第 8 / 9 課
Lesson 07 · 約 10 分鐘
因子的陷阱
因子動物園與資料探勘、過度擬合、因子週期性、擁擠與衰減 — 歷史有效 ≠ 未來有效
因子的陷阱
因子聽起來很美:有學術背書、有歷史數據、可以系統化。但這一課要潑全書最重的冷水 —— 因為這正是系統化 / 量化 / AI 投資最容易翻車的地方。如果你之後要做 AI 選股與回測,這一課的每一個陷阱都可能讓你「回測賺翻、實盤賠光」。核心一句話:歷史有效,不等於未來有效。
一、因子動物園:大部分「因子」是假的
- 學術界已經發表了超過 314 個「因子」在頂尖期刊,加上沒發表的更多 —— 這叫**「因子動物園(factor zoo)」**。
- 問題:這麼多因子,大部分是「資料探勘」挖出來的假貨。 在夠大的資料裡瞎找,你一定能找到「歷史上看起來有效」的模式 —— 但那多半是巧合,不是真規律。
- 真正經得起考驗、有堅實邏輯的因子,其實只有少數幾個(第 06 課那五個是相對可靠的)。看到一個沒聽過的神奇因子,預設懷疑。
★ 二、資料探勘與過度擬合(p-hacking)
這是最致命的一個,一定要刻在心裡:
在海量資料裡不斷嘗試,你總能找到一組「在歷史上完美」的規則 —— 但它只是把雜訊當成訊號,一到未來就失效。 這叫過度擬合(overfitting)、或 p-hacking。
- 你試 100 種因子組合、100 種參數,總有幾種「剛好」在歷史數據上超賺 —— 這不是你找到了真理,是你把答案抄在了已知的考卷上。
- 這跟《技術分析入門》07 的「參數最佳化幻覺」、《股市共通知識》的「回測幻覺」是同一個坑,而且在因子 / 量化 / AI 裡更危險,因為工具讓你能試的組合是天文數字。
- 研究直白地說:過度擬合挖出來的假因子,在回測裡顯著,在實盤裡快速衰減。
三、因子週期性:好因子也會長期不表現
- 就算是真的因子,它也不會一直有效。因子有週期性,會經歷長達數年的低潮。
- 經典例子:價值因子在 2010 年代後期嚴重落後(便宜股一直跑輸成長股,很多價值投資人熬不住而放棄),然後在 2021 年強勢反彈。
- 意義:沒有因子 always work。 用因子投資,你必須熬得過它的低潮期 —— 而多數人正好在因子最慘、最該堅持時放棄(又是行為偏誤)。
四、擁擠與衰減:被太多人跟,就失靈
- 擁擠(crowding):當一個因子被廣泛發現、太多人用同樣的策略,它的報酬會被稀釋、波動增加,甚至在市場壓力時突然反轉(大家同時擠向出口)。
- 因子衰減(alpha decay):因子一旦被發現、被套利,超額報酬會逐漸衰減、甚至消失(呼應第 01 課:一月效應被發現後就消失了)。這不是暫時的波動,是策略的結構性失效。
- 紙上報酬 ≠ 可執行報酬:回測算出來的漂亮報酬,沒有扣掉交易成本、買賣的價格衝擊、稅、流動性限制。真的去執行時,這些成本會把「紙上的超額報酬」吃掉一大塊,有時吃光。
★ 怎麼降低翻車機率(做 AI / 系統化必守)
這幾條是把因子 / 回測用得誠實的護欄:
- 要有經濟邏輯:只信「有合理理由(風險或行為)、能講出為什麼有效」的因子。純靠資料挖出來、講不出道理的,不要信。
- 樣本外測試:在一段資料上找規則,一定要拿另一段沒用過的資料 / 未來的時間去驗證。只在「找規則的那段資料」上有效,等於沒驗證。
- 簡單優於複雜:參數越少、規則越簡單,過度擬合的機會越小。堆越多條件的策略,越可能是騙自己。
- 把成本算進去:回測一定要扣交易成本、滑價、稅 —— 看「可執行報酬」,不是「紙上報酬」。
- 預期它會失效:別假設歷史報酬會重現;給因子低潮的心理與資金準備。
一句話帶走
因子最危險的地方在「系統化」的假象:因子動物園有 314+ 個、大部分是資料探勘的假貨;過度擬合 / p-hacking 讓你在歷史上找到「完美」規則、實盤卻失效(同回測幻覺、且在 AI 裡更危險);真因子也有多年低潮(價值 2010末→2021);還會因擁擠而衰減,而紙上報酬扣掉成本後常所剩無幾。護欄:要有經濟邏輯、樣本外測試、簡單優於複雜、算進成本、預期它會失效。歷史有效 ≠ 未來有效。
最後一課(08):把行為金融與因子,收在「系統化 / AI 投資」的意義上 ——它們既是 AI 選股的骨架,也是最該防的坑。並為整個股市系列作總結。