散户放弃因子研究,这个选择对吗?
结论:方向对,但「放弃因子」这个说法不准确
准确的说法是 —— 你不做因子的生产者,但你必须做因子的消费者。
评估对象:3 个月 A 股经验 + 目标为「程序化执行 / 扩大选股面 / 去情绪」的个人散户 | 评估日期:2026-09-26
📌 本版新增两块:「因子到底是什么 / 能干什么」科普篇(第 2–5 节) + 「散户具体怎么学、怎么用」实操篇(第 10–11 节)
🎯 一、判据:你的目标函数和因子研究根本不是一回事
这是整件事的地基。目标一错配,后面所有努力都白费。
✅ 你选的路:流程目标
- 要什么:扩大选股数量、把情绪从决策链里删掉、让执行不依赖意志力
- 成功标准:我按规则执行了 100 次,没有一次例外
- 需要的本事:工程能力(把想法写成代码)+ 纪律 + 风控
- 因子在这里的角色:只是筛子的网眼尺寸,不是收益来源
🔬 因子研究:超额收益目标
- 要什么:在指数之上稳定赚出 alpha
- 成功标准:IC > 0.03、IR > 0.5,样本外超额可观且稳定
- 需要的本事:统计学 + 数据工程 + 算力 + 至少 3–5 年完整周期的验证
- 散户的现实:数据要买、算力要租,好东西早被人挖完了
💡 核心判断:你放弃的是「alpha 生产」,不是「因子认知」。这两件事被大多数人混为一谈 —— 混了,就会做出错误的取舍。
你要「扩大选股数量」这个诉求,本身就必须靠因子条件来实现(否则你拿什么筛 5000 只票?)。
所以你从来就没打算不用因子,你只是不打算研发因子。
🧩 二、因子到底是什么:先把它从「玄学」里捞出来
不先搞懂这个,前面「该不该学」的判断你只能靠感觉接受。这一节不写一个公式。
因子 = 一个能把全市场股票「排成一队」的可量化特征
就这么朴素。它不是数学模型、不是神经网络、不是机构黑科技。它本质上就是一个分数 —— 给每只股票打一个分,然后从高到低排队。
真正难的是「打什么分、怎么打才准」,而不是「因子」这两个字本身。
📏 条件一 · 可量化
- 必须是数值,不能是「感觉不错」
- ✅ 市盈率 12.3、20 日涨幅 8.5%、ROE 15.2%、月换手率 46%
- ❌ 「这只票形态好看」「听说要涨」「量能配合得不错」
🗂️ 条件二 · 覆盖全市场
- 每只票都得有一个值,否则没法排序
- 你只比 3 只票的 PE 高低 → 那叫「比较」
- 你给 5000 只票都算出 PE 再排序 → 这才叫因子
- 所以「因子」天生是全市场概念
⚖️ 条件三 · 同一截面上可比
- 银行的 PE 天生 5 倍、科技的 PE 天生 60 倍,混在一起排是错的
- 所以专业做法要做标准化 + 行业中性化
- 这一步就是「业余」和「专业」的分水岭(第 5 节细讲)
⚠️ 最容易混:因子 ≠ 技术指标
- MACD 本身是指标。用法是「盯着这一只票,看它金叉还是死叉」
- 但如果我把全市场 5000 只票的 MACD 值都算出来横着排序,它就变成了因子
- 指标是盯着看一只,因子是横着比全部。这一对混掉,后面全乱
⚠️ 第二容易混:因子 ≠ 策略
- 因子是原料,策略是配方
- 同一个「低估值因子」,可以做成月调仓的、季度调仓的、选 10 只的、选 50 只的 —— 这些是不同的策略
- 所以听到「我有个好因子」别激动:因子好 ≠ 策略好
🚫 最坑的一对:因子 ≠ 预测方向
- 因子只回答「哪些票在某一个维度上更突出」
- 它不回答「明天大盘涨不涨」。那是择时,跟因子是两件事
- 很多人把这两件事混了,用错地方,然后得出结论「因子没用」
- 记住:因子管「买什么」,择时管「买不买」
📐 那 IC 又是什么?一句话讲清
IC = 「因子排名」和「未来收益排名」的相关度。
打个比方,IC 就是在问一句大白话:「这次数学考得好的学生,下次考试是不是真的也考得好?」
| IC 数值 | 含义 | 你该有的反应 |
| IC > 0.03 | 有基本预测力 | 可以用,但别指望它单独赚钱 |
| IC > 0.05 | 强预测力 | 值得关注,先查样本外 |
| IC > 0.10 | 异常高 | 别高兴,先检查有没有未来函数 |
| IR > 0.5 | 稳定性达标 | IC 均值 ÷ IC 标准差,衡量的是「稳不稳」而不是「强不强」 |
⚠️ 0.03 听起来低得离谱,但这就是金融数据的常态。
金融数据的信噪比极低 —— 信号只有 0.03 的强度,噪声却有 0.997。也正因为信号这么弱,「过拟合」才会成为默认结果而不是意外:
任何一点方法论瑕疵,都会让你把噪声错当成信号。这就是业余选手在因子挖掘上天然劣势的物理原因,跟聪明不聪明无关。
🛠️ 三、因子的四大功能:它到底能给你什么(以及不能给你什么)
因子有四个用途,但只有第一个是你现在需要的。搞清顺序,才不会把力气花错地方。
🔍 ① 筛选 · Selection 现在就需要
- 把 5000 只票缩到 50 只 —— 这正是你「扩大选股数量」这个诉求的实现方式
- 你不可能人工看 5000 只票。因子就是那把尺子,把「值得看的 50 只」自动推到你面前
- 👉 这是你唯一现在就必须掌握的功能,也就是第 11 节的「应用层」
📊 ② 归因 · Attribution 第 6–12 个月需要
- 把你的收益拆开:多少来自大盘涨(beta)、多少来自某个风格(风格收益)、多少来自你自己选的(alpha)
- 没有这一层,你永远分不清自己是靠本事还是靠运气
- 入门做法:把组合日收益,分别和指数、和某个风格组合算相关系数
- 👉 这是你 3 个月手动交易经验唯一能变现成认知的地方
🛡️ ③ 风控 · Risk 迟早需要
- 知道自己暴露在哪,才知道什么行情会杀你
- 例:你现在重仓小市值。别以为你在「选股」,你其实是在裸奔一个小市值暴露 —— 而 2026 年正是它最危险的时候
- 👉 这一条直接对应第 8 节的「三重挤压」
🔧 ④ 组合构建 · Construction 你现在不用
- 多因子合成打分、正交化、权重分配、行业中性约束、组合优化器
- 这是机构的主战场,也是 71 家百亿私募挤得最惨的地方
- 学习成本极高,而对几万到几十万资金来说边际收益接近 0
- 👉 你会用到它的那一天,意味着你已经不满足于 5% 的年化了
🚫 因子做不到的三件事(同样重要)
- 不预测市场整体方向。那是择时,是另一套完全不同的方法论。因子解决的是「买什么」,不是「买不买」。
- 不替代风控纪律。管住暴露 ≠ 会止损。因子告诉你风险在哪,但按下卖出键的还得是你写进代码的规则。
- 不解决执行成本。滑点、冲击成本、成交率,这些是执行层问题。一个好因子配一个糟糕的执行,照样亏钱。
一句话:因子只告诉你「哪些股票更像是一类」,不告诉你「明天会不会涨」。
🗺️ 四、因子分类地图:先分清「买风险」还是「抢错误」
这一节有个分水岭式的概念 —— 理解了它,你这整页的问题就自动有答案了。
🗂️ 按数据来源,因子分四族
| 家族 | 包含什么 | 数据成本 | 拥挤度 | 散户判断 |
| 📈 价量因子 |
动量、反转、波动率、换手率、流动性、量价背离 |
免费(日线) |
极高 |
用,但这是你最没优势的一块 —— 所有人都在用同一批日线数据算同样的东西 |
| 📊 基本面因子 |
估值(PE/PB/PS/股息率)、质量(ROE/现金流/毛利率)、成长(营收/净利增速)、规模(市值) |
免费(财报) |
高 |
首选战场。数据免费、逻辑好懂、更适合长周期低频,和你的执行力匹配 |
| 📣 情绪 / 预期因子 |
分析师评级调整、盈利预测修正、资金流、龙虎榜、融资余额、股东户数变化 |
部分免费 |
中 |
有信息优势的话能做。个人投资者在「小票 + 冷门信息」上,反而比大机构灵活 |
| 📡 另类数据因子 |
卫星图像、电商销量、招聘数据、舆情 NLP、APP 活跃度 |
天价 |
低 |
直接放弃。光数据授权费就是天文数字,这是百亿机构的护城河 |
说明:上表「数据成本 / 拥挤度」为基于公开信息的定性判断,非量化统计,仅用于帮你分配精力。
⚖️ 按作用分两类 —— 这条分水岭,就是你这整页问题的答案
🔵 风格因子(Style Factor)
- 所有人都知道、都能算
- 长期有溢价,但会周期性失效
- 典型:市值、价值、动量、质量、波动率
- 它代表「你承担了某种风险」
💎 alpha 因子(Alpha Factor)
- 你自己挖出来的,别人还不知道
- 一旦被广泛使用,就会迅速衰减
- 典型:各家机构自研的、不公开的因子
- 它代表「你发现了某个定价错误」
行业铁律:买风格因子,是买风险溢价;挖 alpha 因子,是抢定价错误。
散户能做前者,做不了后者。
套回你的问题 —— 你要「消费」的是风格因子(拿它当筛子、当体检仪),你要「放弃」的是生产 alpha 因子(跟机构拼挖掘)。
所以「放弃因子研究」这个说法真正该被改写成:放弃 alpha 生产,保留风格消费。
🎯 数据成本 × 收益空间:你该站哪个格子
🎯 低成本数据 · 大空间收益
- 情绪 / 预期因子的小票角落
- 可转债定价偏差、小市值套利
- 机构因容量限制进不来的地方
👉 你的机会区。需要的不是钱,是你愿意看冷门标的
🏢 高成本数据 · 大空间收益
- 另类数据因子、高频价量因子
- 需要专用通道、算力、数据采买
- 百亿机构的主战场
✗ 别去。你的弹药打不到这里
✅ 低成本数据 · 小空间收益
- 基本面因子、经典风格因子
- 人人都能算,超额被摊薄得很薄
- 但逻辑清楚、容易验证、不容易翻车
✓ 你的主战场。当筛子用,不当印钞机用
⚠️ 高成本数据 · 小空间收益
- 另类数据的滞后项、已失效的高频因子
- 花了大钱、抢不到肉
✗ 最亏的格子。有人会想卖给你
上表为基于公开信息的定性框架,用于辅助决策,非量化结论。
⚙️ 五、因子是怎么工作的:三步流水线,以及你该在哪一步停下
这是全页最实用的一节 —— 你会发现自己其实早就在用因子了,只是没给它起名字。
✅ STEP 1
取原始值
- 给每只票算出一个数:贵州茅台 PE = 22.1、某票 PE = 3.2、某票 PE = 480
- 动量因子就取「过去 20 日涨幅」,换手率因子就取「月换手率」
你已经会了 —— 就是拉数据 + 算一列数
⚠️ STEP 2
预处理:去极值 → 标准化 → 中性化
- 去极值:把超过 ±3 倍标准差的值截断,或掐掉头尾各 5%
- 标准化:
(x − 均值) ÷ 标准差,让不同因子可比
- 中性化:至少做到「行业内单独排名再合并」
业余与专业的分水岭 —— 你迟早会撞上它
🚫 STEP 3
排序 → 分组 → 建组合
- 前半段(你在做):按因子值排序,取前 30 只,等权买入,定期调仓
- 后半段(不用碰):多因子合成打分、正交化、权重分配、组合优化器、行业约束
前半段是你的战场,后半段是机构的主场 —— 现在就划清
⚠️ 为什么 STEP 2 是分水岭:不做的后果很具体
- 不去极值 → 排序永远被几只异常值股票主导。一只 PE = 3 的票会永远排第一,而它可能马上要退市。
- 不做行业中性化 → 你那个「低估值因子」,其实是在偷偷买一堆银行和地产。
- 这就是常见的自欺:很多人自己做出来的「低估值选股策略」回测好得离谱 —— 因为他实际上做的是一个银行股策略,而银行股恰好在某些年份很强。他以为找到了 alpha,其实只是押中了一个风格。
💡 好消息:你现在其实已经在用因子了
双均线策略
= 动量因子的 STEP 3(排序取多头的那些)
ETF 网格
= 波动率因子的应用(挑波动稳定的标的)
可转债双低轮动
= 价格因子 + 估值因子(溢价率)的组合
所以你从来不是「不用因子」,你只是没给它起名字。
这个认知很重要 —— 它意味着你要补的不是「一套新知识」,而是给已经在做的事装上仪表盘。
🧰 散户版的「预处理三件套」(三行 pandas,不用学统计学)
| 步骤 | 做法 | 一句话理由 |
| 去极值 | 按百分位掐掉头尾各 5%(最省心,不用算标准差) | 防止一只退市边缘的票霸占榜首 |
| 标准化 | 截面 Z-score:(x − 均值) ÷ 标准差 | 让「涨幅 8%」和「PE 22 倍」能放一起比 |
| 中性化 | 先按行业分组,组内单独排名,再把名次合并 | 别让你的策略偷偷变成「银行股策略」 |
做到这三步,你的因子处理就已经超过 90% 的散户了。剩下的复杂方法(回归取残差中性化、正交化、Barra 风险模型)现在完全不需要。
📉 六、2026 现状:因子这条赛道,肉已经被吃完了
这不是「难不难」的问题,是「值不值得」的问题。以下是今年 A 股量化因子战场的真实水位。
📉 指增产品平均超额(2026H1)
3.11 pct
去年同期 14.17 pct,同比下降近八成
📉 指增超额均值(2026 年 1–4 月)
4.06 %
去年同期 9% 以上,腰斩
🏆 百亿量化私募数量
71 家
2020 年初仅 4 家,四年增长约 17 倍
💰 量化股票基金规模
3 万亿+
私募+公募口径,浙商证券测算
来源:私募排排网数据(经央视网财经 2026-07-11 报道)、中国证券报 / 21 世纪经济报道(2026-06-08)、中信证券与浙商证券测算。均为非一手来源,需核实原文。
📊 上半年指增产品平均超额收益对比
统计口径:私募指数增强产品平均超额收益(相对基准),单位 pct
来源:私募排排网,经央视网财经(2026-07-11)报道;2026H1 统计截至 2026-06-30。
📊 七、细分数据:不同类型的指增,过得差很多
| 产品类型 | 平均超额 | 统计区间 | 说明 |
| 全部指数增强产品 | 16.25% 收益率 / 3.11pct 超额 | 2026 上半年 | 1236 只有业绩展示的产品;收益率与去年同期 17.32% 基本持平,但超额掉了八成 |
| 沪深300 指增 | 7.28pct | 2026 上半年 | 正超额产品占比超 80%,今年表现最佳的一类 |
| 中证A500 指增 | 6.40pct | 2026 上半年 | 正超额产品占比超 80% |
| 量化选股(空气指增) | 2.58pct | 2026 上半年 | 549 只产品;业绩极度分化,超额被踩中 / 没踩中 AI 主线决定 |
| 中证1000 指增 | 3.24% | 2026 年 1–4 月 | 口径不同于上半年数据,不可直接横向比较 |
| 中证500 指增 | 1.93% | 2026 年 1–4 月 | 同上;部分管理人自 2025-10 以来几乎没创造任何超额 |
来源:私募排排网、央视网财经(2026-07-11)、中国证券报 / 21 世纪经济报道(2026-06-08)。注意统计区间不一致,勿跨区间直接对比。以上为非一手来源,需核实原文。
🧱 八、为什么肉没了:三重挤压
🧲 ① 同质化拥挤
- 大量资金集中在反转、高低波、小市值等相似因子和相似换手区间
- 机构共用相似的价量因子与流水线框架
- 行业人士原话:「传统量化流水线产出的因子同质化问题突出」
- 后果:好因子一被广泛使用就迅速衰减
- 结果:超额被海量资金摊薄
🔍 ② 市场结构变窄
- 2026 上半年 A 股呈 「K 型」分化,前 5% 热门科技股占成交量 40–50%
- 一季度前 10% 成交额股票占比升到 60%
- 指数被少数权重股拉高,广泛分散持股的策略反而跑不赢指数
- 行业与风格轮动从月级别压缩到周甚至日级别
- 结果:量化赖以「广谱分散选股」的宽度消失
⚖️ ③ 经典因子集体反噬
- 动量因子强,但反转、均值回归、小市值因子持续反向
- 中证2000 相对沪深300 估值比价回到 2024 年初水平,小盘溢价空间正在收敛
- 低估值低波因子弱势,红利指增有正 alpha 但 beta 端亏得补不回来
- 结果:策略业绩变成「赌风格」
⚠️ 由此推出的结论:
一群有几十上百个研究员、买最贵的另类数据、有专用算力集群的百亿机构,2026 年上半年合力挖出来的平均超额只剩 3.11 个百分点,同比掉了八成。
行业内部判断,未来平均超额中枢大概率收敛到 5% 左右甚至更低。
在这个背景下,一个每天投入 1–2 小时的散户,用公开日线数据去挖新因子 —— 这不是努力,这是往最卷的战场里送人头。
⚖️ 九、反方声音:但你的理由可能是错的
同一个决定,两种理由,只有一种站得住。这一段请认真看。
❌
错误理由:「因子太学术、太难,我不碰」
危险。如果你不懂因子,你就永远不知道自己的收益到底来自哪里。你以为你在跑「趋势跟踪」,实际上你可能是在裸奔小市值暴露或高波动暴露,只是恰好在 2024–2025 年这个风格里赚了钱。等风格切换,你连自己怎么亏的都说不清,只会得出「策略失效了」这个无效结论。
2026 年就是活教材:反转策略的管理人不是模型坏了,是他们不知道自己站在反转因子上,而市场切到了动量。
✅
正确理由:「我不做 alpha 生产,因为目标不是超额收益,且我没有数据、算力和团队」
站得住。承认自己在因子生产上没有比较优势,是一种清醒,不是怯懦。你的比较优势在别的地方 —— 资金小、进出灵活、没有排名和赎回压力、可以人机结合随时按暂停键。这些恰恰是机构复制不了的。
🧰 十、散户的因子工具箱:只留这 7 个概念
每个 30 分钟就能懂,不写代码、不算 IC。第 7 个最重要,别跳过去。
🚀 ① 动量 / 反转Momentum / Reversal
过去涨得好的继续涨(动量),还是跌多了会反弹(反转)。
2026 现状:动量强,反转持续反向。
怎么用:你的双均线策略本质就是动量策略,必须知道它在震荡市会怎么死。
📏 ② 小市值Size
小盘股长期跑赢大盘股的那部分收益。
2026 现状:小盘溢价正在收敛,中证2000/沪深300 估值比价回到 2024 年初。
怎么用:最容易自欺的因子。很多人以为自己「选股厉害」,其实只是在裸奔小市值。
📉 ③ 低波动Low Volatility
低波动股的风险调整后收益反而更好。
2026 现状:低波因子弱势。
怎么用:行情极端时,它会告诉你「高波动股票突然集体强」是危险信号。
💰 ④ 估值 / 价值Value
便宜的(低 PE/PB、高股息)长期跑赢贵的。
2026 现状:低估值低波弱势,红利指增有正 alpha 但 beta 端亏损补不回来。
怎么用:给你的策略加一道「贵不贵」的闸门,尤其在成长风格末期。
🏆 ⑤ 质量Quality
高 ROE、现金流健康的公司长期表现更好。
2026 现状:主线在成长/动量,质量因子不是今年的明星。
怎么用:作为排雷器而不是收益源 —— 过滤掉基本面烂的票。
⚡ ⑥ 流动性 / 换手Liquidity
换手率高低、成交是否活跃,本身就是一种定价偏差来源。
2026 现状:成交高度集中在前 5–10% 的股票,流动性分层加剧。
怎么用:直接决定你的策略容量上限。你的网格和轮动能不能做,先看这个。
⚠️ ⑦ 因子暴露 vs 因子择时 最重要
「暴露」= 我的持仓天然偏向哪一类股票;「择时」= 我主动判断哪个因子接下来会强。这两件事完全不同。
2026 现实:绝大多数人的收益是被动暴露决定的,不是主动择时能力 —— 但几乎所有散户都误以为是后者。
怎么用:这是你唯一必须掌握到「能回答问题」程度的因子概念 —— 我的策略赚钱,是因为我聪明,还是因为我恰好站在了某个因子上?
📎 这些因子的数据从哪来?在 QMT / PTrade 里怎么落地
你需要的全部数据都是免费的。要花钱的是另类数据 —— 而那个你已经决定不碰了。
| 需要什么数据 | 免费来源 | 在量化终端里怎么拿 |
| 全市场日线(开高低收量) | AkShare / Baostock / Tushare | QMT:先 download_history_data() 下载,再 xtdata.get_market_data_ex() 读;PTrade:get_history() |
| 估值(PE / PB / 股息率) | AkShare 财务接口 / Tushare | QMT 内置财务数据接口;另有现成的「多因子数据接口」可直接取因子表 |
| 质量(ROE / 现金流 / 毛利率) | AkShare / Tushare | 同上,QMT 财务数据字段对照表里有现成字段名 |
| 成长(营收 / 净利增速) | AkShare / Tushare | 同上 |
| 换手率 / 流通市值 | AkShare / Tushare | QMT 因子库直接取;或自行用成交量 ÷ 流通股本算 |
| 行业分类(申万 / 证监会) | AkShare 申万行业接口 | QMT 行业数据接口 + 文档附录里的 CSRC 行业列表 |
| 指数成分股(沪深300 / 中证2000 等) | AkShare 指数成分接口 | QMT 维护指数数据 / 下载指数成分 |
| 资金流 / 龙虎榜 / 融资余额 | AkShare(覆盖较全且免费) | 一般不必走量化终端,本地算完再喂给策略即可 |
免费数据工具三件套:AkShare(覆盖面最广、纯免费,首选)· Tushare(数据质量高,积分制,跑顺之后再升级)· Baostock(老牌稳定,接口简单)。
算法上唯一一条绝对不能破的铁律:
因子值只能用 T 日及之前 的数据算,收益只能用 T+1 起 的未来数据算。
这两者只要有一点点重叠,就是未来函数 —— 回测会漂亮得不像话,实盘会死得很难看。
🪜 十一、散户学因子、用因子的三个层次(这才是「怎么用」)
三层里只有前两层要做。第三层是机构的活,你做了也白做 —— 但要知道自己放弃了什么。
必须做
🎓 层次一 · 认知层:给已经在做的事装上仪表盘
约 10 小时 · 第 6–12 个月
- 把第 10 节那 7 个概念各花 30 分钟搞懂。不写一行代码。
- 每个月看一眼持仓:集中在哪个行业、哪个市值段、平均换手率多少。这一步打开行情软件就能做,不需要编程。
- 练一句话:「我这个月赚(亏)的 X%,主要来自 ____ 因子。」—— 说不出来,说明仪表盘还没装上。
- 把 2025–2026 这轮行情当现成教材:反转策略的管理人为什么集体回撤?因为模型没坏,是他们不知道自己站在反转因子上,而市场切到了动量。你要避免的就是这件事。
- 这一层的产出不是新策略,是一次对自己策略的重新认识。
必须做
🧰 层次二 · 应用层:把因子当筛子用(唯一要动手的一层)
约 10 小时 + 1 次完整实操 · 第 12 个月后
- 先只上 2 个因子。建议
20 日动量 + 换手率 —— 都免费、都算得快、逻辑都一句话能说清。别一上来搞 10 个。
- 拉数据,落成一张宽表。用 AkShare 拉全市场 3 年日线,整理成「日期 × 股票 × 因子值」的结构。
- 做预处理三件套。去极值(掐头尾 5%)→ Z-score 标准化 → 行业内排名。三行 pandas 的事。
- 排序取前 30 只,等权买入,每月调一次仓。这就是你人生第一个因子策略。复杂度到此为止,不要再加。
- 回测 3 年,只看两个数:最大回撤 + 夏普比率。别被年化吸引 —— 年化是三个指标里最容易骗人的那个。
- 做一次最粗糙的归因(这步最重要):把你的组合日收益,分别和「中证2000 指数」、和「一篮子高换手股票」算相关系数。如果相关性 > 0.8,说明你辛苦半天只是复制了一个小市值 / 高换手暴露 —— 这时候你才第一次真正「看懂」自己的策略。
- 加第 3 个因子,重跑,看夏普有没有提升。没有提升就删掉它,不要因为「它理论上有效」而留着 —— 理论上有效的因子有几百个,能加分的没几个。
不用做
🚫 层次三 · 复现层:IC/IR 流水线、正交化、组合优化、机器学习挖因子
建议直接放弃 · 除非命中第 12 节的触发信号
- 算 IC / IR 去批量筛选几十个因子 → 这是机构的工业化流水线,同一个战场上你没有任何胜算
- 因子正交化、Barra 风险模型、组合优化器 → 你只有几万到几十万资金,这些方法的边际收益接近 0,而学习成本极高
- 机器学习生成因子(AlphaGen、遗传规划) → 数据量、算力、验证成本三项全都不够
- 另类数据 → 光数据授权费就劝退
- 「因子动物园」式海量试错 → 试 100 个组合挑最好看的那个,那叫 p-hacking,你找到的只是噪声,而且你会对它深信不疑
📋 散户用因子的 5 条纪律
- 因子数量 ≤ 5,最好 3 个。宁要 3 个强的,不要 30 个弱的
- 每个因子必须能用一句人话说清「它为什么会有效」。说不清,就说明你只是在拟合噪声
- 一定做行业中性化。否则你的「低估值因子」其实是在买银行股
- 一定看它近 2 年的表现。用 2015 年的有效性判断今天,是刻舟求剑
- 一次只加一个因子,加完必须重做样本外验证。同时加三个,你永远不知道是哪个起了作用
❌ 散户明确别做的 5 件事
- ❌ 自己算 IC / IR 去筛几十个因子
- ❌ 做因子正交化、上组合优化器
- ❌ 碰另类数据(卫星、舆情、电商销量)
- ❌ 用机器学习生成因子
- ❌ 相信「因子动物园」—— 把参数试遍挑最好看的那个
这五件事不是「难」,是「不值得」。共同点是:需要机构级的数据、算力和团队,才能做出边际收益。
🚨 十二、什么时候该回头补因子?(4 个触发信号)
不要提前学,也不要永远不学。命中任意一条,就该补课了。
1
策略连续跑输基准超过 2 个月,而你不知道原因。这时候你需要因子视角来判断:是策略逻辑坏了,还是市场风格切了。这两者的应对方式完全相反。
2
你想知道自己的收益来源构成。也就是做归因 —— 今年赚的 20%,多少来自 beta、多少来自动量、多少来自小市值。不做归因,你永远无法迭代。
3
你要同时跑 3 个以上策略,需要判断它们是不是在同一因子上重复暴露。两个看起来不相关的策略,可能都在赌同一个东西 —— 那你的「分散」是假的。
4
你开始想做指数增强(对标某个宽基指数)。到这一步,因子就从选修变成必修课了 —— 因为指增的全部意义就是稳定赚 alpha。
以上 4 条都没命中 → 你现在的路线完全正确,不必焦虑,也不用「适当涉猎」来求心安。
🗓️ 十三、18 个月时间轴:什么时候学什么
🚀 第 0–6 个月
纯执行层,完全不碰因子。把编程、QMT / miniQMT、模拟盘、小资金实盘这条路走通。目标是「能稳定跑起来」,不是「跑得好」。
🎓 第 6–12 个月
补因子常识。上面 7 个概念,每周 1 小时,只读方法论不写代码。同时用 QMT 的策略回测,做一次最粗糙的暴露归因 —— 看看你的策略收益跟小市值、跟动量方向的相关性有多高。这一步的产出不是新策略,是一次对自己策略的重新认识。
🏁 第 12–18 个月
按信号决定是否进入因子实践。命中第十二节的任意一条 → 开始学 IC / IR 与分层回测,用现成工具(不要从零写);一条都没命中 → 继续把执行层做扎实,把精力放在策略多样性和风控上,收益远高于硬啃因子。
🏁 十四、一句话总结
你的选择是对的,但请把它精确成这句话:
不做因子的「生产者」,但要做因子的「消费者」。
—— 换成本页第四节的行业说法:消费「风格因子」,放弃生产「alpha 因子」
生产者要跟 71 家百亿机构抢那 3.11 个百分点的超额,你没有那个弹药;消费者只需要花几十个小时搞懂 7 个概念,就能在那 3.11 个百分点被人吃干抹净之前,先看清自己站在哪儿。
至于「适当涉猎一点因子」—— 方向没错,但顺序错了。现在涉猎,你没有策略可以归因,学的东西会变成一堆漂浮的概念。等你手上有了一两个跑了半年、有真实净值曲线的策略,那时候再学因子,每一个概念都会立刻挂到具体的数字上,效率是现在的 5 倍以上。
🚀 接下来 6 个月 · 只做一件
- 把执行层走通:编程 → QMT / miniQMT → 模拟盘 → 小资金实盘
- 这一层不需要任何金融知识,只需要把工具跑通
- 因子一个字都不用学,真的不用
🎓 第 6–12 个月 · 只做两件
- 搞懂第 10 节那 7 个概念(约 10 小时,不写代码)
- 每月看一眼持仓的行业 / 市值 / 换手分布,练熟那句话:「我的收益来自哪个因子」
- 产出的不是新策略,是一份策略体检报告
🚫 永远不做
- IC / IR 流水线、正交化、组合优化、ML 挖因子、另类数据
- 它们都需要机构级的数据、算力和团队,对你的边际收益接近 0
- 不是「难」,是「不值得」
⚠️ 免责声明:以上内容基于公开数据和量化分析,仅供参考,不构成投资建议。市场有风险,投资需谨慎。任何投资决策应结合个人风险承受能力、资金状况和投资目标独立判断,必要时咨询持牌专业机构。过往表现不预示未来收益。
数据来源与时效说明:文中量化私募超额收益、规模、数量等数据来自私募排排网、央视网财经(2026-07-11)、中国证券报 / 21 世纪经济报道(2026-06-08)、中国金融信息网(2026-06-11)、华夏时报(2026)、上海证券报(cnstock.com)等公开报道,均为非一手来源,统计区间不一致,不可跨区间直接对比,引用前需核实原文。市场结构描述基于上述报道,为定性结论。