散户放弃因子研究,这个选择对吗?

结论:方向对,但「放弃因子」这个说法不准确

准确的说法是 —— 你不做因子的生产者,但你必须做因子的消费者。

评估对象:3 个月 A 股经验 + 目标为「程序化执行 / 扩大选股面 / 去情绪」的个人散户  |  评估日期:2026-09-26
📌 本版新增两块:「因子到底是什么 / 能干什么」科普篇(第 2–5 节) + 「散户具体怎么学、怎么用」实操篇(第 10–11 节)

🎯 一、判据:你的目标函数和因子研究根本不是一回事

这是整件事的地基。目标一错配,后面所有努力都白费。

✅ 你选的路:流程目标

  • 要什么:扩大选股数量、把情绪从决策链里删掉、让执行不依赖意志力
  • 成功标准:我按规则执行了 100 次,没有一次例外
  • 需要的本事:工程能力(把想法写成代码)+ 纪律 + 风控
  • 因子在这里的角色:只是筛子的网眼尺寸,不是收益来源

🔬 因子研究:超额收益目标

  • 要什么:在指数之上稳定赚出 alpha
  • 成功标准:IC > 0.03、IR > 0.5,样本外超额可观且稳定
  • 需要的本事:统计学 + 数据工程 + 算力 + 至少 3–5 年完整周期的验证
  • 散户的现实:数据要买、算力要租,好东西早被人挖完了

💡 核心判断:你放弃的是「alpha 生产」,不是「因子认知」。这两件事被大多数人混为一谈 —— 混了,就会做出错误的取舍。 你要「扩大选股数量」这个诉求,本身就必须靠因子条件来实现(否则你拿什么筛 5000 只票?)。 所以你从来就没打算不用因子,你只是不打算研发因子。

🧩 二、因子到底是什么:先把它从「玄学」里捞出来

不先搞懂这个,前面「该不该学」的判断你只能靠感觉接受。这一节不写一个公式。

因子 = 一个能把全市场股票「排成一队」的可量化特征

就这么朴素。它不是数学模型、不是神经网络、不是机构黑科技。它本质上就是一个分数 —— 给每只股票打一个分,然后从高到低排队。 真正难的是「打什么分、怎么打才准」,而不是「因子」这两个字本身。

📏 条件一 · 可量化

  • 必须是数值,不能是「感觉不错」
  • ✅ 市盈率 12.3、20 日涨幅 8.5%、ROE 15.2%、月换手率 46%
  • ❌ 「这只票形态好看」「听说要涨」「量能配合得不错」

🗂️ 条件二 · 覆盖全市场

  • 每只票都得有一个值,否则没法排序
  • 你只比 3 只票的 PE 高低 → 那叫「比较」
  • 你给 5000 只票都算出 PE 再排序 → 这才叫因子
  • 所以「因子」天生是全市场概念

⚖️ 条件三 · 同一截面上可比

  • 银行的 PE 天生 5 倍、科技的 PE 天生 60 倍,混在一起排是错的
  • 所以专业做法要做标准化 + 行业中性化
  • 这一步就是「业余」和「专业」的分水岭(第 5 节细讲)

⚠️ 最容易混:因子 ≠ 技术指标

  • MACD 本身是指标。用法是「盯着这一只票,看它金叉还是死叉」
  • 但如果我把全市场 5000 只票的 MACD 值都算出来横着排序,它就变成了因子
  • 指标是盯着看一只,因子是横着比全部。这一对混掉,后面全乱

⚠️ 第二容易混:因子 ≠ 策略

  • 因子是原料,策略是配方
  • 同一个「低估值因子」,可以做成月调仓的、季度调仓的、选 10 只的、选 50 只的 —— 这些是不同的策略
  • 所以听到「我有个好因子」别激动:因子好 ≠ 策略好

🚫 最坑的一对:因子 ≠ 预测方向

  • 因子只回答「哪些票在某一个维度上更突出」
  • 它不回答「明天大盘涨不涨」。那是择时,跟因子是两件事
  • 很多人把这两件事混了,用错地方,然后得出结论「因子没用」
  • 记住:因子管「买什么」,择时管「买不买」

📐 那 IC 又是什么?一句话讲清

IC = 「因子排名」和「未来收益排名」的相关度。 打个比方,IC 就是在问一句大白话:「这次数学考得好的学生,下次考试是不是真的也考得好?」

IC 数值含义你该有的反应
IC > 0.03有基本预测力可以用,但别指望它单独赚钱
IC > 0.05强预测力值得关注,先查样本外
IC > 0.10异常高别高兴,先检查有没有未来函数
IR > 0.5稳定性达标IC 均值 ÷ IC 标准差,衡量的是「稳不稳」而不是「强不强」

⚠️ 0.03 听起来低得离谱,但这就是金融数据的常态。 金融数据的信噪比极低 —— 信号只有 0.03 的强度,噪声却有 0.997。也正因为信号这么弱,「过拟合」才会成为默认结果而不是意外: 任何一点方法论瑕疵,都会让你把噪声错当成信号。这就是业余选手在因子挖掘上天然劣势的物理原因,跟聪明不聪明无关。

🛠️ 三、因子的四大功能:它到底能给你什么(以及不能给你什么)

因子有四个用途,但只有第一个是你现在需要的。搞清顺序,才不会把力气花错地方。

🔍 ① 筛选 · Selection 现在就需要

  • 把 5000 只票缩到 50 只 —— 这正是你「扩大选股数量」这个诉求的实现方式
  • 你不可能人工看 5000 只票。因子就是那把尺子,把「值得看的 50 只」自动推到你面前
  • 👉 这是你唯一现在就必须掌握的功能,也就是第 11 节的「应用层」

📊 ② 归因 · Attribution 第 6–12 个月需要

  • 把你的收益拆开:多少来自大盘涨(beta)、多少来自某个风格(风格收益)、多少来自你自己选的(alpha)
  • 没有这一层,你永远分不清自己是靠本事还是靠运气
  • 入门做法:把组合日收益,分别和指数、和某个风格组合算相关系数
  • 👉 这是你 3 个月手动交易经验唯一能变现成认知的地方

🛡️ ③ 风控 · Risk 迟早需要

  • 知道自己暴露在哪,才知道什么行情会杀你
  • 例:你现在重仓小市值。别以为你在「选股」,你其实是在裸奔一个小市值暴露 —— 而 2026 年正是它最危险的时候
  • 👉 这一条直接对应第 8 节的「三重挤压」

🔧 ④ 组合构建 · Construction 你现在不用

  • 多因子合成打分、正交化、权重分配、行业中性约束、组合优化器
  • 这是机构的主战场,也是 71 家百亿私募挤得最惨的地方
  • 学习成本极高,而对几万到几十万资金来说边际收益接近 0
  • 👉 你会用到它的那一天,意味着你已经不满足于 5% 的年化了

🚫 因子做不到的三件事(同样重要)

一句话:因子只告诉你「哪些股票更像是一类」,不告诉你「明天会不会涨」。

🗺️ 四、因子分类地图:先分清「买风险」还是「抢错误」

这一节有个分水岭式的概念 —— 理解了它,你这整页的问题就自动有答案了。

🗂️ 按数据来源,因子分四族

家族包含什么数据成本拥挤度散户判断
📈 价量因子 动量、反转、波动率、换手率、流动性、量价背离 免费(日线) 极高 用,但这是你最没优势的一块 —— 所有人都在用同一批日线数据算同样的东西
📊 基本面因子 估值(PE/PB/PS/股息率)、质量(ROE/现金流/毛利率)、成长(营收/净利增速)、规模(市值) 免费(财报) 高 首选战场。数据免费、逻辑好懂、更适合长周期低频,和你的执行力匹配
📣 情绪 / 预期因子 分析师评级调整、盈利预测修正、资金流、龙虎榜、融资余额、股东户数变化 部分免费 中 有信息优势的话能做。个人投资者在「小票 + 冷门信息」上,反而比大机构灵活
📡 另类数据因子 卫星图像、电商销量、招聘数据、舆情 NLP、APP 活跃度 天价 低 直接放弃。光数据授权费就是天文数字,这是百亿机构的护城河

说明:上表「数据成本 / 拥挤度」为基于公开信息的定性判断,非量化统计,仅用于帮你分配精力。

⚖️ 按作用分两类 —— 这条分水岭,就是你这整页问题的答案

🔵 风格因子(Style Factor)

  • 所有人都知道、都能算
  • 长期有溢价,但会周期性失效
  • 典型:市值、价值、动量、质量、波动率
  • 它代表「你承担了某种风险」

💎 alpha 因子(Alpha Factor)

  • 你自己挖出来的,别人还不知道
  • 一旦被广泛使用,就会迅速衰减
  • 典型:各家机构自研的、不公开的因子
  • 它代表「你发现了某个定价错误」

行业铁律:买风格因子,是买风险溢价;挖 alpha 因子,是抢定价错误。 散户能做前者,做不了后者。

套回你的问题 —— 你要「消费」的是风格因子(拿它当筛子、当体检仪),你要「放弃」的是生产 alpha 因子(跟机构拼挖掘)。 所以「放弃因子研究」这个说法真正该被改写成:放弃 alpha 生产,保留风格消费。

🎯 数据成本 × 收益空间:你该站哪个格子

🎯 低成本数据 · 大空间收益
  • 情绪 / 预期因子的小票角落
  • 可转债定价偏差、小市值套利
  • 机构因容量限制进不来的地方
👉 你的机会区。需要的不是钱,是你愿意看冷门标的
🏢 高成本数据 · 大空间收益
  • 另类数据因子、高频价量因子
  • 需要专用通道、算力、数据采买
  • 百亿机构的主战场
✗ 别去。你的弹药打不到这里
✅ 低成本数据 · 小空间收益
  • 基本面因子、经典风格因子
  • 人人都能算,超额被摊薄得很薄
  • 但逻辑清楚、容易验证、不容易翻车
✓ 你的主战场。当筛子用,不当印钞机用
⚠️ 高成本数据 · 小空间收益
  • 另类数据的滞后项、已失效的高频因子
  • 花了大钱、抢不到肉
✗ 最亏的格子。有人会想卖给你

上表为基于公开信息的定性框架,用于辅助决策,非量化结论。

⚙️ 五、因子是怎么工作的:三步流水线,以及你该在哪一步停下

这是全页最实用的一节 —— 你会发现自己其实早就在用因子了,只是没给它起名字。

✅ STEP 1
取原始值
  • 给每只票算出一个数:贵州茅台 PE = 22.1、某票 PE = 3.2、某票 PE = 480
  • 动量因子就取「过去 20 日涨幅」,换手率因子就取「月换手率」
你已经会了 —— 就是拉数据 + 算一列数
⚠️ STEP 2
预处理:去极值 → 标准化 → 中性化
  • 去极值:把超过 ±3 倍标准差的值截断,或掐掉头尾各 5%
  • 标准化:(x − 均值) ÷ 标准差,让不同因子可比
  • 中性化:至少做到「行业内单独排名再合并」
业余与专业的分水岭 —— 你迟早会撞上它
🚫 STEP 3
排序 → 分组 → 建组合
  • 前半段(你在做):按因子值排序,取前 30 只,等权买入,定期调仓
  • 后半段(不用碰):多因子合成打分、正交化、权重分配、组合优化器、行业约束
前半段是你的战场,后半段是机构的主场 —— 现在就划清

⚠️ 为什么 STEP 2 是分水岭:不做的后果很具体

💡 好消息:你现在其实已经在用因子了

双均线策略
= 动量因子的 STEP 3(排序取多头的那些)

ETF 网格
= 波动率因子的应用(挑波动稳定的标的)

可转债双低轮动
= 价格因子 + 估值因子(溢价率)的组合

所以你从来不是「不用因子」,你只是没给它起名字。 这个认知很重要 —— 它意味着你要补的不是「一套新知识」,而是给已经在做的事装上仪表盘。

🧰 散户版的「预处理三件套」(三行 pandas,不用学统计学)

步骤做法一句话理由
去极值按百分位掐掉头尾各 5%(最省心,不用算标准差)防止一只退市边缘的票霸占榜首
标准化截面 Z-score:(x − 均值) ÷ 标准差让「涨幅 8%」和「PE 22 倍」能放一起比
中性化先按行业分组,组内单独排名,再把名次合并别让你的策略偷偷变成「银行股策略」

做到这三步,你的因子处理就已经超过 90% 的散户了。剩下的复杂方法(回归取残差中性化、正交化、Barra 风险模型)现在完全不需要。

📉 六、2026 现状:因子这条赛道,肉已经被吃完了

这不是「难不难」的问题,是「值不值得」的问题。以下是今年 A 股量化因子战场的真实水位。

📉 指增产品平均超额(2026H1)

3.11 pct
去年同期 14.17 pct,同比下降近八成

📉 指增超额均值(2026 年 1–4 月)

4.06 %
去年同期 9% 以上,腰斩

🏆 百亿量化私募数量

71 家
2020 年初仅 4 家,四年增长约 17 倍

💰 量化股票基金规模

3 万亿+
私募+公募口径,浙商证券测算

来源:私募排排网数据(经央视网财经 2026-07-11 报道)、中国证券报 / 21 世纪经济报道(2026-06-08)、中信证券与浙商证券测算。均为非一手来源,需核实原文。

📊 上半年指增产品平均超额收益对比

统计口径:私募指数增强产品平均超额收益(相对基准),单位 pct
来源:私募排排网,经央视网财经(2026-07-11)报道;2026H1 统计截至 2026-06-30。

📊 七、细分数据:不同类型的指增,过得差很多

产品类型平均超额统计区间说明
全部指数增强产品16.25% 收益率 / 3.11pct 超额2026 上半年1236 只有业绩展示的产品;收益率与去年同期 17.32% 基本持平,但超额掉了八成
沪深300 指增7.28pct2026 上半年正超额产品占比超 80%,今年表现最佳的一类
中证A500 指增6.40pct2026 上半年正超额产品占比超 80%
量化选股(空气指增)2.58pct2026 上半年549 只产品;业绩极度分化,超额被踩中 / 没踩中 AI 主线决定
中证1000 指增3.24%2026 年 1–4 月口径不同于上半年数据,不可直接横向比较
中证500 指增1.93%2026 年 1–4 月同上;部分管理人自 2025-10 以来几乎没创造任何超额

来源:私募排排网、央视网财经(2026-07-11)、中国证券报 / 21 世纪经济报道(2026-06-08)。注意统计区间不一致,勿跨区间直接对比。以上为非一手来源,需核实原文。

🧱 八、为什么肉没了:三重挤压

🧲 ① 同质化拥挤

  • 大量资金集中在反转、高低波、小市值等相似因子和相似换手区间
  • 机构共用相似的价量因子与流水线框架
  • 行业人士原话:「传统量化流水线产出的因子同质化问题突出」
  • 后果:好因子一被广泛使用就迅速衰减
  • 结果:超额被海量资金摊薄

🔍 ② 市场结构变窄

  • 2026 上半年 A 股呈 「K 型」分化,前 5% 热门科技股占成交量 40–50%
  • 一季度前 10% 成交额股票占比升到 60%
  • 指数被少数权重股拉高,广泛分散持股的策略反而跑不赢指数
  • 行业与风格轮动从月级别压缩到周甚至日级别
  • 结果:量化赖以「广谱分散选股」的宽度消失

⚖️ ③ 经典因子集体反噬

  • 动量因子强,但反转、均值回归、小市值因子持续反向
  • 中证2000 相对沪深300 估值比价回到 2024 年初水平,小盘溢价空间正在收敛
  • 低估值低波因子弱势,红利指增有正 alpha 但 beta 端亏得补不回来
  • 结果:策略业绩变成「赌风格」

⚠️ 由此推出的结论: 一群有几十上百个研究员、买最贵的另类数据、有专用算力集群的百亿机构,2026 年上半年合力挖出来的平均超额只剩 3.11 个百分点,同比掉了八成。 行业内部判断,未来平均超额中枢大概率收敛到 5% 左右甚至更低。

在这个背景下,一个每天投入 1–2 小时的散户,用公开日线数据去挖新因子 —— 这不是努力,这是往最卷的战场里送人头。

⚖️ 九、反方声音:但你的理由可能是错的

同一个决定,两种理由,只有一种站得住。这一段请认真看。

❌
错误理由:「因子太学术、太难,我不碰」

危险。如果你不懂因子,你就永远不知道自己的收益到底来自哪里。你以为你在跑「趋势跟踪」,实际上你可能是在裸奔小市值暴露或高波动暴露,只是恰好在 2024–2025 年这个风格里赚了钱。等风格切换,你连自己怎么亏的都说不清,只会得出「策略失效了」这个无效结论。

2026 年就是活教材:反转策略的管理人不是模型坏了,是他们不知道自己站在反转因子上,而市场切到了动量。

✅
正确理由:「我不做 alpha 生产,因为目标不是超额收益,且我没有数据、算力和团队」

站得住。承认自己在因子生产上没有比较优势,是一种清醒,不是怯懦。你的比较优势在别的地方 —— 资金小、进出灵活、没有排名和赎回压力、可以人机结合随时按暂停键。这些恰恰是机构复制不了的。

🧰 十、散户的因子工具箱:只留这 7 个概念

每个 30 分钟就能懂,不写代码、不算 IC。第 7 个最重要,别跳过去。

🚀 ① 动量 / 反转Momentum / Reversal

过去涨得好的继续涨(动量),还是跌多了会反弹(反转)。

2026 现状:动量强,反转持续反向。
怎么用:你的双均线策略本质就是动量策略,必须知道它在震荡市会怎么死。
📏 ② 小市值Size

小盘股长期跑赢大盘股的那部分收益。

2026 现状:小盘溢价正在收敛,中证2000/沪深300 估值比价回到 2024 年初。
怎么用:最容易自欺的因子。很多人以为自己「选股厉害」,其实只是在裸奔小市值。
📉 ③ 低波动Low Volatility

低波动股的风险调整后收益反而更好。

2026 现状:低波因子弱势。
怎么用:行情极端时,它会告诉你「高波动股票突然集体强」是危险信号。
💰 ④ 估值 / 价值Value

便宜的(低 PE/PB、高股息)长期跑赢贵的。

2026 现状:低估值低波弱势,红利指增有正 alpha 但 beta 端亏损补不回来。
怎么用:给你的策略加一道「贵不贵」的闸门,尤其在成长风格末期。
🏆 ⑤ 质量Quality

高 ROE、现金流健康的公司长期表现更好。

2026 现状:主线在成长/动量,质量因子不是今年的明星。
怎么用:作为排雷器而不是收益源 —— 过滤掉基本面烂的票。
⚡ ⑥ 流动性 / 换手Liquidity

换手率高低、成交是否活跃,本身就是一种定价偏差来源。

2026 现状:成交高度集中在前 5–10% 的股票,流动性分层加剧。
怎么用:直接决定你的策略容量上限。你的网格和轮动能不能做,先看这个。
⚠️ ⑦ 因子暴露 vs 因子择时 最重要

「暴露」= 我的持仓天然偏向哪一类股票;「择时」= 我主动判断哪个因子接下来会强。这两件事完全不同。

2026 现实:绝大多数人的收益是被动暴露决定的,不是主动择时能力 —— 但几乎所有散户都误以为是后者。
怎么用:这是你唯一必须掌握到「能回答问题」程度的因子概念 —— 我的策略赚钱,是因为我聪明,还是因为我恰好站在了某个因子上?

📎 这些因子的数据从哪来?在 QMT / PTrade 里怎么落地

你需要的全部数据都是免费的。要花钱的是另类数据 —— 而那个你已经决定不碰了。

需要什么数据免费来源在量化终端里怎么拿
全市场日线(开高低收量)AkShare / Baostock / TushareQMT:先 download_history_data() 下载,再 xtdata.get_market_data_ex() 读;PTrade:get_history()
估值(PE / PB / 股息率)AkShare 财务接口 / TushareQMT 内置财务数据接口;另有现成的「多因子数据接口」可直接取因子表
质量(ROE / 现金流 / 毛利率)AkShare / Tushare同上,QMT 财务数据字段对照表里有现成字段名
成长(营收 / 净利增速)AkShare / Tushare同上
换手率 / 流通市值AkShare / TushareQMT 因子库直接取;或自行用成交量 ÷ 流通股本算
行业分类(申万 / 证监会)AkShare 申万行业接口QMT 行业数据接口 + 文档附录里的 CSRC 行业列表
指数成分股(沪深300 / 中证2000 等)AkShare 指数成分接口QMT 维护指数数据 / 下载指数成分
资金流 / 龙虎榜 / 融资余额AkShare(覆盖较全且免费)一般不必走量化终端,本地算完再喂给策略即可

免费数据工具三件套:AkShare(覆盖面最广、纯免费,首选)· Tushare(数据质量高,积分制,跑顺之后再升级)· Baostock(老牌稳定,接口简单)。

算法上唯一一条绝对不能破的铁律: 因子值只能用 T 日及之前 的数据算,收益只能用 T+1 起 的未来数据算。 这两者只要有一点点重叠,就是未来函数 —— 回测会漂亮得不像话,实盘会死得很难看。

🪜 十一、散户学因子、用因子的三个层次(这才是「怎么用」)

三层里只有前两层要做。第三层是机构的活,你做了也白做 —— 但要知道自己放弃了什么。

必须做
🎓 层次一 · 认知层:给已经在做的事装上仪表盘
约 10 小时 · 第 6–12 个月
  1. 把第 10 节那 7 个概念各花 30 分钟搞懂。不写一行代码。
  2. 每个月看一眼持仓:集中在哪个行业、哪个市值段、平均换手率多少。这一步打开行情软件就能做,不需要编程。
  3. 练一句话:「我这个月赚(亏)的 X%,主要来自 ____ 因子。」—— 说不出来,说明仪表盘还没装上。
  4. 把 2025–2026 这轮行情当现成教材:反转策略的管理人为什么集体回撤?因为模型没坏,是他们不知道自己站在反转因子上,而市场切到了动量。你要避免的就是这件事。
  5. 这一层的产出不是新策略,是一次对自己策略的重新认识。
必须做
🧰 层次二 · 应用层:把因子当筛子用(唯一要动手的一层)
约 10 小时 + 1 次完整实操 · 第 12 个月后
  1. 先只上 2 个因子。建议 20 日动量 + 换手率 —— 都免费、都算得快、逻辑都一句话能说清。别一上来搞 10 个。
  2. 拉数据,落成一张宽表。用 AkShare 拉全市场 3 年日线,整理成「日期 × 股票 × 因子值」的结构。
  3. 做预处理三件套。去极值(掐头尾 5%)→ Z-score 标准化 → 行业内排名。三行 pandas 的事。
  4. 排序取前 30 只,等权买入,每月调一次仓。这就是你人生第一个因子策略。复杂度到此为止,不要再加。
  5. 回测 3 年,只看两个数:最大回撤 + 夏普比率。别被年化吸引 —— 年化是三个指标里最容易骗人的那个。
  6. 做一次最粗糙的归因(这步最重要):把你的组合日收益,分别和「中证2000 指数」、和「一篮子高换手股票」算相关系数。如果相关性 > 0.8,说明你辛苦半天只是复制了一个小市值 / 高换手暴露 —— 这时候你才第一次真正「看懂」自己的策略。
  7. 加第 3 个因子,重跑,看夏普有没有提升。没有提升就删掉它,不要因为「它理论上有效」而留着 —— 理论上有效的因子有几百个,能加分的没几个。
不用做
🚫 层次三 · 复现层:IC/IR 流水线、正交化、组合优化、机器学习挖因子
建议直接放弃 · 除非命中第 12 节的触发信号
  1. 算 IC / IR 去批量筛选几十个因子 → 这是机构的工业化流水线,同一个战场上你没有任何胜算
  2. 因子正交化、Barra 风险模型、组合优化器 → 你只有几万到几十万资金,这些方法的边际收益接近 0,而学习成本极高
  3. 机器学习生成因子(AlphaGen、遗传规划) → 数据量、算力、验证成本三项全都不够
  4. 另类数据 → 光数据授权费就劝退
  5. 「因子动物园」式海量试错 → 试 100 个组合挑最好看的那个,那叫 p-hacking,你找到的只是噪声,而且你会对它深信不疑

📋 散户用因子的 5 条纪律

  • 因子数量 ≤ 5,最好 3 个。宁要 3 个强的,不要 30 个弱的
  • 每个因子必须能用一句人话说清「它为什么会有效」。说不清,就说明你只是在拟合噪声
  • 一定做行业中性化。否则你的「低估值因子」其实是在买银行股
  • 一定看它近 2 年的表现。用 2015 年的有效性判断今天,是刻舟求剑
  • 一次只加一个因子,加完必须重做样本外验证。同时加三个,你永远不知道是哪个起了作用

❌ 散户明确别做的 5 件事

  • ❌ 自己算 IC / IR 去筛几十个因子
  • ❌ 做因子正交化、上组合优化器
  • ❌ 碰另类数据(卫星、舆情、电商销量)
  • ❌ 用机器学习生成因子
  • ❌ 相信「因子动物园」—— 把参数试遍挑最好看的那个

这五件事不是「难」,是「不值得」。共同点是:需要机构级的数据、算力和团队,才能做出边际收益。

🚨 十二、什么时候该回头补因子?(4 个触发信号)

不要提前学,也不要永远不学。命中任意一条,就该补课了。

1
策略连续跑输基准超过 2 个月,而你不知道原因。这时候你需要因子视角来判断:是策略逻辑坏了,还是市场风格切了。这两者的应对方式完全相反。
2
你想知道自己的收益来源构成。也就是做归因 —— 今年赚的 20%,多少来自 beta、多少来自动量、多少来自小市值。不做归因,你永远无法迭代。
3
你要同时跑 3 个以上策略,需要判断它们是不是在同一因子上重复暴露。两个看起来不相关的策略,可能都在赌同一个东西 —— 那你的「分散」是假的。
4
你开始想做指数增强(对标某个宽基指数)。到这一步,因子就从选修变成必修课了 —— 因为指增的全部意义就是稳定赚 alpha。

以上 4 条都没命中 → 你现在的路线完全正确,不必焦虑,也不用「适当涉猎」来求心安。

🗓️ 十三、18 个月时间轴:什么时候学什么

🚀 第 0–6 个月
纯执行层,完全不碰因子。把编程、QMT / miniQMT、模拟盘、小资金实盘这条路走通。目标是「能稳定跑起来」,不是「跑得好」。
🎓 第 6–12 个月
补因子常识。上面 7 个概念,每周 1 小时,只读方法论不写代码。同时用 QMT 的策略回测,做一次最粗糙的暴露归因 —— 看看你的策略收益跟小市值、跟动量方向的相关性有多高。这一步的产出不是新策略,是一次对自己策略的重新认识。
🏁 第 12–18 个月
按信号决定是否进入因子实践。命中第十二节的任意一条 → 开始学 IC / IR 与分层回测,用现成工具(不要从零写);一条都没命中 → 继续把执行层做扎实,把精力放在策略多样性和风控上,收益远高于硬啃因子。

🏁 十四、一句话总结

你的选择是对的,但请把它精确成这句话:

不做因子的「生产者」,但要做因子的「消费者」。

—— 换成本页第四节的行业说法:消费「风格因子」,放弃生产「alpha 因子」

生产者要跟 71 家百亿机构抢那 3.11 个百分点的超额,你没有那个弹药;消费者只需要花几十个小时搞懂 7 个概念,就能在那 3.11 个百分点被人吃干抹净之前,先看清自己站在哪儿。

至于「适当涉猎一点因子」—— 方向没错,但顺序错了。现在涉猎,你没有策略可以归因,学的东西会变成一堆漂浮的概念。等你手上有了一两个跑了半年、有真实净值曲线的策略,那时候再学因子,每一个概念都会立刻挂到具体的数字上,效率是现在的 5 倍以上。

🚀 接下来 6 个月 · 只做一件

  • 把执行层走通:编程 → QMT / miniQMT → 模拟盘 → 小资金实盘
  • 这一层不需要任何金融知识,只需要把工具跑通
  • 因子一个字都不用学,真的不用

🎓 第 6–12 个月 · 只做两件

  • 搞懂第 10 节那 7 个概念(约 10 小时,不写代码)
  • 每月看一眼持仓的行业 / 市值 / 换手分布,练熟那句话:「我的收益来自哪个因子」
  • 产出的不是新策略,是一份策略体检报告

🚫 永远不做

  • IC / IR 流水线、正交化、组合优化、ML 挖因子、另类数据
  • 它们都需要机构级的数据、算力和团队,对你的边际收益接近 0
  • 不是「难」,是「不值得」
⚠️ 免责声明:以上内容基于公开数据和量化分析,仅供参考,不构成投资建议。市场有风险,投资需谨慎。任何投资决策应结合个人风险承受能力、资金状况和投资目标独立判断,必要时咨询持牌专业机构。过往表现不预示未来收益。

数据来源与时效说明:文中量化私募超额收益、规模、数量等数据来自私募排排网、央视网财经(2026-07-11)、中国证券报 / 21 世纪经济报道(2026-06-08)、中国金融信息网(2026-06-11)、华夏时报(2026)、上海证券报(cnstock.com)等公开报道,均为非一手来源,统计区间不一致,不可跨区间直接对比,引用前需核实原文。市场结构描述基于上述报道,为定性结论。