回测年化 38%、最大回撤 12%——第一反应往往是「终于找到了」。更成熟的研究习惯恰恰相反:曲线越好看,越要主动找茬。不是因为你悲观,而是因为 A 股个人量化里,「想证明自己对」的路径几乎必然通向过拟合;「想证明自己错」才会逼你把口径对齐、把资金约束算进去、把样本外和统计检验做完。
本文不提供「稳赚战法」,只提供一张系统性证伪清单:把成交规则与后复权、成本、未来函数、批量 vs 单账户、指标探测 WFO、Reality Check、动画复盘、可操作性串成一条质检流水线,并给出否决标准——满足哪些条件时,应停止投入更多调参时间,暂时放弃该策略版本。
示例流程以 A 股零代码量化工具 LemonPicking 说明;证伪逻辑与软件无关,任何严肃回测都应做类似核对。专业版能力(WFO、Reality Check、更长历史等)会如实标注,不夸大免费版边界。
一、从「证明自己对」到「证明自己错」:心态切换
个人研究者常见路径:
想法 → 调参 → 曲线好看 → 找理由相信 → 实盘落差 → 怀疑人生
证伪路径:
想法 → 形式化 → 主动设否决条件 → 任一条触发则降级或放弃 → 幸存策略才配讨论实盘
| 旧问题 | 新问题 |
|---|---|
| 还能怎么把年化调高? | 哪些假设一改就崩? |
| 哪组参数最红? | WFO 测试窗还剩多少 edge? |
| 批量平均收益多少? | 单账户跳过率是否 > 30%? |
| 复盘里有没有赚钱 K 线? | 随机抽 10 笔,逻辑是否与口头规则一致? |
反例: 某策略在 2020–2024 全样本上夏普 1.6,研究者继续扫 500 组参数「再挤 5 个点」——这是证明自己对。若先设否决线「WFO 测试窗夏普 < 0.3 即放弃」,可能在第 2 天就发现策略从未通过样本外,省下数月无效调参。
二、证伪清单总览:九道关卡一张表
下面九关建议按顺序执行;前一关不过,后一关的数字越好看越危险。
| 关卡 | 证伪问题 | 主要工具/模块 | 典型否决信号 |
|---|---|---|---|
| 1. 口径 | 复权与成交是否对齐实盘可执行? | 回测配置、策略说明 | 除权假信号;当根收盘价成交 |
| 2. 成本 | 收益是否靠「零成本幻觉」? | 佣金、滑点 | 加倍滑点后曲线仍「几乎不动」(高频) |
| 3. 未来函数 | 是否偷看未来数据? | 编辑器逻辑、复盘 | 信号在突破 K 收盘前已触发 |
| 4. 筛选密度 | 规则是否可操作? | 筛选(最新 K 线) | 长期 0 命中或 > 50 只/天 |
| 5. 批量普适 | edge 是否只活在少数票? | 批量单标的回测 | 多数标的无 edge,靠极值拉动 |
| 6. 单账户 | 真实资金下买不买得上? | 单账户线性模拟 | 跳过率 > 30% 或曲线较批量腰斩 |
| 7. WFO | 参数是否样本内运气? | 专业版指标探测 | 测试窗收益/夏普接近 0 或转负 |
| 8. Reality Check | 最优是否像随机碰运气? | 专业版真实性检验 | 未通过,且已减参仍不过 |
| 9. 复盘与主观 | 赚的到底是不是你以为的逻辑? | 动画复盘 | 抽样 10 笔,≥ 4 笔逻辑不符 |
免费版 LemonPicking 可完整覆盖 1–6、9 与常规历史回测;7–8 需专业版指标探测。下文逐关展开。
三、第 1 关:成交规则与后复权——最先杀的「口径幻觉」
在比任何收益数字之前,先对齐两条基础假设。LemonPicking 常规选股与历史回测默认:
- 1. 价格:后复权——除权除息不会把均线、突破位打变形。
- 2. 成交:当根 K 线收盘确认信号,下一根开盘价成交,并计入佣金与滑点。
| 检查项 | 合格 | 不合格(应否决口径) |
|---|---|---|
| 复权 | 后复权(或与实盘决策一致的一种) | 未复权算突破/均线 |
| 确认时点 | 日线策略 = 收盘确认 | 盘中 intraday 条件却按日线回测 |
| 成交价 | 次日开盘 + 滑点 | 信号当根收盘价立即满仓 |
| T+1 / 涨跌停 | 策略涉及打板时核对约束 | 涨停仍假设成交 |

反例: 「突破 20 日新高买入」用未复权 highest(high,20),除权次日出现「假突破」;批量回测年化被拉高 5–8 个百分点——在第 1 关就应否决,后续 WFO 只是在优化噪声。
证伪动作: 改一次滑点(如 0 → 0.2%),看收益是否合理下降;若策略对成本完全无感,记录为风险项(未必立刻否决,但进入第 2 关加压)。
四、第 2–3 关:成本敏感性与未来函数
第 2 关:成本
| 策略类型 | 证伪标准(示例) |
|---|---|
| 低频(持仓 ≥ 5 日) | 滑点加倍后年化下降 < 30% 相对值 |
| 中高频 | 滑点加倍后夏普明显下降;否则可能依赖 unrealistic 成交 |
反例: 日均换手 200% 的策略,零滑点年化 60%,加 0.15% 滑点变 8%——不是「滑点害我」,是策略从未成立。
第 3 关:未来函数与前视偏差
系列前文专讲过未来函数;证伪清单里只问一句:动画复盘里,信号是否出现在你「实盘能知道」的时刻之后?
常见坑:
- – 使用「当日最高」突破,却按收盘价确认之前触发;
- – 指标窗口含「未来 bar」的写法(可视化工具较少,但 AI 草稿需人工查);
- – 筛选「区间任意 K 线」时,把后段信息误用于前段(研究习惯问题)。
否决: 任意抽样 10 笔,发现 ≥ 2 笔 存在明确前视 → 立即降级,不得进入 WFO。
与 AI 草稿联动的证伪提示
AI 生成策略后,证伪清单第 3 关应额外核对:是否把 SEQUENCE 写成了 AND、是否默认「信号当根成交」、是否遗漏出场导致回测区间末强制平仓。系列《AI 生成策略怎么验收》中的结构核对表,可作为第 3 关的子清单——AI 越方便,人工验收越不能省。
五、第 4 关:筛选密度——不可操作 = 未证伪的「空策略」

筛选(尤其「最新 K 线」模式)回答:规则在真实市场里多常发生。这是可操作性门禁。
| 命中情况 | 解读 | 建议 |
|---|---|---|
| 连续 20+ 交易日 ≈ 0 | 过严或逻辑错误 | 先修 AND/SEQUENCE,勿扫参 |
| 1–20 只/天 | 可操作带 | 进入 5–6 关 |
| > 50 只/天 | 过松,假信号多 | 加 AND/SEQUENCE 或提高阈值 |
反例: 回测区间只有 3 笔交易、年化却 80%——样本太少,统计上未证伪也未证实,应否决「可实盘」结论,最多保留「观察清单」。
六、第 5–6 关:批量回测 vs 单账户——两种幻觉一次拆

| 模式 | 证伪问题 | 否决信号(示例) |
|---|---|---|
| 批量单标的 | edge 是否广泛存在? | 80% 标的无正期望,靠少数极值 |
| 单账户线性 | 一份钱能否执行? | 信号跳过率 > 30%;或收益较批量 腰斩以上 |
批量与单账户回答不同问题,不可替代:
- – 批量好看、单账户崩 → 资金/持仓幻觉,未必策略逻辑全错,但不能按批量年化做预期。
- – 批量崩、单账户好看 → 少见,多为样本过小或设置错误,需复查。
- – 两者都崩 → 高优先级否决。
证伪动作清单:
- 自选股 + 随机 N 只批量,看收益/胜率分布是否靠极值
- 单账户设置最大持仓、固定仓位比例,与实盘计划一致
- 记录跳过率与「跳过信号的事后表现」(复盘里可 spot check)
七、第 7–8 关:WFO 与 Reality Check(专业版,如实说明)
当你通过 1–6 关,策略仍「看起来不错」,才进入参数与统计证伪——这是过拟合的主战场。LemonPicking 专业版指标探测提供 Walk-Forward Optimization(WFO)与 Reality Check / 真实性检验;免费版可理解概念并用固定参数回测,但无法替代下述检验。

第 7 关:WFO 样本外
| 概念 | 证伪含义 |
|---|---|
| 训练窗定参 | 允许在「过去」扫描 |
| 测试窗冻结 | 未参与选参的未来段表现 |
| 全样本最优 vs WFO 推荐 | 应用 WFO 推荐,勿用 IS 冠军 |
否决信号(示例,可按风险偏好调整):
- – 多轮 WFO 测试窗累计夏普 < 0.3,或最大回撤远超可承受;
- – 参数热力图孤立尖峰(相邻格断崖),WFO 推荐落在尖峰上;
- – 换标的池后 WFO 测试窗同步崩塌。
第 8 关:Reality Check
扫描 200 组参数时,必然有一组样本内最优——哪怕策略是噪声。Reality Check 问:观测到的最优,是否显著好于随机策略/随机参数的预期?
| 结果 | 含义 |
|---|---|
| 通过 | 不能证明必赚,但「纯运气」解释力下降 |
| 不通过 | IS 最优高度可疑,应简化逻辑、减扫描维度 |
WFO 与 RC 互补(系列 WFO 深度文已述):
- – WFO 过、RC 不过 → 时间切分还行,统计上仍像碰运气 → 继续减参,勿加仓预期。
- – RC 过、WFO 不过 → 全样本不像纯噪声,但参数不迁移 → 查参数悬崖与 regime。

反例: 全样本最优年化 42%,WFO 测试窗 5%,Reality Check p 值不显著——研究者仍写「我的策略 40%+」——这是拒绝证伪,不是研究。
专业版与免费版:证伪清单怎么配
| 关卡 | 免费版能否完成 | 说明 |
|---|---|---|
| 1–6、9 | ✓ | 口径、双模式回测、筛选、复盘——应人人必做 |
| 7 WFO | 需专业版 | 无 WFO 时,至少做「固定参数换区间/换标的池」粗测 |
| 8 Reality Check | 需专业版 | 无 RC 时,降低对「扫参冠军」的信任度,少扫维度 |
免费版用户的务实替代: 将全样本切为 70% 定参 / 30% 留作手检,手检段表现若崩溃,视同 WFO 不通过——虽不如正式 WFO 严谨,但比「全样本调到满意」强一个数量级。
八、第 9 关:动画复盘——逻辑层最后一击

数字过关后,用动画复盘做逻辑证伪:
- 1. 随机抽 10 笔完整交易;
- 2. 逐 K 线问:入场是因为 SEQUENCE/AND 的哪个阶段?出场是否按规则?
- 3. 若 ≥ 4 笔与口头规则不符 → 逻辑证伪,回编辑器修结构,禁止继续扫参。
与 OR/SEQUENCE 相关的典型打脸:
- – 口头「先缩后突」,复盘却是同一根 K 线 AND 凑齐;
- – OR 过松导致「任意条件亮就买」,复盘里买点分散无形态;
- – 突破 K 盈利,但后续 8 笔均为假突破亏损——说明 B 阶段确认不足,非「再调大止盈」能救。
九、可操作性终审:从研究到「你愿不愿意每天执行」
证伪不只对着图表,还对着你的生活:
| 维度 | 证伪问题 |
|---|---|
| 频率 | 每日信号数是否超出你能跟单的上限? |
| 持有期 | 与你的工作节奏是否冲突? |
| 回撤 | 最大回撤 × 计划仓位,睡眠是否受影响? |
| 依赖 | 是否依赖分钟线/Level2,而你的执行做不到? |
反例: 策略需要 9:45 前完成决策,但你只能收盘后操作——这是执行层否决,与夏普无关。
十、完整案例:一张「打脸流水账」长什么样
假设某「均线金叉 + SEQUENCE 放量确认」策略,回测年化 32%。按证伪清单走一遍(示意):
| 关卡 | 结果 | 裁决 |
|---|---|---|
| 1 口径 | 后复权、次日开盘 ✓ | 通过 |
| 2 成本 | 滑点加倍后年化 24% | 通过 |
| 3 前视 | 10 笔中 1 笔边界 case | 通过(记录) |
| 4 筛选 | 平均 8 只/天 | 通过 |
| 5 批量 | 随机 50 只中 38 只有正收益 | 通过 |
| 6 单账户 | 跳过率 35%,年化降至 14% | 软否决候选 |
| 7 WFO | 测试窗夏普 0.4 | 边缘 |
| 8 RC | 不通过 | 硬否决候选 |
| 9 复盘 | 10 笔中 3 笔 SEQUENCE 顺序存疑 | 软否决候选 |
最终裁决: 硬否决 1 条(RC)+ 软否决 2 条 → 暂停实盘,回编辑器加冷却期、减扫描参数,重跑 1–6 关。若第二轮 RC 仍不过,放弃该版本——这比直接实盘然后亏 15% 便宜得多。
十一、否决标准汇总:何时应放弃策略(版本)
下面任一条成立,建议停止继续调参,标记为「未通过证伪」;可保留记录,6 个月后再用新数据重测,而非立刻实盘。
A. 硬否决(任一触发)
- 1. 前视/未来函数经复盘确认;
- 2. 未复权或当根收盘价成交等口径错误未修正;
- 3. 单账户跳过率 > 40% 且批量优势主要来自被跳过的信号;
- 4. 专业版 WFO 测试窗累计表现远低于可接受底线,且已尝试 WFO 推荐参数;
- 5. 专业版 Reality Check 不通过,且已减扫描维度仍不过。
B. 软否决(满足 ≥ 2 条建议暂停)
- 1. 筛选长期在可操作带外(0 或 > 50 只/天);
- 2. 批量收益靠 < 10% 标的拉动;
- 3. 动画抽样 10 笔中 3–4 笔逻辑存疑;
- 4. 加倍滑点后中频策略夏普 腰斩;
- 5. 口头规则与编辑器 AND/OR/SEQUENCE 结构不一致。
C. 幸存线(才讨论「研究版实盘监测」)
- – 1–6 关无硬否决;
- – 7–8 关(若可用)未触发硬否决;
- – 复盘抽样 ≥ 8/10 符合逻辑;
- – 单账户曲线与批量方向一致,衰减在可解释范围(跳过率 < 25%);
- – 你已书面写下最大回撤与仓位承受线。
幸存 ≠ 保证赚钱,只表示:暂时没有找到足够强的打脸证据。
十二、串联工作流:一张可打印的证伪 SOP
形式化策略 → 验证保存
↓
[1] 后复权 + 次日开盘成交 + 费用 ✓
↓
[2] 滑点敏感性 ✓
↓
[3] 复盘查前视 ✓
↓
[4] 筛选命中数 ✓
↓
[5] 批量普适性 ✓
↓
[6] 单账户 + 跳过率 ✓
↓
[7] 专业版 WFO(可选但强烈建议)✓
↓
[8] 专业版 Reality Check ✓
↓
[9] 动画复盘 10 笔 ✓
↓
可操作性终审 → 幸存 / 否决
研究日志建议字段(本地 SQLite 存策略与结果,符合本地优先原则):
- 口径截图或文字记录
- 筛选命中数(日期、标的池)
- 批量 vs 单账户核心指标 + 跳过率
- WFO 推荐参数 vs 全样本最优(若已跑)
- Reality Check 结论(若已跑)
- 复盘抽样笔记(10 笔)
- 最终裁决:幸存 / 软否决 / 硬否决
十三、与「可信度自检」系列的关系
系列前文《回测赚钱实盘却亏》提出四步可信度自检;本篇是升级版:把自检扩展为九关证伪 + 否决标准,并显式纳入 WFO、Reality Check、筛选密度与 OR/AND/SEQUENCE 逻辑一致性。
二者关系:
| 自检(02 篇) | 证伪清单(本篇) |
|---|---|
| 问「有多可信?」 | 问「何时必须放弃?」 |
| 4 步 | 9 关 + 硬/软否决 |
| 偏诊断 | 偏流程与裁决 |
与 SEQUENCE / AND 形态文(29 篇) 的关系:29 篇教你怎么写对规则;本篇教你怎么判规则该不该留。建议顺序:形态/逻辑搭稳 → 29 篇清单跑通 → 30 篇九关证伪 → 幸存才进监测或实盘研究。
建议:新策略走证伪清单;老策略季度复查走自检四步即可。
十四、证伪 FAQ:五个「能不能例外?」
Q1:WFO 不过,但批量很好看,能不能只做观察仓?
不建议。批量未单账户、未 RC 的好看,属于研究幻觉;最多保留筛选名单,不写仓位。
Q2:Reality Check 不过,但我逻辑很自洽,能不能忽略?
RC 针对的是扫参后的最优;若你固定参数、几乎不扫,RC 权重可略降——但若 IS 冠军来自大网格扫描,RC 不过应硬否决。
Q3:单账户跳过率高,我加大总资金行不行?
跳过率反映信号密度 vs 槽位结构问题,加钱不解决「同一天 20 个信号抢 5 个槽」;应降噪入场或加冷却。
Q4:复盘 10 笔里有 2 笔不符,算否决吗?
硬否决线设在 ≥ 4 笔;2 笔应回到编辑器修条件,修完重抽 10 笔,而非继续扫参。
Q5:免费版做不了 WFO/RC,是不是没法证伪?
能做 80% 证伪——口径、成本、筛选、双模式、复盘足以杀掉多数幻觉;剩余 20% 用「手切样本外 + 少扫参」替代,待升级专业版再补 RC。
证伪 mindset 与日常习惯
把证伪清单变成习惯,比一次性「认真一次」更有用:
| 习惯 | 频率 | 耗时(约) |
|---|---|---|
| 口径核对(复权/成交) | 每次改策略 | 2 分钟 |
| 筛选命中数 | 每次改入场 | 5 分钟 |
| 动画复盘 10 笔 | 每次大改 | 15 分钟 |
| 批量 + 单账户对照 | 每个「候选版」 | 20 分钟 |
| WFO + RC | 准备进「研究版」库前 | 专业版,视扫描规模 |
反例: 研究者每周微调参数却从不重跑单账户——跳过率从 18% silently 爬到 41%,批量年化仍显示 28%,直到实盘才第一次看见真相。证伪清单的价值,在于把 silent failure 变成可见指标。
结语:会证伪的研究者,才配谈 alpha
A 股个人量化里,未经证伪的策略不是资产,是负债——它消耗你的注意力和实盘资金,还给你虚假信心。
把「想证明自己对」改成「想证明自己错」,并不是悲观,而是把 LemonPicking 提供的工具链用到正确位置:后复权与成交规则对齐现实,批量与单账户拆两种幻觉,筛选约束可操作,动画复盘查逻辑,专业版 WFO 与 Reality Check 拆调参运气——任一关亮红灯,都值得你感谢「又躲过了一次实盘打脸」。
若你希望用零代码方式实践这套证伪流水线,可以了解 LemonPicking(零代码 A 股量化):策略与回测结果保存在本机,免费版即可完成口径、筛选、双模式回测与复盘;专业版提供指标探测、WFO、Reality Check、更长历史与分钟线,用于参数与统计层证伪。
记住:回测报告上的每一个漂亮数字,都是待证伪的假设——不是勋章。你能列出「哪一条否决线被触发」,比你能背出年化数字,更接近真实的研究能力。
下载与说明见产品页:
https://www.zpyztech.com/product/lemonpicking/
免责声明: 本文仅作量化研究方法与软件使用说明,不构成任何投资建议。历史回测不代表未来表现,请独立判断并自行承担交易风险。