MLPCOGNITIVE DATA AGENT · RESEARCH SIMULATION
证伪优先 · 源跨度接地 · 实验台账
洛佩兹·德·普拉多Marcos López de Prado
金融机器学习实验审计官
“先证明你的发现不是筛出来的幻觉。”
市场数据不是一张时间序列表,而是一组带重叠信息、选择路径和实验债务的观测。先修复研究设计,再谈模型。
RAW OBSERVATIONDEFENSIBLE DISCOVERY
01事件时钟
什么才算一个独立观测?- INPUT
- 逐笔、成交量、美元量、波动率、公司事件
- PROTOCOL
- 事件驱动采样;避免任意固定时间K线
- OUTPUT
- 信息含量更均匀的 bars
02标签与并发
预测目标何时开始、何时结束?- INPUT
- 价格路径、止盈止损、持有期、事件终点
- PROTOCOL
- 三重障碍、并发度、样本唯一性
- OUTPUT
- 带时间跨度的标签与权重
03特征与血缘
当时真的知道这些变量吗?- INPUT
- PIT财务、微观结构、另类数据、修订记录
- PROTOCOL
- 双时态、分数差分、特征聚类
- OUTPUT
- 可知时间明确的特征矩阵
04泄漏隔离
训练样本是否偷看测试期?- INPUT
- 标签跨度、训练/测试窗口、交叉验证折
- PROTOCOL
- Purging + Embargo + CPCV
- OUTPUT
- 无重叠泄漏的验证路径
05伪发现控制
这个赢家经历了多少次筛选?- INPUT
- 全部实验、失败配置、收益分布、偏度峰度
- PROTOCOL
- PBO、DSR、FDR、独立复现
- OUTPUT
- 发现可信度与否证证据
06生产闭环
模型在成本和治理后仍成立吗?- INPUT
- 成交、冲击、容量、版本、模型漂移
- PROTOCOL
- 元标签、特征重要性、在线监控
- OUTPUT
- 可审计的交易决策
PURGEEMBARGOCPCVPBODSRPASS / FAIL
FORENSIC RESEARCH LAB实验取证室:一条Alpha如何被判定为“尚未被证伪”
CASE FILEEXP-0427记录数据快照、所有试验、失败分支和研究者决策。
LEAKAGE ALARMS- 标签窗口重叠
- 财报发布时间错位
- 特征全样本标准化
- 只报告赢家
RED TEAM- Purged CV
- Embargo
- CSCV / PBO
- Deflated Sharpe
- 独立复算
VERDICTCONDITIONAL PASS结论不是“策略有效”,而是在当前数据版本和否证协议下暂未失败。
EARLIEST VERIFIABLE APPEARANCE
观点最早出现时间轴
不是按本站录入顺序,而是按承载观点的最早公开来源排序。只有年份的来源保留年精度;持续更新页无法确认绝对首发时,明确标记为“本站首次核验”。
20条观点10个来源节点2014时间线起点16有来源日期4首次核验边界 01
- 夏普率必须对多重试验和非正态收益修正年精度
- 记录试验总数是数据治理字段年精度
02
- 逐笔成交方向并非原始真值而是推断结果年精度
- 分类算法必须和买卖价差解释力一起验证年精度
03
- 金融发现更接近受控工业实验年精度
- 每条发现都应有数据版本、实验路径和否证条件年精度
04
- 多次试验会把噪声筛成看似优秀的策略年精度
- CSCV用样本组合估计回测过拟合概率年精度
05
- 对外报告应披露尝试过的配置数量年精度
- 策略评审需要看到选择路径而非单条净值曲线年精度
06
- 金融ML失败往往来自组织和研究流程而非模型不够复杂年精度
- 数据科学团队需要明确的研究协议和独立复核年精度
07
- 经验金融中的大量发现可能是选择偏差年精度
- 研究台账必须保留失败实验而非只保留赢家年精度
08
- 金融机器学习需要重新设计研究工序而非只替换回归器年精度
- 特征、标签、样本权重、验证和解释必须协同年精度
09
- 研究索引把数据科学、伪发现、微观结构与投资流程连成一体核验日期
- 应按问题选择采样、标签、验证和统计推断,而不是直接把价格表喂给模型核验日期
持续更新页面未提供稳定首发日期;本时间是本站首次完成公开核验的日期,不声称等于观点在全球的绝对首发。
10
- 公开DSR、CSCV、HRP等参考实现核验日期
- 方法结论应附可复算代码和输入假设核验日期
持续更新页面未提供稳定首发日期;本时间是本站首次完成公开核验的日期,不声称等于观点在全球的绝对首发。