OPEN EVIDENCE LEDGER · 2026-07-27

量化人物
公开证据库

入口不再只是下载文件。这里把60位人物、404条结构化观点和176组公开来源作为可检索页面展示,并保留完整MD与机器可读版本。

60人物
404观点
176来源
5高密度档案
01

证据强度分层

前5位为逐主张高密度证据;其余为档案级来源摘要。数量多不伪装成证据更强。

02

观点完整保留

展示本轮已收集的全部结构化转述,不只保留适合首页的短句。

03

版权与身份边界

不镜像全文、不冒充原话或本人;每条档案都回链论文、大学、本人或机构入口。

04

机器可读

JSON、来源索引、JSONL与角色Agent规范可用于复核、再抽取和知识图谱更新。

PROVENANCE LEDGER

人物—观点—来源

60 / 60
01

Marcos López de Prado

金融机器学习、样本构造、验证与伪发现控制

逐主张高密度证据10 源 / 20 观点
市场数据不是一张时间序列表,而是一组带重叠信息、选择路径和实验债务的观测。先修复研究设计,再谈模型。
  1. 研究索引把数据科学、伪发现、微观结构与投资流程连成一体
  2. 应按问题选择采样、标签、验证和统计推断,而不是直接把价格表喂给模型
  3. 公开DSR、CSCV、HRP等参考实现
  4. 方法结论应附可复算代码和输入假设
  5. 金融机器学习需要重新设计研究工序而非只替换回归器
  6. 特征、标签、样本权重、验证和解释必须协同
  7. 多次试验会把噪声筛成看似优秀的策略
  8. CSCV用样本组合估计回测过拟合概率
  9. 夏普率必须对多重试验和非正态收益修正
  10. 记录试验总数是数据治理字段
  11. 经验金融中的大量发现可能是选择偏差
  12. 研究台账必须保留失败实验而非只保留赢家
  13. 逐笔成交方向并非原始真值而是推断结果
  14. 分类算法必须和买卖价差解释力一起验证
  15. 金融ML失败往往来自组织和研究流程而非模型不够复杂
  16. 数据科学团队需要明确的研究协议和独立复核
  17. 金融发现更接近受控工业实验
  18. 每条发现都应有数据版本、实验路径和否证条件
  19. 对外报告应披露尝试过的配置数量
  20. 策略评审需要看到选择路径而非单条净值曲线
02

石川

A股因子投资、实证资产定价、多重检验

逐主张高密度证据10 源 / 20 观点
因子不是字段排名,而是“理论约束—变量构造—A股实证—统计推断—组合落地”的证据链。数据处理口径就是研究结论的一部分。
  1. 因子研究应把理论、实证与A股可复制结果放在同一框架
  2. 公开数据和算法说明是可复现性的组成部分
  3. 研究聚焦因子投资、资产配置与组合管理
  4. 学术严谨与实务约束必须同时保留
  5. 因子动物园、p-hacking、多重检验、缺失数据和可复制研究属于同一审计问题
  6. 应从SDF/资产定价理论向下约束经验因子
  7. 因子收益进入组合前要经过协方差、风险模型和实施边界
  8. 因子择时的一阶矩证据通常不足
  9. 公开CAPM、FF3/5、Carhart、HXZ等A股日月频因子数据
  10. 算法版本和市场/无风险收益应分离保存
  11. 以统一股票池比较七类风格因子
  12. 指数算法说明和历史序列应同步版本化
  13. A股盈利因子需明确TTM分子分母和调仓时点
  14. 单变量、双变量、预期外盈利与PEAD应分层检验
  15. 行为偏差可形成异象和共同收益因子
  16. 数据图谱应连接预期偏差、风险偏好、注意力和套利限制
  17. 先理解金融时间序列的统计性质再选择模型
  18. 随机游走、自相关、波动聚集需要分别建模
  19. 因子溢价估计和多因子模型检验是两类问题
  20. 遗漏变量、变量误差与信息聚合会改变实证结论
03

Robert Carver

系统化期货、预测组合、仓位与成本

逐主张高密度证据10 源 / 20 观点
优势来自一连串朴素、可维护的决定:可靠价格、统一风险单位、保守预测、跨品种池化、成本约束和实盘反馈。每层都要能单独诊断。
  1. 研究结果应公开包括无效结果
  2. 数据不足时优先池化、平均和稳健化,而非精细拟合
  3. 系统化投资从预测、风险和组合规则出发
  4. 高夏普的单市场回测通常包含显性或隐性拟合
  5. 同一系统支持回测和生产交易
  6. 数据、配置、缓存、预测、仓位、组合、账户构成可追踪阶段
  7. 期货连续价、原始合约价和百分比收益分母不能混用
  8. 交易成本应拆为点差、合约费用、比例费和每笔费用
  9. 单一品种通常没有足够数据区分规则优劣
  10. 池化估计能增加有效样本但必须尊重可比性
  11. 真实市场没有固定且已知的分布
  12. 真实相关性估计误差远大于理想随机数据,需收缩
  13. 应同时比较实盘与回测而不是只展示回测
  14. 交易规则、成本、资产与风险预算构成一个整体
  15. 规则分组收益和相关性要跨多个窗口观察
  16. 实盘执行差异是需要积累的数据而非噪声
  17. 成本应进入动态优化而不是回测后统一扣减
  18. 高成本品种可提供预测信息但不一定应实际交易
  19. 慢速系统即使有数十年和上百品种,有效独立样本仍可能很少
  20. 统计显著性应按信号频率而非原始行数判断
04

Cliff Asness

价值、动量、质量与跨资产因子

逐主张高密度证据10 源 / 20 观点
可信因子必须同时跨定义、跨时期、跨国家、跨资产成立,拥有经济解释,能被独立复现,并在成本与容量后仍可实施。
  1. 研究主题长期覆盖价值、动量、质量与组合
  2. 实践观点通过论文、数据集和复现持续公开
  3. 公开日/月频因子和原论文数据
  4. 研究数据应持续扩展而不是停留在发表样本
  5. 价值和动量在多市场多资产存在共同结构
  6. 跨市场证据比单一美股样本更能约束解释
  7. 公开48个测试资产相关组合数据
  8. 原始论文数据和后续更新数据应区分
  9. 质量由盈利、成长、安全和派息共同定义
  10. 质量价格和未来收益需在长样本及多国验证
  11. 日频因子覆盖美国和23个国际市场
  12. 定义、组合交叉和更新节奏构成数据产品元数据
  13. 内部新发现要由另一研究者独立复现
  14. 不应相信数百个互不相关因子,而应聚合为少数经济主题
  15. 因子估值择时需要多测量和长历史
  16. 单一估值指标的极端值容易误导
  17. 行业内和行业间效应必须拆分
  18. 中性化不是装饰,而是识别收益来源的实验设计
  19. 价值与动量均有预测证据且相互补充
  20. 因子必须作为组合证据而不是孤立排名
05

丁鹏

中国量化投资体系、数据工程与程序化交易

逐主张高密度证据8 源 / 16 观点
量化投资不是程序化下单的别名,而是“大数据—策略模型—程序化执行—绝对收益目标”的完整学科体系;数据、模型、交易风险要由不同系统分别控制。
  1. 量化投资以大数据为基础、策略模型为核心、程序化交易为手段
  2. 数据只是起点,目标函数和交易闭环决定用途
  3. 风险分为数据、模型和交易三层
  4. 盘前参数、盘中自动执行、盘后统计和持续优化形成日循环
  5. 国内历史数据曾需要购买两到三份交叉校对
  6. 市场理解必须先转译成程序化行为
  7. 基金样本存在存活偏差,实盘预期必须打折
  8. 资金规模决定可用策略和数据频率
  9. 量化是程序化、科学化的投资手段
  10. 不能把单一K线技术指标等同于完整量化体系
  11. 程序化交易只是量化投资的执行子集
  12. 策略、交易、数据和风险需要统一理解
  13. 新市场量化成功首先依赖数据,其次依赖策略
  14. 24小时、多标的市场迫使风险控制自动化
  15. 从选股、择时、套利到算法交易组织量化策略
  16. 数据标准化和交易技术是策略可落地的共同底座
06

Andrew W. Lo

适应性市场、金融计量与市场微观结构

档案级来源摘要8 源 / 16 观点
市场不是平稳机器,而是参与者、制度与技术持续适应的生态;数据生成过程本身会改变。
  1. 研究跨越适应性市场、系统风险、机器学习与市场模型
  2. 数据解释必须考虑参与者学习与制度环境
  3. 公开研究覆盖随机游走、非同步交易、数据窥探和微观结构
  4. 频率、交易制度和估计方法共同决定可预测性
  5. 同一数据库被反复使用会产生大量伪模式
  6. 数据窥探不能完全消除,只能通过披露和稳健程序抑制
  7. 不同采样频率的方差估计可检验随机游走
  8. 拒绝随机游走不自动等于发现可交易均值回归
  9. 风险管理从理解价格统计行为开始
  10. 随机游走、长记忆和稳定分布是竞争性解释
  11. 价格效率、财富分布、成交量和价差由异质学习者互动产生
  12. 市场数据应与参与者生态和机制一起建模
  13. 可预测性会随竞争者、制度和环境改变
  14. 模型需要监控结构变化而不是假设永久平稳
  15. 成交量定义本身来自理论约束
  16. 价格和数量应共同进入市场模型
07

Ernest P. Chan

统计套利、均值回归与实盘回测

档案级来源摘要8 源 / 16 观点
有效独立样本远少于数据行数;简单模型、可交易价格、成本与实盘衰减比回测复杂度更重要。
  1. 研究聚焦机器学习和量化资产管理
  2. 公开课程与文章以可操作回测为核心
  3. 历史数据的独立信息量远小于行数
  4. 经济逻辑、少参数、简单模型是使用珍贵样本的前提
  5. 金融序列非平稳,模型有时需要连续再训练
  6. 样本外测试能降低但不能消除复杂模型过拟合
  7. 曾经有效的策略会因市场变化而死亡
  8. 实盘衰减数据必须进入模型生命周期
  9. 准确的低频快照仍可能制造虚假利润
  10. 策略持有期内路径和可交易价不能被收盘价替代
  11. 不同资产与频率有不同的回测陷阱
  12. 成交成本、存活偏差和交易时点需显式模拟
  13. 订单流可能有alpha但采集门槛高
  14. 需要保存每个买价、卖价、成交和成交量
  15. 真正未见样本比重新切分历史样本更有说服力
  16. 成本后的表现才是策略证据
08

Corey Hoffstein

组合构造、时点运气与过程多样化

档案级来源摘要8 源 / 16 观点
数据不仅回答买什么,还回答如何实施与何时决策;what、how、when三维都需要分散。
  1. 研究覆盖因子、趋势、组合构造和时点运气
  2. 稳健性来自what/how/when三维分散
  3. 相同策略仅改变调仓日就会产生显著差异
  4. 重叠组合可分散不可补偿的时点风险
  5. 组合500多个日期、定义和回看期变体可降低规格风险
  6. 模型集成应覆盖过程和调仓时点
  7. 信息流速并非常数,固定日历窗口可能在平静期过采样、危机期欠采样
  8. 采样域可以从钟表时间改为信息时间
  9. 单信号简单系统可能对随机扰动极脆弱
  10. 适度集成在复杂度和估计风险之间取得平衡
  11. 资产、信号定义和调仓时点是三种不同风险
  12. 数据图谱不能只有标的维度
  13. 慢速基本面策略同样受调仓日影响
  14. 历史研究要保存每个可选形成日快照
  15. 相关性只描述what,收益形态描述how
  16. 均值回归与趋势的凹凸收益可以组合
09

Edward O. Thorp

统计套利、凯利准则与科学化仓位

档案级来源摘要2 源 / 5 观点
把市场视为可检验的概率游戏:先证明优势,再依据不确定性配置资本,并持续寻找定价关系而非方向故事。
  1. 投资和赌博都应先估计胜率、赔率与估计误差,不能只依据历史收益排名。
  2. 凯利准则最大化长期财富的几何增长率,但实际应用通常要因参数误差和回撤承受力采用分数凯利。
  3. 可转换债券与对应股票之间的相对定价可构成接近市场中性的统计套利。
  4. 对异常稳定且难以解释的业绩应进行独立数据核验、策略容量检查和欺诈可能性审计。
  5. 真正的量化优势来自科学方法:提出假说、收集数据、实验验证、下注并根据反馈修正。
10

Campbell R. Harvey

因子动物园、多重检验与收益预期

档案级来源摘要2 源 / 5 观点
金融发现必须把试过多少次、理论先验、样本外证据和发表选择共同计入;一个漂亮 t 值不是因子真相。
  1. 因子数量快速增长会形成“因子动物园”,传统显著性阈值不足以控制伪发现。
  2. 新因子应使用更高统计门槛,并报告研究者自由度、尝试次数和多重检验修正。
  3. 基金经理和因子选择都可能把运气误判为技能,需要跨期复现和层级化比较。
  4. 预期收益来自状态变量、风险与行为机制,历史均值只有在样本与结构稳定时才是合理估计。
  5. 行业中性化会改变因子的经济含义,不能作为默认清洗步骤而不做分解验证。
11

David H. Bailey

回测过拟合与多重试验统计

档案级来源摘要2 源 / 5 观点
回测是一种极易被过度搜索污染的实验;如果不记录搜索空间和失败试验,最优曲线往往只是历史噪声的肖像。
  1. 策略变体数量相对数据量过大时,样本内最优者通常会在样本外失效。
  2. 任何目标收益曲线都可能通过搜索历史证券权重被拟合出来,因此外观不能证明机制。
  3. 应使用PBO、组合式样本切分和试验台账度量回测选择偏差。
  4. 伪数学、过度精确参数和隐藏搜索次数是量化产品尽调中的主要危险信号。
  5. 科学计算可复现性要求保存数据、代码、参数、软件环境和所有候选结果。
12

Michael Halls-Moore

量化系统工程与历史数据治理

档案级来源摘要2 源 / 5 观点
量化交易首先是数据工程与软件工程问题;策略研究、事件驱动回测、风险和实盘必须共享清晰接口。
  1. 历史数据采购要同时评估质量、偏差、公司行为、频率、授权与长期成本。
  2. 事件驱动架构能让行情、信号、订单、成交与组合状态在回测和实盘间保持一致。
  3. 回测必须显式处理前视偏差、幸存者偏差、成本、滑点与市场冲击。
  4. 研究代码只有进入可测试、可监控和可恢复的生产系统后才成为可用策略。
  5. 策略选择应从假说、数据可得性和实施约束出发,而非先挑模型。
13

Antti Ilmanen

预期收益、风险溢价与长期证据

档案级来源摘要2 源 / 5 观点
预期收益要从长期证据、估值、收益来源和投资者行为共同估计;在低预期收益时代更需要分散与耐心。
  1. 历史平均收益、估值隐含收益、调查预期和理论模型回答的是不同问题。
  2. 价值、动量、防御与趋势等风格可提供跨资产分散,但都可能经历长期逆风。
  3. 当前估值影响长期预期收益,却很难精确预测短期拐点。
  4. 投资组合应在资产类别、风险溢价、宏观情景和实施方式之间分散。
  5. 投资者主观预期常追逐近期表现,与合理的前瞻预期方向相反。
14

Lasse Heje Pedersen

流动性、杠杆与有效低效市场

档案级来源摘要2 源 / 5 观点
市场既非完全有效也非任意低效;信息成本、融资约束、流动性与专业资本共同决定可利用的错价。
  1. 主动管理的收益机会与投资者寻找优秀管理人的成本同时存在。
  2. 融资流动性恶化会迫使交易者降杠杆,并反馈为市场流动性下降。
  3. 低风险资产的高风险调整收益与杠杆约束相关,不能只用CAPM解释。
  4. 交易优势必须覆盖信息、融资、库存和市场冲击成本。
  5. 大数据只有与经济模型和真实市场约束连接时才形成可持续优势。
15

Rob Arnott

基本面指数、估值与因子择时

档案级来源摘要2 源 / 5 观点
价格加权的市值指数会把近期赢家赋予更高权重;估值、基本面权重与均值回归是构造长期组合的重要反向力量。
  1. 基本面指数按企业经济规模而非市场价格分配权重,从而系统性再平衡估值偏离。
  2. 因子收益会随拥挤度和估值变化,因子不能脱离买入价格讨论。
  3. 回测异常若依赖单一时期、单一定义或发表后消失,不应被包装为长期溢价。
  4. 长期预期收益需要结合收益率、增长、估值变化和均值回归分解。
  5. 智慧贝塔的价值来自透明、可实施和有经济逻辑的规则,不是新标签。
16

Meb Faber

全球资产配置与趋势

档案级来源摘要2 源 / 5 观点
简单、透明、低频的全球资产配置和趋势规则,往往比精细预测更容易跨市场、跨年代存活。
  1. 长期趋势过滤可降低全球资产组合的波动和深度回撤,但会产生来回止损。
  2. 资产配置应全球化,不能把美国单一历史样本当成全部投资世界。
  3. 估值更适合决定长期相对配置,而非短期交易时点。
  4. 模型规则应简单到可解释、可复算,并对参数附近保持稳定。
  5. 公开数据与公开规则有助于区分策略逻辑和营销选择。
17

Jim Gatheral

波动率曲面、粗糙波动率与市场冲击

档案级来源摘要2 源 / 5 观点
波动率曲面和市场冲击不是抽象参数,而是订单流、交易者拆单与无套利约束留下的数据结构。
  1. 隐含波动率曲面必须满足静态无套利约束,校准不能只追求样本内误差。
  2. 高频波动率呈现比传统扩散模型更粗糙的路径结构。
  3. 粗糙波动率可从订单拆分和微观结构机制获得解释,而非纯粹数学拟合。
  4. 执行冲击模型必须排除价格操纵式交易路径,并结合点差与瞬时冲击。
  5. 期权、逐笔、订单流和执行数据应共同约束波动率与冲击模型。
18

Euan Sinclair

期权、波动率与交易优势

档案级来源摘要2 源 / 5 观点
期权只是表达工具,真正交易的是预测波动率与市场隐含波动率之间的差异,并用仓位和复盘保护优势。
  1. 期权优势需要分解为方向、实现波动率、隐含波动率、偏斜与事件风险。
  2. 高隐含波动率并不自动意味着期权昂贵;比较对象应是未来实现分布而非历史分位。
  3. 模型的价值是把波动率观点翻译成价格和对冲,不是复杂度本身。
  4. 寻找优势、资金管理和交易心理缺一不可,其中仓位规则比信心更可靠。
  5. 绩效复盘应把方向盈亏与波动率盈亏分开,确认工具是否真正增加价值。
19

Stefan Jansen

机器学习交易与开源实现

档案级来源摘要2 源 / 5 观点
机器学习只有嵌入从数据采购、特征、验证、组合到回测的端到端流程,才可能转化为交易价值。
  1. 市场、财务、另类文本与图像数据需要不同的清洗、时间对齐和特征工程。
  2. 预测精度必须通过交易规则、成本和组合约束转译为经济价值。
  3. 时间序列切分、滚动验证和防泄漏管线是模型选择的基础。
  4. 文本、深度学习和强化学习应与简单基线在相同数据与成本条件下比较。
  5. 可执行Notebook、数据下载步骤和复现实验是量化教育与研究交付的一部分。
20

Wesley Gray

量化价值与学术因子落地

档案级来源摘要2 源 / 5 观点
用学术证据寻找简单、行为驱动且可实施的价值与动量规则,再以透明流程减少投资者自身的行为错误。
  1. 量化价值把基本面质量与估值结合,避免只买统计意义上的廉价陷阱。
  2. 动量简单但不容易坚持,策略收益的一部分来自投资者行为和执行纪律。
  3. 研究结果必须从论文走到真实股票池、换手、成本和组合集中度。
  4. 复杂优化不一定优于清晰排名与稳健规则。
  5. 教育和公开复现能缩小学术因子与投资产品之间的研究鸿沟。
21

Rishi K. Narang

量化系统分类、风险与管理人尽调

档案级来源摘要2 源 / 5 观点
量化策略不是不可解释黑箱,而是由Alpha模型、风险模型、组合构造、执行与数据组成的可拆解系统。
  1. 评估量化管理人应分别审视数据、Alpha来源、风险约束、组合构造和执行。
  2. 不同Alpha模型表达趋势、均值回归、价值、质量和事件等不同假说。
  3. 风险的误测可能来自历史窗口、相关性突变、流动性与杠杆,而非单一波动率。
  4. 组合构造决定分散假设如何变成真实持仓,不能被Alpha回测遮蔽。
  5. 黑箱的真正问题是治理与透明度不足,不是使用数学或自动化本身。
22

Gary Antonacci

双动量

档案级来源摘要2 源 / 5 观点
相对动量选择强者,绝对动量决定是否承担风险;两者结合形成简单、可解释的双动量框架。
  1. 相对强弱用于在风险资产之间选择,绝对趋势用于识别广泛风险状态。
  2. 双动量的主要目标之一是减少大幅熊市损失,而非提高每个月胜率。
  3. 长期动量证据跨越多个市场和历史时期,但实现依赖定义、形成期和安全资产。
  4. 单一动量模型可与多种趋势、均值回归和其他因子组合。
  5. 策略应在广泛指数层面实施,避免把简单框架变成高换手选股。
23

Kris Abdelmessih

期权、波动率与决策教育

档案级来源摘要2 源 / 5 观点
期权是关于分布、路径和波动率的语言;好决策要把方向、波动率、相关性与资金管理分别归因。
  1. 期权盈亏必须拆分方向、gamma/theta实现波动率与vega隐含波动率。
  2. 不存在唯一的“波动率”;采样尺度、时间结构和价格路径都会改变测量结果。
  3. 相关性只描述共同方向,收益形态与凸凹性决定组合在极端情景中的行为。
  4. 市场价格包含参与者权重信息,但仍需用复制关系和无套利检查理解。
  5. 交易教育应通过可计算练习、案例和反例建立直觉,而非背诵希腊字母。
24

Adam H. Grimes

市场结构、价格行为与统计验证

档案级来源摘要2 源 / 5 观点
市场大部分时间接近噪声,优势只在特定结构和条件下出现;统计检验与交易技艺必须互相约束。
  1. 价格行为模式应先转成明确规则,再用数据验证条件概率和失败分布。
  2. 趋势与均值回归是价格行为的两个基本状态,边缘来自状态识别而非图形命名。
  3. 指标和模式只有在市场背景、波动率和执行窗口下才有意义。
  4. 模拟多种路径和直接检查原始数据,往往比套用复杂公式更能发现错误。
  5. 交易日志需要同时保存计划、执行、情绪和结果,以区分过程质量与随机输赢。
25

Perry Kaufman

交易系统、噪声与效率比率

档案级来源摘要2 源 / 5 观点
交易系统必须在市场噪声、趋势效率、响应速度和交易成本之间做工程化权衡。
  1. 价格效率比率用方向性净变化与路径噪声之比刻画趋势质量。
  2. 更快系统响应及时但换手和假信号更多,更慢系统稳健但滞后。
  3. 规则要跨市场测试,依靠组合分散而不是为单一市场精调。
  4. 波动率、仓位、止损和相关性共同构成系统风险控制。
  5. 商业套期保值、期货与股票系统共享规则框架,但成本和数据结构不同。
26

Kathryn Kaminski

危机阿尔法与趋势跟踪

档案级来源摘要2 源 / 5 观点
趋势跟踪的价值不只是平均收益,而是在市场长期单向失衡和危机期间提供凸性与危机Alpha。
  1. 趋势跟踪通常在持续、跨市场的价格移动中获利,在反转和震荡中付出成本。
  2. 危机Alpha应按危机阶段、方向和速度分析,不能只用单一年度相关性。
  3. 跨资产分散使趋势系统不依赖预测某一种宏观危机。
  4. 短期和长期趋势信号的危机表现、换手与反转风险不同。
  5. 策略评估应覆盖危机前、危机中和修复期,而非只看总体夏普率。
27

Andreas Clenow

趋势、股票动量与实现

档案级来源摘要2 源 / 5 观点
专业趋势跟踪的核心规则并不神秘;真正难点是跨市场组合、风险归一化、连续合约和长期执行。
  1. 大多数CTA趋势系统共享相似的方向逻辑,差异主要来自组合和实施细节。
  2. 期货应按波动率调整仓位,使不同合约贡献可比较的风险。
  3. 跨资产分散和长期执行比寻找完美入场点重要。
  4. 连续期货、换月、点值和回测成本必须按真实合约处理。
  5. 简单规则可复制策略形态,但资金规模、保证金、基础设施和纪律构成实际门槛。
28

王琛

A股多源因子、另类数据与组织迭代

档案级来源摘要2 源 / 5 观点
量化优势会随数据和技术普及快速衰减,因此组织必须把数据、算法、交易实现和风险系统做成持续进化的实验室。
  1. 新数据和新技术会创造短期红利,也会因竞争使用而回归正常风险收益。
  2. 数据、算法和交易实现需要内部实验室协同,而不是三个孤立团队。
  3. 风险既要自动监控报警,也要由人工应急并持续更新模型。
  4. A股热点与交易规则变化要求风险预算和模型快速识别制度状态。
  5. 量化长期有助于市场多样性、流动性和价格发现,但机构必须管理容量与同质化。
29

Larry Harris

市场微观结构、交易成本与交易规则

档案级来源摘要2 源 / 5 观点
市场数据是不同动机交易者在规则、信息和流动性约束下互动的结果;订单类型和成本决定价格如何形成。
  1. 交易者可按信息、流动性、时间与代理动机分类,不同类型在订单流中留下不同痕迹。
  2. 点差、市场冲击、机会成本和未成交风险共同组成执行成本。
  3. 限价单以未成交风险换取价格改善,市价单以价格让步换取立即成交。
  4. 交易规则、最小报价单位和市场结构会改变流动性供给与价格发现。
  5. 评估执行不能只看成交价,还要相对决策时价格、到达价和后续价格衡量。
30

裘慧明

A股机器学习、多频策略与量化流程

档案级来源摘要2 源 / 5 观点
量化是前沿技术与市场理解的结合;完整生产链从数据到交易执行,任何单层升级都不能替代长期人才和基础设施投入。
  1. 量化研究可拆为数据收集、清洗、特征、模型、组合、回测和交易执行七个环节。
  2. 仅采集和挖掘数据不足以发现规律,模型必须结合金融逻辑与市场结构。
  3. 量化更常使用公开结构化和价量数据,主观投资更依赖深度基本面,两者并非对立。
  4. 从线性模型到机器学习和深度学习,方法变化但寻找可持续有效价格的目标不变。
  5. 策略研发需要长期投入人才、算力、数据和交易技术,短期扩张不能替代投研能力。
31

Eugene F. Fama

有效市场、资产定价与长期收益证据

档案级来源摘要2 源 / 5 观点
价格是否有效不能脱离联合假设判断;任何异常都同时检验市场效率与所选资产定价模型。
  1. 市场效率是关于信息如何进入价格的可检验命题,不是价格永不偏离。
  2. 异常收益判断依赖基准模型,错误基准会制造伪异常。
  3. 长期截面研究需要稳定的公司、收益和组合构造档案。
  4. 规模与价值等经验规律应在不同样本和时期复核。
  5. 数据清洗、退市收益和样本边界会直接改变经验结论。
32

Kenneth R. French

因子数据、组合排序与国际资产定价

档案级来源摘要2 源 / 5 观点
因子不是一个回归标签,而是从可复算股票池、断点、权重和再平衡规则生成的组合时间序列。
  1. 因子数据必须同时给出形成规则、频率、地区和更新日期。
  2. 价值、规模、盈利与投资因子应配套底层排序组合用于诊断。
  3. 全球研究不能把美国断点机械复制到每个市场。
  4. 历史数据更新会引入回溯修订,研究需保存下载版本。
  5. 月度、年度与日度因子不能在未对齐形成期时混用。
33

John H. Cochrane

贴现率、风险溢价与资产定价理论

档案级来源摘要2 源 / 5 观点
价格—股利比与未来收益、现金流增长由现值恒等式连接;数据解释必须在这一约束内闭合。
  1. 收益可预测性往往反映时变贴现率而非可轻易套利的错误定价。
  2. 因子模型应解释共同风险与定价误差,而非只追求样本拟合。
  3. 跨资产证据能约束单一股票市场故事。
  4. 宏观状态变量和长期收益要在一致时间尺度上建模。
  5. 理论、估计和经济量级必须同时成立。
34

Robert J. Shiller

长期估值、行为金融与历史序列

档案级来源摘要2 源 / 5 观点
短样本会把制度、通胀和估值周期误当常态;理解市场需要跨世纪且口径透明的历史序列。
  1. 长期估值指标需要价格、盈利、股息与通胀在同一历史口径下对齐。
  2. 高估值更适合讨论长期预期回报,不是精确短期择时器。
  3. 市场波动无法仅由未来现金流变化解释。
  4. 调查与叙事数据补充价格数据,帮助识别投资者预期。
  5. 房地产、债券和股票的长期数据可用于检验跨资产估值关系。
35

Richard H. Thaler

行为金融、有限理性与选择架构

档案级来源摘要2 源 / 5 观点
市场参与者并非无摩擦优化器;有限注意、心理账户和制度默认项会在行为数据中留下系统痕迹。
  1. 异常研究应提出具体行为机制而非事后贴心理标签。
  2. 有限套利使行为偏差可能长期保留在价格中。
  3. 投资者分组和制度环境会改变同一信号的效果。
  4. 调查、账户与交易行为数据能检验价格数据无法区分的机制。
  5. 选择架构与披露方式本身可能改变数据生成过程。
36

William F. Sharpe

资本资产定价、风格分析与风险预算

档案级来源摘要2 源 / 5 观点
组合评价必须把回报放回承担的风险和可复制基准中,单独的收益率没有决策含义。
  1. 风险调整收益依赖一致的频率、无风险利率和收益分布假设。
  2. 历史持仓风格可通过基准收益暴露进行估计。
  3. 资产配置与主动选择应分开归因。
  4. 同一夏普比率可能隐藏不同尾部风险和路径依赖。
  5. 预测输入的不确定性应传导到组合权重而非被点估计掩盖。
37

Andrea Frazzini

实证因子、可交易组合与公开数据集

档案级来源摘要2 源 / 5 观点
可相信的因子必须跨地区、跨资产、跨定义成立,并在真实融资、换手与交易约束下保留收益。
  1. 价值和动量应在全球市场以统一但本地适配的口径复核。
  2. 低贝塔异象与融资约束相关,组合杠杆不可忽略。
  3. 质量因子需要将盈利、增长、安全和分红等维度透明组合。
  4. 因子数据应公开构造说明和更新序列。
  5. 净收益评价必须纳入换手、容量与借券条件。
38

Tobias J. Moskowitz

动量、共同因子与体育分析

档案级来源摘要2 源 / 5 观点
稳健现象应跨市场、跨资产与跨场景重复出现;共同结构比单一市场的高拟合系数更有说服力。
  1. 时间序列动量需要跨多个期货市场和长历史检验。
  2. 共同因子可从资产间协同变化中识别。
  3. 交易成本和危机期表现是动量策略的核心数据字段。
  4. 自然实验可帮助区分技能、运气与选择偏差。
  5. 样本外和跨领域重复是抑制数据挖掘的关键。
39

Bryan T. Kelly

机器学习资产定价、文本与高维因子

档案级来源摘要2 源 / 5 观点
机器学习的价值在于把高维信号压缩为样本外风险与收益预测,同时保持经济约束和严格验证。
  1. 高维特征比较应使用统一滚动样本外协议。
  2. 非线性模型的增益要相对简单基准和经济量级评估。
  3. 文本嵌入与新闻信号需要时间戳、版本和泄漏审计。
  4. 模型解释可通过特征重要性与定价核结构连接。
  5. 预测能力必须在交易成本和组合约束后复核。
40

Dacheng Xiu

高维统计、机器学习与金融计量

档案级来源摘要2 源 / 5 观点
金融预测是弱信号、高维度和强依赖共存的问题;模型必须用适合数据生成过程的统计推断来约束。
  1. 机器学习资产定价应在滚动样本外比较预测与组合表现。
  2. 数千个Alpha同时检验时需要控制选择和相关结构。
  3. 高频协方差估计必须处理噪声、异步与跳跃。
  4. 弱信号可通过结构化降维和集成提高稳定性。
  5. 大语言模型用于收益预测时必须冻结语料时间并审计前视信息。
41

Guofu Zhou

预测组合、贝叶斯收缩与模型不确定性

档案级来源摘要2 源 / 5 观点
收益可预测性非常弱,最优组合不能把单一模型的点预测当真值;收缩、组合预测与经济约束更重要。
  1. 多预测变量环境需要收缩以抑制样本噪声。
  2. 预测模型应按样本外效用而非仅按统计显著性比较。
  3. 组合预测可降低单模型选择风险。
  4. 参数不确定性应进入权重和风险预算。
  5. 宏观变量与技术信号可在统一预测框架内比较。
42

Kewei Hou

q因子、异常复制与全球资产定价

档案级来源摘要2 源 / 5 观点
异常是否真实,应在统一数据、统一定义和统一统计门槛下批量复制;零散成功案例不能代表因子宇宙。
  1. 异常复制必须统一样本、断点、持有期和显著性标准。
  2. 投资与盈利能力因子可由企业投资理论约束。
  3. 大量已发表异常在严格复现下会显著衰减。
  4. 微盘股与交易摩擦可能放大学术组合收益。
  5. 国际与中国样本能检验因子机制的普适性。
43

Emanuel Derman

金融模型、模型风险与量化职业伦理

档案级来源摘要2 源 / 5 观点
金融模型是帮助思考的有损类比,不是自然定律;数据拟合不能消除结构性模型风险。
  1. 每个模型都应声明目的、假设、校准数据和失效区域。
  2. 漂亮公式不能替代对交易机制和产品条款的理解。
  3. 校准误差与结构误差必须分开管理。
  4. 外推到未观察制度或尾部状态时应降低信任。
  5. 模型使用者有责任向决策者解释不确定性。
44

Paul Wilmott

数量金融教育、衍生品与模型批判

档案级来源摘要2 源 / 5 观点
数量方法必须可解释、可质疑并与交易常识对照;复杂度不是质量的代理变量。
  1. 衍生品模型应从产品现金流和对冲问题出发。
  2. 校准得到的参数不一定具有稳定经济含义。
  3. 数值实现、边界条件和离散误差同样属于模型。
  4. 模型风险应通过多模型比较和情景测试暴露。
  5. 教育资料和公开讨论有助于发现行业共同误区。
45

Jean-Philippe Bouchaud

市场微观结构、复杂系统与金融风险

档案级来源摘要2 源 / 5 观点
金融市场是相互作用主体构成的复杂系统;重尾、长记忆和市场冲击是数据事实,不应被高斯假设抹平。
  1. 订单流具有长记忆,但价格仍可因流动性适应保持近似不可预测。
  2. 市场冲击是执行和组合容量的核心状态变量。
  3. 收益重尾要求超越方差的风险刻画。
  4. 模型应先复现稳健经验事实,再谈微观解释。
  5. 大规模逐笔数据可检验交易者互动的集体现象。
46

Rama Cont

系统性风险、订单簿与金融网络

档案级来源摘要2 源 / 5 观点
价格、流动性与系统性风险来自网络互动和反馈;单资产静态分布无法描述危机传播。
  1. 订单簿状态比单一成交价包含更直接的短期流动性信息。
  2. 市场冲击与订单簿不平衡需联合建模。
  3. 金融网络中的共同敞口会放大冲击。
  4. 压力测试应模拟反馈、违约和流动性螺旋。
  5. 高频模型要区分统计预测与可执行决策。
47

Petter N. Kolm

量化投资工程、机器学习与市场微观结构

档案级来源摘要2 源 / 5 观点
量化策略是数据、预测、优化、执行和监控的端到端系统,任何局部指标都必须经过全链路验证。
  1. 机器学习信号应在组合与交易成本层面评价。
  2. 非平稳市场要求滚动训练和漂移监控。
  3. 替代数据需要实体映射、时间对齐和许可治理。
  4. 组合优化必须处理估计误差与约束。
  5. 研究代码到生产代码的差异是重要操作风险。
48

Tucker Balch

机器学习交易、强化学习与市场仿真

档案级来源摘要2 源 / 5 观点
交易智能体必须在有摩擦、会反馈的市场环境中学习;离线预测精度不等于策略价值。
  1. 课程化研究应让数据、特征、学习器、组合和模拟器可复算。
  2. 强化学习奖励必须包含成本、风险和持仓约束。
  3. 训练与测试按时间切分,不能随机打乱金融序列。
  4. 多智能体互动可能改变价格与流动性。
  5. 仿真用于压力测试时要校准关键经验事实。
49

Yves Hilpisch

Python量化、计算金融与AI工程

档案级来源摘要2 源 / 5 观点
量化研究的可信度取决于可执行代码、可重建环境和数据接口;文字公式只是实现的一部分。
  1. 研究示例应同时保留数据、环境、代码和结果。
  2. 向量化、并行和云计算选择应由数据规模与延迟需求驱动。
  3. API数据需要缓存、重试和版本记录。
  4. 机器学习金融应用要把样本外与交易成本作为默认协议。
  5. 生产部署需分离研究权限、交易密钥与运行监控。
50

John C. Hull

衍生品、风险管理与模型教学

档案级来源摘要2 源 / 5 观点
衍生品数据必须围绕无套利、现金流、波动率曲面和风险暴露组织,而不是孤立的行情字段。
  1. 期权价格需要标的、利率、股息、到期和合约条款统一对齐。
  2. 隐含波动率曲面比单一波动率更接近市场状态。
  3. 模型校准需检查静态套利与跨期限一致性。
  4. 交易对手信用风险和抵押品会改变估值。
  5. 压力情景与敏感度共同构成风险管理数据层。
51

Carol Alexander

市场风险、加密资产与量化金融教育

档案级来源摘要2 源 / 5 观点
风险度量必须尊重资产类别特有的数据生成机制;把传统市场假设直接搬到新市场会产生系统误判。
  1. 波动率和相关性模型需按持有期与市场制度选择。
  2. 加密市场数据要处理交易所碎片化、稳定币计价和全天候交易。
  3. 衍生品曲面提供尾部与风险中性分布信息。
  4. 风险模型应同时进行回测、压力测试和模型比较。
  5. 教育性数据集和案例可提高方法复现性。
52

Attilio Meucci

组合风险、估计风险与多元统计

档案级来源摘要2 源 / 5 观点
组合决策的核心不是寻找唯一正确分布,而是把估计不确定性、非线性风险和主观观点一致地映射到仓位。
  1. 概率模型应区分不变量、状态变量与观测价格。
  2. 协方差估计需要收缩、稳健化和有效样本量诊断。
  3. 风险因子映射应保留非线性与尾部暴露。
  4. 观点融合要显式表达信心水平。
  5. 组合优化结果必须通过扰动和情景分析检验稳定性。
53

Igor Tulchinsky

分布式Alpha研究、人才网络与工业化量化

档案级来源摘要2 源 / 5 观点
Alpha会衰减,研究产能来自全球人才、海量数据、标准化评估和持续组合,而非少数不可复制的明星想法。
  1. Alpha应被视为可标准化评估和组合的预测信号。
  2. 分布式研究需要统一数据字典、表达式和回测协议。
  3. 海量候选信号要求自动去重、相关性与稳健性筛选。
  4. 人才覆盖和数据覆盖共同扩大可搜索问题空间。
  5. 研究平台必须在开放协作与知识产权之间设定清晰边界。
54

Zura Kakushadze

公式化Alpha、风险模型与大规模信号工程

档案级来源摘要2 源 / 5 观点
Alpha研究应尽量落成明确公式、输入字段和组合规则,才能批量比较、去相关与复现。
  1. 公式化Alpha需要明确开高低收量、行业和时序算子的精确定义。
  2. 大量Alpha的组合重点是相关结构和稳定性而非单项峰值。
  3. 风险模型可从持仓与收益数据反向构造。
  4. 短周期信号对数据清洗和执行假设高度敏感。
  5. 公开公式有助于检验结果对市场、时期和成本的迁移性。
55

Michael Isichenko

统计套利、量化组合与工业研究

档案级来源摘要2 源 / 5 观点
统计套利不是单一预测模型,而是从数据清洗到组合、执行、监控和组织迭代的工业系统。
  1. Alpha通常是低信噪比预测,价值来自大规模组合。
  2. 风险中性化不能替代对预测来源的理解。
  3. 交易成本模型应随流动性、订单规模和市场状态变化。
  4. 研究绩效需要区分信号、组合构造与执行贡献。
  5. Alpha衰减要求持续研究和生产监控。
56

Robert Litterman

Black-Litterman、风险预算与气候风险

档案级来源摘要2 源 / 5 观点
组合不应从噪声均值直接优化;先建立市场均衡基准,再以显式信心融合观点和长期风险。
  1. 均衡隐含收益为不稳定的历史均值提供稳健起点。
  2. 主观观点必须同时给出方向、相对关系和置信度。
  3. 协方差与风险厌恶共同决定观点对权重的影响。
  4. 情景与长期结构风险应进入资本配置。
  5. 气候风险具有难以由短历史样本估计的尾部与转型维度。
57

Stefan Nagel

投资者预期、机器学习与流动性

档案级来源摘要2 源 / 5 观点
资产价格取决于投资者如何学习和形成预期;经历、记忆与市场状态是必须观测的数据。
  1. 个人宏观经历会系统影响其通胀与收益预期。
  2. 预期数据可帮助区分现金流消息与贴现率变化。
  3. 机器学习用于策略风险解释时应保持样本外与经济约束。
  4. 流动性在危机期具有共同因子结构。
  5. 调查、持仓和价格数据的联结能识别预期形成机制。
58

Yacine Aït-Sahalia

高频金融计量、跳跃与市场微观结构

档案级来源摘要2 源 / 5 观点
高频数据并非观测得更密就更接近真值;微观结构噪声、异步和跳跃要求专门的统计推断。
  1. 高频波动率估计必须处理微观结构噪声。
  2. 异步交易会偏置跨资产协方差估计。
  3. 连续波动与价格跳跃需要统计分离。
  4. 做市速度的价值取决于订单流、逆向选择和竞争。
  5. 高频可预测性需要严格样本外和交易成本验证。
59

Stefano Giglio

宏观风险、崩盘风险与气候金融

档案级来源摘要2 源 / 5 观点
难以观测的长期风险可以从不同期限、不同资产的价格与文本信号中交叉识别。
  1. 崩盘风险、宏观不确定性和气候风险需要分别构造代理变量。
  2. 长期合约与房地产可提供远期风险定价信息。
  3. 气候新闻指数必须冻结语料和分类规则。
  4. 对冲组合应检验是否在风险事件中真正支付。
  5. 跨资产证据可降低单一市场代理变量的测量误差。
60

Leda Braga

系统化宏观、趋势跟踪与另类市场

档案级来源摘要2 源 / 5 观点
系统化投资由可测量规则、分散市场、稳健风险控制和持续技术投入驱动,主观干预不应随意覆盖模型。
  1. 趋势与宏观策略需要跨市场分散以降低单一制度依赖。
  2. 研究、技术和交易是一个协同生产系统。
  3. 替代数据与电子交易持续扩展可交易机会。
  4. 模型干预应通过研究流程而非临场情绪完成。
  5. 另类市场和中国商品需要本地合约、流动性与交易制度数据。
ANSWER-READY SUMMARY

这套证据库能回答什么?

A股量化最先要补什么数据?

先保证证券主数据、交易日历、复权、财报PIT和可成交成本,再根据策略追加L2、另类数据与自建实盘反馈。

为什么前5位单独做角色Agent?

他们公开材料更密、方法边界更清晰,且五种框架在实验验证、因子实证、系统控制、跨市场证据和A股生产工程上互补。

“全量观点”是什么意思?

指本轮已收集并允许公开转述的全部观点;不声称穷尽人物一生作品,也不包含付费墙或不可索引内容。