← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客25 Sep 2018来源: traffic.libsyn.com主持: Patrick O'Shaughnessy

Jeremiah Lowin – Machine Learning in Investing – [Invest Like the Best, EP.105]

一句话导读

这篇访谈讲的是机器学习在投资里到底怎么用。作者认为,机器学习只是强化版的线性回归,能发现复杂规律,但金融数据是随时间变化的,很容易用错。他特别提醒,别拿复杂模型去解决简单问题——就像拿电锯切黄油。他建议从自己最懂的小问题入手,用机器学习辅助判断,而不是替代人。重点提到:数据质量才是真正的优势,买别人都有的公开数据集很难赚钱;要小心“数据泄漏”,也就是模型无意中看到了未来的信息;还要注意“42问题”——很多人忙着找答案,却根本没搞清楚自己问的是什么。

AI 摘要AI 生成 · 可能有误 · 以原文为准

本期《Invest Like the Best》邀请前量化风控专家、Prefect创始人Jeremiah Lowin,探讨机器学习在投资中的应用。核心观点是:机器学习虽强大,但常被过度炒作,尤其不适合非平稳时间序列的金融市场预测。他强调数据质量与特征工程是超额收益的关键,而非模型复杂度。重要结论包括:训练需严格区分训练集、测试集与验证集;标签构建(label formation)不可忽视;树模型(如随机森林)是通用性最强的工具;超参数调优需谨慎,避免过拟合。Lowin指出,许多量化模型失败源于忽视时间序列的平稳性假设与数据泄漏,建议从简单模型起步,逐步引入机器学习。

全文约 10 分钟 · 12 个章节
深度解读

本期速览

前量化风控专家、Prefect创始人Jeremiah Lowin与主持人Patrick O'Shaughnessy探讨机器学习在投资中的应用。核心判断:机器学习只是"强化版线性回归",擅长发现复杂相关性,但金融市场的时间序列特性使其极易被误用。Lowin强调,数据质量与特征工程才是超额收益的真正来源,模型复杂度往往适得其反。


机器学习:工具选择决定成败

Jeremiah Lowin认为,机器学习工具常被过度使用,许多人"拿着电锯去切黄油"。他直言AI本质上很笨——"它们就像小狗,只能做少数几件事,有时做得够好能生存"("They're like puppies. They can do a small number of things, and sometimes they can do them well enough to survive.")。AI唯一擅长的是发现数据中的复杂相关性,这相当于人类的"经验"。

关键区分:

  • 分类(Classification):输出是/否(如邮件是否为垃圾邮件)
  • 回归(Regression):输出数值关系(如股票与市场的beta系数)

Lowin指出,构建AI模型本身很容易——"只是把一堆回归模型叠在一起加一点微调",但训练才是真正困难且需要终身学习的地方


训练流程:数据分割与过拟合陷阱

Lowin强调,训练集、测试集、验证集的三层分割是防止过拟合的关键防线

数据集 用途 关键注意
训练集(Training Set) 让模型学习输入与标签之间的相关性结构 可多次使用
验证集(Validation Set) 在调参过程中评估模型表现 一旦用于调参,就不再是真正的"样本外"
测试集(Test Set) 最终评估模型真实表现 模型从未见过,仅使用一次

过拟合的经典案例:训练识别坦克的AI,所有坦克照片都在夜间拍摄,结果模型实际学会的是"判断是否为夜晚"而非识别坦克。这种"潜在相关性"(latent correlation)是机器学习中最隐蔽的错误来源。


机器学习 vs 经典金融模型:目的截然不同

Lowin认为,两者的根本差异在于目的,而非技术

  • 经典金融模型(如Fama-Macbeth回归):旨在理解参数本身——beta是多少?是否显著?是否异于零?
  • 机器学习模型:旨在产出有用预测——参数太多、太复杂,花时间判断某个参数是否显著可能是浪费时间

"一个参数可能只在看到提及尼日利亚的邮件时才起作用,其余时间都处于休眠状态。这在以平均值和标准误表达统计置信度的世界里很难捕捉。"("That parameter may turn out to only even be useful when you see an email that mentions Nigeria... It may sit dormant the rest of the time.")


非平稳性与标签构建:金融ML的两大核心难题

非平稳性(Stationarity)

股票价格是非平稳分布——亚马逊从$100涨到$1,000,模型必须随之调整。解决方案是将价格转化为收益率(returns),后者近似平稳分布(虽然后尾更厚)。

标签构建(Label Formation)

Lowin认为,在金融领域"输出并不明显"——什么构成"好交易"?持有期多长?卖出时机?组合影响?这是一个"跨时间信用分配问题"(cross-temporal credit assignment problem)。

他的核心哲学:市场并非始终可预测,只是偶尔可预测。因此,成功的ML策略需要"不仅预测市场,还要预测何时市场可以被预测"。最聪明的做法是"不玩这个游戏",转而寻找投资流程中其他更可预测的环节来部署ML。


模型分类与选择:树的通用性

Lowin将模型分为四个象限

监督学习 无监督学习
分类 逻辑回归、决策树(如垃圾邮件分类) K-means聚类(如将数据分为若干组)
回归 线性回归、神经网络(如预测beta) 自编码器等(如降维)

关于决策树/随机森林:Lowin称其为"设定即忘"(set it and forget it)模型——超参数少、表现稳定,很难找到不用它的理由。但图像识别等场景不适用,因为像素间的复杂关系需要卷积神经网络来捕捉。


数据质量:真正的竞争优势

Lowin断言,数据获取是ML投资中最关键的环节:"如果你花250美元买别人也能买到的数据集,我怀疑里面是否有250美元的价值。"("If you're buying the same data set that everyone else can buy for 250 bucks... I'd be shocked if there was $250 of value in there.")

成功实践者的共同特征:能将自己的行为、交易、研究甚至错误作为当前模型的输入,形成反馈循环。


常见陷阱与建议

Lowin总结三大常见陷阱

1. 过度工程化:用复杂模型解决简单问题(电锯切黄油)

2. "42问题":不知道自己在问什么——引用《银河系漫游指南》,人们等了数百万年得到答案"42",却发现根本不知道问题是什么

3. 数据泄漏:模型无意中"看到未来"——"我数不清有多少次听到'尤里卡',结果发现某个完全无辜的方式让计算机缓存了未来的输出"

建议:从你理解最深的简单问题开始,用ML增强而非替代人类判断。


可解释性:被高估了吗?

Lowin认为可解释性被高估了,但并非完全不可解释:

  • 大型神经网络有数十亿参数,逐一解释毫无意义
  • 从整体看,可以观察到模型在各层对数据的理解逐步深化
  • 谷歌曾因人类不断覆盖搜索算法而"解雇"了干预者——让模型自己运行反而更准确

梯度下降:从错误中学习

梯度下降是训练神经网络的核心机制——类比为从山顶滚下的大理石,每一步都沿最陡方向(梯度)下降以最小化误差。但存在局部最小值问题(陷入山谷无法继续下降),解决方案包括引入动量(momentum),让模型保持前进方向。

Lowin的总结:"搞清楚怎么最快下山固然好,但如果你发现自己爬错了山,那就麻烦了。"("It's all well and good to figure out how you're going to get down that mountain as fast as possible. But if you look around and realize you were on the wrong mountain in the first place, you've got a problem.")


提及的标的

本节未讨论具体可投资标的。


值得记住的判断

1. AI只做一件事:发现复杂相关性(Lowin)。它不思考、不推理,只是"像小狗一样"重新部署经验。理解这一点是正确使用ML的前提。

2. "拿着电锯去切黄油"是ML投资中最常见的错误(Lowin)。TensorFlow等工具让构建复杂模型太容易,但金融数据噪声大、信号弱,简单模型往往更有效。

3. 市场并非始终可预测,只是偶尔可预测(Lowin)。成功的ML策略需要"不仅预测市场,还要预测何时市场可以被预测"——最聪明的做法是"不玩这个游戏",转而寻找投资流程中其他更可预测的环节。

4. 标签构建是金融ML中最被低估的环节(Lowin)。什么构成"好交易"?这是一个"跨时间信用分配问题"——持有期、卖出时机、组合影响都使答案不明确。

5. "42问题":不知道自己在问什么(Lowin)。引用《银河系漫游指南》——人们得到答案"42"才发现根本不知道问题是什么。许多ML项目失败是因为从未正确定义要解决的问题。

6. 数据质量是真正的竞争优势(Lowin)。花250美元买来的公开数据集几乎不可能产生超额收益;成功者能将自己的行为、交易、错误作为模型输入。

7. 可解释性被高估了(Lowin)。数十亿参数的神经网络逐一解释毫无意义;谷歌曾因人类不断覆盖搜索算法而"解雇"干预者——让模型自己运行反而更准确。

8. "模型会耸肩"的能力至关重要(Lowin)。在偶尔可预测的市场中,模型必须能说"我不知道",而不是被迫输出一个答案。概率模型比确定性模型更适合金融场景。