ALPHABENCH: BENCHMARKING LARGE LANGUAGE MODELS IN FORMULAIC ALPHA FACTOR MINING
论文笔记:AlphaBench —— 在公式化 Alpha 因子挖掘的完整工作流中,大语言模型适合扮演什么角色:因子公式生成器、不做回测的因子评审员、接收回测反馈不断提出新候选的搜索器。
研究的问题:
在“ Alpha 因子挖掘”的完整工作流中,大语言模型究竟适合扮演什么角色?"
三个角色:
- 因子公式生成器
- 不看数据、不做回测的因子评审员
- 接收回测反馈、不断提出新候选的搜索器
理解Alpha Factor:
Alpha Factor 是一个用量化指标(历史价格 成交量)等等有数据的量化指标 计算出来的一个数学表达
例如 动量因子:
$$
f_{i,t} = \frac{Close_{i,t}-Close_{i,t-20}}{Close_{i,t-20}}
$$
Qlib DSL中:
Div(
Sub($close, Ref($close, 20)),
Add(Ref($close, 20), 1e-12)
)
每天对所有股票计算因子的值,然后根据因子值从高到低排名。之后可以构造一个多空组合:
买入因子值高的股票;
卖出或者低配因子值低的股票。
这是因为因子可能与股价上涨有正相关 值高则上涨的相关性更高 负相关则相反
背后也可以有类似的金融逻辑解释
动量因子这里 使用 当前收盘价-20天前的收盘价/(20天前的收盘价) 这里算的是 新的收盘价上涨的幅度相较于20天前的收盘是百分之多少
这里可以合理解释为
价格上涨多 -> 市场认为其上涨动力强 -> 更多人追高 -> 价格可能继续上涨
如何判断因子有没有预测力呢
论文当中使用 IC (Information coefficient):
$$
IC_t = Corr_i(f_{i,t},r_{i,t+1})
$$
IC的数值理解为
IC > 0 : 因子和股价是正相关,越高相关性越高
IC = 0 : 完全的无相关
IC < 0 : 因子和股价是负相关,越负负相关性越高
ICIR (Information Coefficient Information Ratio) 是预测能力的稳定性
- RankIC
- Win Rate
- Skewness
论文中建立了什么benchmark
| 任务 | 给 LLM 的输入 | LLM 要输出什么 | 实际测量的能力 |
|---|---|---|---|
| Factor Generation | 自然语言因子描述或主题标签 | 可执行的因子表达式 | 是否能把金融意图翻译成 DSL |
| Factor Evaluation | 一个或一组因子公式 | 分数、标签或排序 | 是否能不经回测判断因子质量 |
| Factor Searching | 种子因子、搜索历史、回测结果 | 改进后的候选因子 | 是否能利用反馈搜索更好的因子 |
Factor Searching 解释一下 也就是在无穷的组合空间里面搜索一个更好的因子
原始因子 -> 反馈IC ICIR -> 改不同的东西 -> 新IC 新ICIR -> 不同搜索看看能不能改进一个更好的因子
prompt+Operator Library → LLM → Generated Factors→ Qlib Backtest→ Metrics→ Further Search
Factor Generation:
分成两个子任务
- Text2Alpha
- Directional Mining
Text2Alpha
例如给一段文字描述:
Return the rolling max of close minus current close, divided by volume SMA, default window = 25.
Return Alpha Factor:
Div(
Sub(Max($close, 25), $close),
Add(Mean($volume, 25), 1e-12)
)
这个任务主要测试:
是否理解自然语言;
是否选对变量;
是否选对操作符;
是否使用正确窗口;
是否生成可解析、可执行的公式。
论文将难度分为:
Easy:单一操作或简单均值、比率;
Medium:组合价格与成交量,加入归一化;
Hard:多层组合、排名、条件逻辑、多个窗口
论文中:
例如 GPT-5 在 Text2Alpha 的 reliability 几乎一直是 1.00,但 accuracy 从:
Easy:0.99;
Medium:0.68;
Hard:0.10。
也就是说,在困难任务上,它几乎总能输出合法公式,但只有约 10% 被判定为真正满足复杂指令。
这揭示了两个完全不同的能力:
Syntax correctness:会不会写合法 DSL;
Semantic correctness:写出来的公式是不是用户真正想要的。
大模型在第一项已经很强,在第二项仍有明显问题
Directional Mining
这里不要求复现一个固定公式,而是给模型一个因子方向,例如:
Momentum;
Mean Reversion;
Volume Spike;
Volatility Breakout;
Price–Volume Divergence;
Candlestick Pattern;
Crash Risk。
模型需要自行设计属于该方向的公式。
困难任务可能要求同时融合 3–5 种信号,例如:
Momentum + Volume Confirmation + Volatility Normalization + Breakout
这比 Text2Alpha 更开放,也更接近实际因子研究。
论文构建了一套包含 90 个细分类别的方向 taxonomy,覆盖:
Trend;
Momentum;
Mean Reversion;
Volume;
Volatility;
Pattern;
Relative Performance;
Seasonality;
Risk;
Microstructure Proxy。