BlackCat

Paper reading 4 min read

ALPHABENCH: BENCHMARKING LARGE LANGUAGE MODELS IN FORMULAIC ALPHA FACTOR MINING

论文笔记:AlphaBench —— 在公式化 Alpha 因子挖掘的完整工作流中,大语言模型适合扮演什么角色:因子公式生成器、不做回测的因子评审员、接收回测反馈不断提出新候选的搜索器。

研究的问题:

在“ Alpha 因子挖掘”的完整工作流中,大语言模型究竟适合扮演什么角色?"

三个角色:

  • 因子公式生成器
  • 不看数据、不做回测的因子评审员
  • 接收回测反馈、不断提出新候选的搜索器

理解Alpha Factor:

Alpha Factor 是一个用量化指标(历史价格 成交量)等等有数据的量化指标 计算出来的一个数学表达

例如 动量因子:
$$
f_{i,t} = \frac{Close_{i,t}-Close_{i,t-20}}{Close_{i,t-20}}
$$

Qlib DSL中:
Div(
Sub($close, Ref($close, 20)),
Add(Ref($close, 20), 1e-12)
)

每天对所有股票计算因子的值,然后根据因子值从高到低排名。之后可以构造一个多空组合:

买入因子值高的股票;
卖出或者低配因子值低的股票。

这是因为因子可能与股价上涨有正相关 值高则上涨的相关性更高 负相关则相反
背后也可以有类似的金融逻辑解释
动量因子这里 使用 当前收盘价-20天前的收盘价/(20天前的收盘价) 这里算的是 新的收盘价上涨的幅度相较于20天前的收盘是百分之多少
这里可以合理解释为
价格上涨多 -> 市场认为其上涨动力强 -> 更多人追高 -> 价格可能继续上涨

如何判断因子有没有预测力呢

论文当中使用 IC (Information coefficient):
$$
IC_t = Corr_i(f_{i,t},r_{i,t+1})
$$

IC的数值理解为
IC > 0 : 因子和股价是正相关,越高相关性越高
IC = 0 : 完全的无相关
IC < 0 : 因子和股价是负相关,越负负相关性越高

ICIR (Information Coefficient Information Ratio) 是预测能力的稳定性

  • RankIC
  • Win Rate
  • Skewness

论文中建立了什么benchmark

任务 给 LLM 的输入 LLM 要输出什么 实际测量的能力
Factor Generation 自然语言因子描述或主题标签 可执行的因子表达式 是否能把金融意图翻译成 DSL
Factor Evaluation 一个或一组因子公式 分数、标签或排序 是否能不经回测判断因子质量
Factor Searching 种子因子、搜索历史、回测结果 改进后的候选因子 是否能利用反馈搜索更好的因子

Factor Searching 解释一下 也就是在无穷的组合空间里面搜索一个更好的因子
原始因子 -> 反馈IC ICIR -> 改不同的东西 -> 新IC 新ICIR -> 不同搜索看看能不能改进一个更好的因子

prompt+Operator Library → LLM → Generated Factors→ Qlib Backtest→ Metrics→ Further Search

Factor Generation:
分成两个子任务

  • Text2Alpha
  • Directional Mining

Text2Alpha

例如给一段文字描述:
Return the rolling max of close minus current close, divided by volume SMA, default window = 25.

Return Alpha Factor:
Div(
Sub(Max($close, 25), $close),
Add(Mean($volume, 25), 1e-12)
)

这个任务主要测试:

是否理解自然语言;
是否选对变量;
是否选对操作符;
是否使用正确窗口;
是否生成可解析、可执行的公式。

论文将难度分为:

Easy:单一操作或简单均值、比率;
Medium:组合价格与成交量,加入归一化;
Hard:多层组合、排名、条件逻辑、多个窗口

论文中:
例如 GPT-5 在 Text2Alpha 的 reliability 几乎一直是 1.00,但 accuracy 从:

Easy:0.99;
Medium:0.68;
Hard:0.10。

也就是说,在困难任务上,它几乎总能输出合法公式,但只有约 10% 被判定为真正满足复杂指令。

这揭示了两个完全不同的能力:

Syntax correctness:会不会写合法 DSL;
Semantic correctness:写出来的公式是不是用户真正想要的。

大模型在第一项已经很强,在第二项仍有明显问题

Directional Mining

这里不要求复现一个固定公式,而是给模型一个因子方向,例如:

Momentum;
Mean Reversion;
Volume Spike;
Volatility Breakout;
Price–Volume Divergence;
Candlestick Pattern;
Crash Risk。

模型需要自行设计属于该方向的公式。

困难任务可能要求同时融合 3–5 种信号,例如:

Momentum + Volume Confirmation + Volatility Normalization + Breakout

这比 Text2Alpha 更开放,也更接近实际因子研究。

论文构建了一套包含 90 个细分类别的方向 taxonomy,覆盖:

Trend;
Momentum;
Mean Reversion;
Volume;
Volatility;
Pattern;
Relative Performance;
Seasonality;
Risk;
Microstructure Proxy。

Keep reading

View all