递归自我改进 + 多模态融合:下一代 AI 量化 Agent 的两条主线
从 AQuA 到 F²Agent,2026 下半年值得关注的 4 个研究方向
过去两年,大语言模型在量化交易领域的角色完成了一次彻底的位移。
2024 年初,QuantAgent 提出"用 LLM 自举策略",业界还在讨论"AI 能不能取代量化研究员"这种宽泛命题。到了 2026 年 8 月,arxiv 上密集出现的论文 —— AQuA、F²Agent、AlphaSchema、Fin-Analyst —— 已经不再回答"能不能",而是在认真地回答"下一代该长什么样"。
如果我们把所有 2024 到 2026 的最新研究摆在一起看,会发现落地路径正在收敛到两条主线:让 Agent 自己变得更聪明 —— 递归自我改进;以及让 Agent 看得更全 —— 多模态融合。这两条线不是平行赛道,而是下一代 AI 量化系统的两条腿。少一条,就走不远。
本文基于 arxiv 2024–2026 年的 11 篇代表性论文,梳理这两条主线的技术脉络、落地证据,以及未来 12 个月最值得关注的 4 个研究方向。
一、从"训完即用"到"越用越聪明":递归自我改进成为分水岭
1.1 早期 LLM 量化 Agent 的天花板
2024 年的 QuantAgent(arxiv 2402.03755)首次系统回答了"LLM 能不能学量化"。答案是能 —— 让 LLM 从自己的回测结果中反思、迭代策略,效果确实显著。但它的天花板也很明显:策略空间是 LLM 自己生成的,既不可控,也不可解释。LLM 学到的不是"市场规律",而是"自己写得出的代码碰巧能跑赢回测的那部分"。
TradingAgents(2412.20138)用多 Agent 框架绕过了部分问题 —— 让"基本面分析师 / 技术面分析师 / 风险管理师 / 基金经理"各司其职,但本质上还是"用 LLM 模拟一个交易日的会议",没有跨时间的累积学习。
FinMem(2311.13743)是第一个严肃回答"记忆"的:分层记忆 + 性格设计,让 Agent 能跨日、跨周地保留关键信号。但它的"学习"还是被动存储 + 调用,不是主动改进。
1.2 AQuA:两条独立闭环的递归自我改进
2026 年 8 月,Mengdi Wang 团队在 arxiv 发布 AQuA(2608.12841),把这事儿往前推了一大步。
AQuA 把"递归自我改进"这件事拆成两个完全独立的子系统:
- 因子发现子系统:一个由 manager 协调的多 Agent 流水线,在封闭沙箱中不断生成符号因子、用历史 IC 评估、把验证过的证据喂回下一轮。
- 模型开发子系统:一个配置驱动的循环,在同一个沙箱里反复尝试不同的时序架构 + 超参,产出可训练的预测模型。
两个系统不共享 Agent、不共享记忆、不共享候选空间、不共享研究状态。它们各自用自己的证据闭环,推动下一轮的假设质量。
结果很硬:
- 因子子系统在加密货币宇宙上达到了 IC ≈ 0.190 的合成信号。
- 模型子系统在美股上达到 单股 IC = +0.0843,转成长短策略后样本外 Sharpe 高达 +2.50,2021–2025 五年每年正收益。
- 最关键的设计:沙箱密封,数据划分、特征定义、评估器对 Agent 全部黑盒。Agent 只能通过"受限的因子表达式"或"配置 diff"行动。
AQuA 最重要的一课不是它的数字,而是它把"自我改进"做成了可治理的研究流程。LLM 不再是"自由发挥的策略家",而是被关在密封沙箱里的研究员 —— 它能进化,但只能在指定边界内进化。
1.3 AlphaSchema:把"探索空间"从黑盒变白盒
如果说 AQuA 解决了"如何让 Agent 自我改进",AlphaSchema(2607.26642)解决的是"如何让探索可控"。
传统 LLM alpha 挖掘的最大痛点:Agent 既负责"写因子",又负责"决定下一步搜什么",探索行为是隐式的、不可控的。AlphaSchema 提出一个结构化的"交易语义空间" —— 每个候选因子都被表达为一个 schema 计划:
- Event:触发事件(突破、放量、政策)
- Context:上下文(市场状态、行业、风格)
- Qualities:性质(动量、波动、估值)
- Direction:方向(正向、反向、相对)
- Output:输出形式(信号强度、排名、二元)
LLM 只负责把"选中的 schema 计划"翻译成可执行因子,真正的探索由一个 surrogate model主导,在语义空间上做全局探索、局部利用、突变三者平衡。
在 A 股市场上的实验显示,这种结构化搜索能稳定收敛到高 reward 区域,且对 LLM 选型不敏感 —— 用 GPT 或用 Claude 实现同一 schema,得到的因子质量相当。这意味着 alpha 挖掘的质量不依赖 LLM,而依赖语义空间的合理性。
这是一条非常反共识的结论:LLM 不是 alpha 挖掘的核心,领域知识的结构化才是。
二、从"看文本"到"看一切":多模态融合正在成为标配
2.1 数据的现实:从来不只是 K 线
真实的金融决策从来不是只看 K 线。一个合格的交易员会同时看:
- 新闻 / 公告(基本面事件)
- SEC 财报、招股书(财务细节)
- 分析师研报 / 卖方观点(行业共识)
- 社交媒体情绪(散户 / 机构情绪)
- 行业图表、宏观数据图(技术信号)
- 基本面指标(PE / ROE / 现金流)
- 量价(K 线本身)
- 龙虎榜、北向资金、融资融券(A 股特有的微观结构)
过去几年,LLM 量化 Agent 的主流做法是单模态串行 —— 一个 Agent 看新闻、一个看 K 线、一个看基本面,最后由 Meta-Agent 投票。但这种方式有两个致命缺陷:
- 跨模态依赖被忽略:新闻情绪的强度,取决于当下技术面是否在关键支撑位;技术面的突破,需要基本面催化配合才能成立。"先各自处理再投票"在数学上就把这种条件依赖丢掉了。
- 噪声鲁棒性差:任何一个模态的异常输入都会直接污染最终信号。
2.2 F²Agent:多模态 agentic 融合的新范式
2026 年 8 月初,F²Agent(2608.05668)给出了一个干净的解法 —— 模态特化 Agent + 噪声鲁棒一致性正则化。
架构分两层:
- 第一层:模态特化 Agent 群。每个 Agent 只看自己最擅长的模态,提取该模态的细粒度信号。这不是"几个 LLM 看不同字段",而是"每个 Agent 内部都有一套针对该模态的预处理、嵌入、推理范式"。
- 第二层:模态感知的自适应融合。把多个 Agent 的输出用一个可学习的融合模块统一起来,融合权重根据当前市场状态动态调整 —— 牛市中技术面信号权重自动提高,财报季基本面信号自动占优。
- 关键正则项:噪声鲁棒一致性。强制不同 Agent 在"加入相同类型噪声"的条件下仍能给出稳定方向,过滤掉容易被噪声翻转的弱信号。
实验结果:
- 6 个股票 + 加密资产,击败 16 个 baseline。
- 平均年化收益相对提升 20%+。
- GOOG 收益 120.48%,TSLA 收益 148.41%。
这两个数字不是"在精心挑选的子集上跑出来的",而是在所有测试资产上一致出现。这意味着多模态融合不是"在某些标的上有用",而是结构性提升。
2.3 Fin-Analyst:8 个专家 Agent 的真实部署
如果说 F²Agent 还在学术验证,Fin-Analyst(2607.12233)就是真实市场 + 真实部署 + 真实排名的硬证据。
Fin-Analyst 参加的是 FinMMEval 2026 Task 3,任务是在 2026 年上半年对 TSLA(股票) 和 BTC(币) 做日级 long/flat/short 决策。这是一个实盘 leaderboard,不是回测。
架构:
- 8 个 LLM 专家 Agent,每个负责一种信号源:新闻、SEC 文件、基本面、分析师预测、技术指标、社交情绪、宏观、订单流。
- 1 个 Meta-Agent,用规则 + 加权投票聚合。
- BTC 上加了一个轻量级规则三信号投票(LLM 在低波动行情下容易过度反应,规则更稳)。
最终成绩(2026-07-05 官方榜单):
- TSLA 第一名:+13.51% 收益,Sharpe 4.10,胜率 88%,跑赢买入持有 28.33 个百分点。
- BTC 持平但大幅跑输基准(BTC 在测试窗口大跌,Agent 没止损,但至少没爆)。
更重要的是他们的消融实验和错误分析:
- 8-K 财报披露事件驱动的信号对 TSLA 贡献最大 —— 印证"事件驱动 + LLM"是当前最有效的组合。
- 无记忆的 Agent 会连续几天重复同一错误决策 —— 这正是 2024 年 FinMem 预测的"记忆问题"的实战证据。
- 固定阈值的 BTC 规则在低波动市被噪声反复触发,而 LLM 流水线在同一条件下反而盈利 —— LLM 不是"看不懂横盘",而是"用错了规则"。
这些结论直接指向下一阶段的研究重点:记忆机制 + 多模态融合的协同。
三、当两条主线交汇:下一代 AI 量化 Agent 的 4 个方向
把"递归自我改进"和"多模态融合"放在一起看,会自然浮现下一代系统的形态:既看得广(多模态融合),又学得快(递归自我改进),还能记得住(分层记忆),并且能验证(形式化正确性)。
下面 4 个方向,是 2026 下半年最值得押注的。
方向 1:多模态 + 递归自我改进的协同架构
当前论文里,这两条主线基本是分离的 —— AQuA 是纯时序数据的因子 + 模型迭代,F²Agent 是多模态但缺乏跨时间的累积学习。下一阶段必然出现:多模态 Agent 在沙箱里做月度 / 季度的"研究-回测-反思"闭环,把多模态融合信号作为 Agent 可操纵的"信号工厂",而不是固定管道。
具体可能形态:一个模态特化 Agent 群提供"信号素材库",一个递归改进的 Manager Agent 每月基于新证据重新设计融合权重,并把验证后的融合策略写回信号库。
方向 2:从"性能排名"到"trace 诊断"的评估范式转移
Can Agentic Trading Systems Pay for Their Own Intelligence?(2607.10286)这篇 2026 年 7 月的论文提出了 TradeLens,一个 trace-grounded 的诊断工具集。
它的核心观点非常犀利:别再看 agent 的总收益,要看每笔决策花了多少 token、赚到多少钱。把 agent 的"推理成本"作为运营成本,和"决策归因利润"做精确对账。
实验揭示了一个反共识事实:不同 LLM 的失败模式完全不同 —— DeepSeek-V3.2 资产选择差,GLM-4.7 时机判断为负。这意味着:
- "能力榜单"(哪个 LLM 收益高)在 agent 时代不是好的评估方式。
- 真正重要的是 intelligence-to-profit conversion(智力-利润转化率)。
- 一个成本低、命中率高的轻量 Agent,完全可能跑赢成本高但决策归因更差的重 Agent。
未来 12 个月,业界很可能从"我用什么 LLM"转向"我的 agent 每块钱的 token 赚到多少钱"。
方向 3:记忆机制成为标配,且与多模态深度耦合
Fin-Analyst 的错误分析已经说得很直白:memoryless agents repeat wrong calls for days at a time。
下一代 Agent 的记忆不会是 FinMem 的简单分层(短期 / 中期 / 长期),而会是多模态嵌入空间上的检索式记忆 —— 把过去 30 天的"新闻摘要 + 对应当时 K 线 + 后续 5 日实际走势"作为一个三元组存进向量库,当下遇到相似新闻时,Agent 不只是"看到相似文本",而是"看到相似情境"。
这一步的关键不是工程实现(向量数据库已经成熟),而是记忆写入的策略 —— 什么值得记、什么该忘、记忆之间怎么冲突时如何裁决。
方向 4:形式化正确性 —— 防 look-ahead bias 的可验证系统
Look-Ahead-Freedom as Temporal Non-Interference(2607.04958)是一篇非常重要的"元研究" —— 它把量化领域最隐蔽的 bug look-ahead bias(在第 t 天的决策里偷偷用了第 t+1 天的信息)形式化为"时序非干扰性"。
这是个被严重低估的问题:agent 越强大,越容易在工具调用过程中偷偷引入未来信息。比如,一个"基本面分析 Agent"调用的财报数据库,如果接的是"最新可得版本"而不是"截至决策时点的快照",它就在偷看未来。
论文给出的是:一套类型与效果系统,在线性时间内可判定一个回测 / Agent 流水线是否 look-ahead-free。在 agent 时代,这种流水线层面的形式化校验会和单元测试一样,成为量化 Agent 上线前的硬门槛。
四、对从业者的启示
如果你正在评估是否要用 AI Agent 改造自己的量化流程,2026 年下半年的几个明确信号:
- 单 Agent 不要再做了。无论 LLM 多强,单 Agent 在面对真实市场时一定会输给一个 5–10 个 Agent 协作的中等规模流水线,因为真实决策本来就是分工的。
- 多模态是结构性提升,不是边际优化。F²Agent 的 +20% 年化收益不是某个调参巧劲,是"跨模态条件依赖被建模"的结构性红利。不做多模态,等于在起跑线上就让了一截。
- Agent 必须有"研究记忆"。如果你的 Agent 第二天不记得第一天的判断,它在震荡市一定会亏。
- 别再只盯总收益。TradeLens 揭示的"智力成本 / 决策利润"对账才是关键。一个成本对半、收益只差 5% 的轻量 Agent,运营上是吊打重 Agent 的。
- 形式化校验必须有。一个会调数据库的 Agent 流水线,必须接受 look-ahead-free 的形式化检查,否则你永远不知道回测里有没有藏 bug。
五、写在最后
2024 年的"AI 量化"还停留在"LLM 能不能读新闻 + 写代码 + 调回测"的演示阶段。2026 年的 AI 量化,已经在拼多 Agent 协作、递归自我改进、多模态融合、分层记忆、可验证正确性这五件硬功夫。
从 AQuA 在美股 5 年正收益的 Sharpe 2.50,到 F²Agent 的 GOOG 120%、TSLA 148%,再到 Fin-Analyst 的 TSLA 实盘 +13.51% —— AI Agent 已经不是在证明"能不能",而是在用真金白银证明"以什么形态能"。
下一代 AI 量化系统的轮廓已经清晰:既看得广,又学得快,还能记得住,并且可被验证。这四条主线,任何一条单独都不够;四条叠加,就是 2026 下半年之后所有头部量化实验室要押注的方向。
📚 参考论文
- AQuA: Recursively Self-Improving Quantitative Trading Research Agents — arxiv 2608.12841 (2026-08-13)
- F²Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading — arxiv 2608.05668 (2026-08-06)
- AlphaSchema: Exploring the Space of Trading Semantics for LLM-Based Alpha Mining — arxiv 2607.26642 (2026-07-29)
- Fin-Analyst at FinMMEval 2026 Task 3: A Live Hybrid Trading Agent — arxiv 2607.12233 (2026-07-14)
- Can Agentic Trading Systems Pay for Their Own Intelligence? — arxiv 2607.10286 (2026-07-11)
- Look-Ahead-Freedom as Temporal Non-Interference — arxiv 2607.04958 (2026-07-06)
- QuantAgents: Multi-agent Financial System via Simulated Trading — arxiv 2510.04643 (2025-10-06)
- TradingAgents: Multi-Agents LLM Financial Trading Framework — arxiv 2412.20138 (2024-12-28)
- QuantAgent: Seeking Holy Grail in Trading by Self-Improving LLM — arxiv 2402.03755 (2024-02-06)
- FinMem: Performance-Enhanced LLM Trading Agent with Layered Memory and Character Design — arxiv 2311.13743 (2023-11-23)
- Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading — arxiv 2608.11232 (2026-07-31)
