从 ICLR 2026 TiMi 论文看 LLM 在量化中的真实边界

2026 年是 LLM 交易 Agent 从"营销 PPT"进入"学术审计"的转折年。ICLR 2026 录用了第一篇以 LLM 交易智能体为核心的论文 TiMi;EMNLP 2025 接受了多 Agent 框架 QuantAgents;arXiv 元综述对 77 项研究做了可复现性审计,19 项满足最低门槛但 0 项达到 R3 完全可复现;ESMA 在 2026-02 发布算法交易监管 briefing 把 AI 纳入 MiFID II 适用范围,2026-07-31 又联合 EBA/EIOPA 发布 JC 2026 25,把前沿 AI 列为 ICT 网络风险放大器;2026-08-25 德国 Scalable Capital 在欧洲首次让 ChatGPT/Claude/Grok 通过 MCP 协议直接下单——五件事在同一时间窗口里,把"LLM 能不能做量化交易"从论文、框架、监管、真实交易四个角度同时压了过来。本文沿着九份一手材料画一条清晰的边界线。

作者:美辰信息技术 · 2026-09-02 · 关键词:LLM、量化交易、Agent、ICLR 2026、TiMi、QuantAgents、FinAgent、FinMem、ESMA JC 2026 25、DORA、AI Act、MCP、Scalable Capital、可复现性、过拟合

一、2026:LLM 交易 Agent 的学术审计元年

把时间轴拉到 2025 年 10 月到 2026 年 8 月这十个月,LLM 交易 Agent 赛道同时发生了五件相互咬合的事。

第一件:ICLR 2026 录用了 TiMi。深度学习三大顶会之一的 ICLR 2026 正式录用了论文 Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading(arXiv:2510.04787,2025-10-06 v1,2026-02-09 v2,17 页 6 图),作者来自同济大学、微软亚洲研究院、复旦大学和布里斯托大学的 Zifan Song 等 8 人。TiMi 的核心论点很简洁:LLM 不应该被丢到交易所去按秒做决策,它的合理位置是"策略开发",真正去执行的是分层编程的 trading bot。这是这个领域第一次在顶会上明确说"LLM 不该亲自下单"。

第二件:arXiv:2605.19337 元综述做了一次可复现性大审计。2026-05-19 发布的 59 页综述 Agentic Trading: When LLM Agents Meet Financial Markets(作者 Yihan Xia、Panpan You、Taotao Wang 等 7 人,15 张图 27 张表)把过去三年所有嵌入 LLM 的交易系统——共 77 项——做了审计。最终只有 19 项研究满足"输出可交易动作 + 闭环评估(Action Output + Closed-Loop Evaluation)"的最低门槛,被定义为 primary empirical subset;剩下 58 项被剔除,只作为背景和设计参考。在 19 项"勉强够格"的研究里,2 项报告了时间一致分割协议,1 项报告了显式交易成本模型,1 项处理了股票池/幸存者偏差,11 项报告了执行时点或语义(T+1 vs T+0、收盘价 vs VWAP),15 项被编码为 R0(最低可复现等级),0 项达到 R3 完全可复现。一句话:架构创新很热闹,审计基础设施几乎为零。

第三件:ESMA 在 2026-02-26 发布算法交易监管 briefing,把 AI 纳入 MiFID II 适用范围。ESMA 这份 supervisory briefing 明确,即使 MiFID II 和 RTS 6 没有专门提到 AI,只要"计算机算法自动决定订单的任何单独参数",就构成 MiFID II 下的算法交易。投资公司在年度自评中必须考虑 AI 的影响,并与 AI Act(Regulation 2024/1689)对齐。这是非约束性文件,但代表了明确的监管期望。

第四件:2026-07-31 EBA/EIOPA/ESMA 联合发布 JC 2026 25,前沿 AI 被定性为 ICT 网络风险放大器。三家欧洲监管机构发布 ESAs' statement toward a consistent and risk-based approach for ICT risks from frontier AI models,这是 Joint Committee 在 ICT 风险领域的第一份 frontier AI 专项声明。声明警告,前沿 AI 模型的先进能力"显著加速网络风险的发现与利用,可能造成系统性网络风险",要求金融机构按 DORA Art. 4 把 ICT 风险管理流程按"预防—检测—管理"三策略对齐,管理层必须为该风险负责并修订风险偏好指标。文档明确不引入新规则,而是把 DORA(数字运营韧性法案)+ AI Act 这两套现行法律激活。

第五件:2026-08-25 德国 Scalable Capital 上线 Agentic Investing,让 ChatGPT/Claude/Grok 通过 MCP 直接下单。总部慕尼黑的 Scalable Capital 管理 €60B 资产、服务 6 国 100 万客户,8 月 25 日成为欧洲第一家让通用大模型在受监管零售账户里执行真实买卖订单的银行。用户激活 Agentic Investing 后,可以在 ChatGPT、Claude 或 Grok 里用自然语言下单、设储蓄计划、管理观察列表、调整限价单,底层通过 Anthropic 主导的 MCP 协议把自然语言翻译成 Scalable 经纪 API 调用。这不是预先审批的策略执行,而是一个外部概率模型实时翻译用户指令——这是 LLM 第一次在零售经纪账户里坐到执行层。

"architectural experimentation is expanding rapidly, while comparable evaluation protocols, execution semantics, and reproducible artifacts remain the field's immediate bottlenecks."
—— arXiv:2605.19337,摘要原文

本文沿着 TiMi、QuantAgents、FinAgent、FinMem、Vincent-chao-lang/quant_llm_pub、2605.19337 元综述、ESMA 2026-02 算法交易 briefing、JC 2026 25 frontier AI 声明、Scalable Capital Agentic Investing 公告这九份一手材料,回答四个问题:LLM 在量化交易里能做什么、不能做什么、可信到什么程度、监管要求是什么。

二、TiMi:把 LLM 关进"理性笼子"

TiMi 的开篇没有替 LLM 站台,它把现有 LLM 交易 Agent 的三个致命缺陷直接摆出来。

第一个:拟人化角色偏差。大多数 LLM 交易 Agent——FinAgent、FinMem——都把 LLM 包装成"基金经理""交易员"这种人设,让 LLM 在推理时无意识地引入情绪偏差,过度依赖社交媒体情绪和最新新闻,而不是结构化的价格量价数据。

第二个:持续推理成本。分钟级部署里,LLM 每秒推理一次几乎不可行——延迟和 token 成本都会击穿任何回报假设。哪怕是 GPT-4o 这样的低延迟模型,在分钟级调用下的成本也会让"高频套利"立刻变成亏本生意。

第三个:策略深度不足。"会聊天"的 Agent 不等于"会量化"。LLM 在 alpha 因子构造、风险敞口严格执行、回测协议设计这些"机械理性"环节天然弱——它能写"RSI 小于 30 时买入"的规则,但它没法告诉你 2008 年 9 月雷曼破产当天这条规则触发了多少次、每次的滑点成本是多少。

TiMi 的回应是把 LLM 关进笼子。具体做法是三层架构:

[策略开发层] LLM 做语义分析、写代码、出策略蓝图
       ↓ 蓝图不直接下单
[策略优化层] 宏观模式 → 微观定制的双层分析,产出 trading bot
       ↓ 输出可执行的代码
[部署层] 分层编程 + 数学反射 + 闭环优化 —— 代码和规则在跑,LLM 不在场

这篇论文最有价值的一句话藏在第三节脚注里:"the minute-level execution layer is operated by the layered trading bot, not by LLM real-time inference"。换句话说,即使 TiMi 这种走在最前沿的架构,作者们也不得不承认:LLM 在分钟级执行上要么太慢、要么太贵、要么太不准。这是 LLM 的本质——它是一个会"想"的模型,不是一个会"做"的系统。

实验部分则需要谨慎阅读。TiMi 声称在 200+ 交易对(股票和加密货币)上"稳定盈利",但 GitHub 上检索不到官方实现仓库,回测协议细节、交易成本模型、股票池选择规则——2605.19337 元综述要审计的核心字段——都没有披露。换句话说,TiMi 自己也没跨过 R3 复现的门槛。

三、QuantAgents:把 LLM 团队变成"虚拟对冲基金"

如果说 TiMi 的克制是"承认 LLM 不能做执行",QuantAgents(arXiv:2510.04643,2025-10-06 v1,作者 Xiangyu Li、Yawen Zeng、Xiaofen Xing、Jin Xu、Xiangmin Xu,EMNLP 2025)则是"用 LLM 模拟整个对冲基金团队"。

四个 Agent 分工明确:

  • Otto(基金经理/Manager):执行决策,所有 Agent 的输出最终汇到这里
  • Bob(模拟交易分析师/Simulated Trading Analyst):在模拟账户上验证策略,不是直接真金白银
  • Dave(风控分析师/Risk Control Analyst):评估每笔决策的风险敞口
  • Emily(市场新闻分析师/Market News Analyst):综合新闻和宏观数据输出市场报告

四个 Agent 通过三种会议协作:每周的市场分析会、每周的策略分析会(含模拟交易)、按需触发的风险预警会。整个系统装备 26 个工具、3 类记忆机制、10 个动作空间。这套架构的设计哲学和 TiMi 相反——TiMi 把 LLM 关在策略层,QuantAgents 让 LLM 直接扮演交易角色,只是用多 Agent 协商约束单个 Agent 的非理性。

QuantAgents 在 NASDAQ-100 Financial Dataset(2015-01-01 至 2023-12-31,日频 OHLCV + 60 个技术指标 + 每日新闻,数据来源 Yahoo Finance + Alpaca News API)上跑出了下面这组数字:

指标QuantAgents说明
ARR 年化收益率58.68%同期纳指约 +25%/年
三年累计总收益(TR)299.55%约 3 倍
Sharpe Ratio(SR)3.11极高
Calmar Ratio(CR)11.38回撤调整后极优
Sortino Ratio(SoR)66.94下行风险调整后极高
最大回撤 MDD16.86%极低
波动率 Vol1.43%极稳

在同一数据集上,QuantAgents 跑赢了自评 leaderboard 里的 9 个 baseline:FinAgent(ARR 45.31%/SR 2.25/MDD 38.48%)、FinMem(37.73%/1.89/40.19%)、FinGPT(36.71%/1.66/37.99%)、AlphaMix+(32.51%/1.49/40.71%)、DeepTrader(32.06%/1.27/29.16%)、SAC(22.14%/0.84/40.13%)、MV(11.30%/0.72/64.15%)、TSM(5.68%/0.64/58.36%)、ZMR(4.19%/0.63/72.89%)。LLM 类方法全面碾压传统规则/RL 基线,Sharpe 3.11 + MDD 16.86% 的组合几乎把"暴利低回撤"在美股纳指上重新实现了一遍。

但这组数字需要打三个折扣。

第一个:数据集区分度。NASDAQ-100 在 2015-2023 这个区间整体涨了约 3 倍,任何"长期持有 + 小幅择时"的策略都能跑赢——即便是被动跟踪的马科维茨(MV)也只亏 11.30% 年化。QuantAgents 的相对优势被牛市背景稀释了。

第二个:日频数据的真实性。QuantAgents 用的是 Yahoo Finance + Alpaca News API,不是交易所逐笔成交。日频回测无法捕捉真实成交价、滑点、流动性约束,对实盘是致命盲区。

第三个:独立复现缺位。GitHub 仓库(quantagents.github.io)给出的是作者团队自己的 leaderboard,业界没有第三方独立团队复现过这个 299% 的回报。作者既是运动员又是裁判——这正是 2605.19337 元综述明确点名的高风险模式。

四、FinAgent 和 FinMem:这条赛道上的两个典型样本

在 QuantAgents 之外,LLM 交易 Agent 这个赛道还有两个被广泛引用的工作值得单独看。

第一个是 FinAgent:A Multimodal Foundation Agent for Financial Trading: Tool-Augmented, Diversified, and Generalist(arXiv:2402.18485,2024-02-28 v1,2024-06-28 v3,作者 Wentao Zhang 等 13 人)。它把 LLM 设计成一个"多模态基础 Agent"——能同时处理数值、文本和视觉 K 线图——并且整合了工具增强、双层反思机制、专家交易策略。论文报告在 6 个金融数据集(股票 + 加密)上跑赢 9 个 baseline,在 6 个金融指标上平均提升超过 36% 的利润,其中一个数据集上达到了 92.27% 的回报(84.39% 相对提升)。

但 FinAgent 的实验设计也是日频数据 + 没有第三方独立复现 + 没有明确的实盘执行细节。和 QuantAgents 的问题一脉相承。

第二个是 FinMem:A Performance-Enhanced LLM Trading Agent with Layered Memory and Character Design(arXiv:2311.13743,2023-11-23 v1,2023-12-03 v2,作者 Yangyang Yu 等 9 人,Stevens Institute of Technology 团队)。它提出了一个三层模块框架——Profiling(给 Agent 设定"性格")、Memory(分层记忆处理)、Decision-making(把记忆转化成投资决策)。论文的核心论点是 Agent 的记忆模块应该模拟人类交易员的认知结构,这样既能保留关键信息又能支持实时调整。

FinMem 的设计更接近"行为金融"思路——它假设如果能让 LLM 模拟一个有"经验""风险偏好""认知边界"的交易员,它的决策会更接近真实交易。但这个假设本身有疑问:行为金融几十年的研究已经表明,人类交易员的"性格"恰恰是回报的敌人,而不是回报的来源。让 LLM 模拟一个有偏差的人类交易员,只会继承这些偏差,而不是消除它们。

五、GitHub 上的下限:Vincent-chao-lang/quant_llm_pub

学术论文是上限,GitHub 开源项目是下限。Vincent-chao-lang/quant_llm_pub(2026-02-05 首 commit,MIT License)是这类项目的一个诚实样本。

它的技术栈很标准:AKShare/baostock 抓 A 股数据,TA-Lib 算技术指标,基本/技术/资金三维度评分,默认股票列表写死 5 只白马蓝筹——贵州茅台(600519)、五粮液(000858)、宁德时代(300750)、中国平安(601318)、美的集团(000333),输出 JSON/Excel/Markdown 三种格式。

这个项目最值得注意的设计选择是:LLM 不参与交易决策。它只负责最后一步——把量化评分翻译成人话报告。决策层依然是 MA/MACD/KDJ/RSI/BOLL/OBV 这些"老古董因子"在干活。换句话说,这个项目里 LLM 的角色和 TiMi 论文的解耦架构建议是一致的——LLM 做 Copilot,代码做决策。

但 Vincent 项目的存在本身也说明了一个事实:即便是一个诚实的、目标明确的"LLM + 量化"项目,在工业界落地的极限也就是"把数字翻译成文字"。这不是 LLM 的失败——这是 LLM 在量化领域的天花板。

六、2605.19337 元综述:真正致命的 6 个数字

把 TiMi、QuantAgents、FinAgent、FinMem 这四个项目叠在一起,看起来 LLM 在量化交易里已经"基本可用"。但 2026-05-19 发布的元综述 arXiv:2605.19337 把这种乐观彻底打回原形。

这篇综述用了"protocol-coded snapshot"的审计方法,检索截至 2026-03-09,所有研究都按 R0/R1/R2/R3 四级可复现性打分。在 primary empirical subset(n=19)里,六个审计维度的合规情况如下:

审计维度合规篇数 / 总数百分比
报告可提取的时间一致分割协议(time-consistent split)2 / 1910.5%
报告显式交易成本模型(transaction-cost model)1 / 195.3%
报告股票池 / 幸存者偏差处理(universe or survivorship handling)1 / 195.3%
报告执行时点或语义(execution timing/semantics,T+1 vs T+0,收盘价 vs VWAP)11 / 1957.9%
被编码为 R0(最低可复现等级)15 / 1978.9%
达到 R3(完全可复现)0 / 190%

把这六个数字翻译成大白话:在 2026 年上半年所有 LLM 交易 Agent 学术论文里,89% 没有报告可复现的时间分割协议,95% 没有报告交易成本,95% 没有处理股票池偏差,79% 是 R0 级别(几乎不可复现),0% 达到 R3 完全可复现

这不是个别项目的问题,是整个领域的系统性问题。论文作者既是运动员又是裁判,自己设计回测、自己报告回报、自己不发布代码——这套自评模式在过去三年的 LLM 量化研究里几乎是行业默认配置。

关键判断:LLM 在量化交易里的"成功故事",在 2026 年上半年经过了第一次系统性可复现性审计,被打回到 R0 起步线。任何"我的 LLM 交易 Agent 跑赢了 90% baseline"的说法,在被独立团队复现之前,都应该被当作营销文案而不是研究结论。

七、ESMA 2026-02 与 JC 2026 25:监管层分两步收口

学术界做可复现性审计是 2026-05,工业界真实部署是 2026-08,而监管层的表态分两步落地,比文章更早也比文章更细。

第一步:2026-02-26 ESMA 算法交易监管 briefing。这份文件 ESMA supervisory briefing on algorithmic trading 解决了一个关键法律问题——AI 参与的订单到底算不算 MiFID II 下的"算法交易"?答案很明确:只要"计算机算法自动决定订单的任何单独参数(包括价格、数量、时机等)",无论人类是否在其他环节干预,都构成 MiFID II 算法交易。投资公司在年度自评(self-assessment)和压力测试中必须把 AI 纳入考量,并与 AI Act(2024/1689)对齐。这是非约束性 briefing,但它把 AI 直接放进了现有算法交易治理框架,任何想做 AI 量化交易的机构都不能绕过 RTS 6 的预交易控制、年评自评、压力测试三道关。

第二步:2026-07-31 JC 2026 25 frontier AI 声明。EBA、EIOPA、ESMA 三家联合发布 ESAs' statement toward a consistent and risk-based approach for ICT risks from frontier AI models,把 frontier AI 从"模型治理"重新定性为"网络风险放大器"。声明的核心论点:前沿 AI 模型的先进能力"显著加速漏洞发现与利用,可能造成系统性网络风险"。文件明确不引入新规则,而是把 DORA Art. 4 的"预防—检测—管理"三策略激活,对金融机构提出四组要求:

  • 预防(Prevention):持续更新 IT 资产清单(含 AI/ML 组件)、secure-by-design、主动补丁、依赖风险评估
  • 检测(Detection):从周期性监控升级到持续监控、用 AI 增强 SOC 和红队测试能力
  • 管理(Management):韧性测试、灾备和备份、把 AI 辅助威胁和多系统故障纳入风险框架
  • 治理与风险偏好:管理层必须为 frontier AI 网络风险负责,风险偏好框架需新增专门指标和容忍阈值

声明还把监管视线延伸到云和 AI 供应商——ESAs 作为 DORA Lead Overseers 已经要求 critical ICT third-party providers 把 frontier AI 风险纳入 2027 Oversight Plan 和 Oversight Examination Methodology。换句话说,任何一家欧洲银行部署 OpenAI/Anthropic/xAI 的 frontier 模型做交易,现在都要同时接受 ESA 对金融机构自身和 DORA 对云/AI 供应商的双重监管。

声明背景里有两个标志性事件:2026-06-25 ESRB(欧洲系统性风险委员会)发布 ESRB/2026/3 警告、2026-07-07 欧盟委员会发布 Action Plan on Cybersecurity and AI。JC 2026 25 是这条监管线上的第三个钉子。

八、Scalable Capital Agentic Investing:LLM 第一次坐到零售经纪执行层

2026-08-25 发生的 Scalable Capital Agentic Investing 是这件事的另一个极端——LLM 不再是策略层的 Copilot,而是直接坐在执行层翻译用户的自然语言指令。

事实清单:

  • Scalable Capital:总部慕尼黑,管理 €60B(约 $69.9B)资产,服务 6 个欧洲国家超 100 万客户,欧洲第一家让通用 LLM 执行受监管零售账户订单的银行
  • 支持的大模型:ChatGPT(OpenAI)、Claude(Anthropic)、Grok(xAI/SpaceXAI)——三家用 MCP 协议接入
  • MCP 协议:由 Anthropic 在 2024-11 发布,2025-03 OpenAI 采用、2025-04 Google 采用、2025-12 Anthropic 把协议捐给 Linux 基金会下的 Agentic AI Foundation,被工程界类比为"USB-C"
  • 功能:交易、储蓄计划、观察列表、价格提醒、限价单调整、持仓诊断、新闻个性化、税务/分析 CSV 导出
  • 安全机制:用户在 web 端用 Scalable 凭据 + 2FA 登录,每次交易前需要单独确认,ex-ante 成本信息和 KID(Key Information Document)强制披露
  • 风险分配:法律上明确 AI 生成的输出和建议不构成 Scalable 的投资建议,交易由投资者自担风险——AI 跑在 OpenAI/Anthropic/xAI 自己的基础设施上,Scalable 只提供 MCP server 在自己一侧

这件事和论文层的 TiMi/QuantAgents 是两个方向的极端:TiMi 把 LLM 关进笼子,让代码做执行;Scalable 把 LLM 放出来,让它直接做执行。一个是"不要让 LLM 实时决策",一个是"让 LLM 实时决策并接受监管"。两种做法都在 2026 年同时存在,这本身就是 LLM 量化赛道分裂的缩影。

但必须看到 Scalable 的两个限制:第一,它承认 AI 应用在 Scalable 控制之外运行,出了问题责任在 AI 提供方和投资者,Scalable 只是通道——这种责任分配在 MiFID II 算法交易治理框架下还没有被监管层明确接受;第二,8 月 25 日上线到 9 月初,真实交易量、滑点表现、模型漂移这些数据尚未公开,2605.19337 元综述要求的 R3 复现在 Agentic Investing 上根本不存在——它不是学术回测,而是直接对真实账户下注。

九、四个能做,四个不能做:LLM 在量化里的真实边界

把 TiMi 的解耦设计、QuantAgents 的多 Agent 协商、FinAgent/FinMem 的具体实现、Vincent 项目的工业落地、2605.19337 的可复现性审计、ESMA 2026-02 算法交易 briefing、JC 2026 25 frontier AI 声明、Scalable Capital Agentic Investing 公告这九份一手材料叠在一起,可以画出一条清晰的边界线。

LLM 在量化交易里能做的四件事:

  1. 自然语言因子提取:从新闻、研报、社交媒体、监管文件里提取情绪分数、关键词热度、事件驱动信号。QuantAgents 的 Emily Agent、FinAgent 的多模态模块、Vincent 项目的新闻情绪模块都在做这件事。这是 LLM 相对于传统 NLP 的真正增量——传统情感分析工具只能处理结构化文本,LLM 能理解语境和反讽。
  2. 策略代码生成:把"早盘脉冲后 30 分钟内回吐 50% 算出货"这样的口语描述,翻译成可执行的 Python/SQL。在 TiMi 的三层架构里,这一层是 LLM 真正的核心价值——它能把策略研究员的直觉快速原型化,而策略研究员不必是程序员。
  3. 回测报告解读:把"ARR 58.68%,MDD 16.86%,Sharpe 3.11,Calmar 11.38"翻译成"风险收益比匹配,但缺少交易成本审计"的人话。这是 LLM 最擅长的工作——把数字变成可读的判断。
  4. 异动归因与叙事:把"主力净流入 20.84 亿"翻译成"半导体周期复苏 + 国产替代预期"。这是传统量化做不到的"叙事能力",LLM 能把冷冰冰的资金流数据接到宏观经济叙事上,让研究报告有故事可讲。

LLM 在量化交易里不能做的四件事:

  1. 分钟级实时决策:TiMi 的解耦设计已经承认这一点——LLM 负责"策略开发",trading bot 负责"按秒执行"。延迟和 token 成本的双重约束让 LLM 永远无法直接做高频决策。即使是 Scalable Capital 这种把 LLM 推到执行层的极端做法,实际撮合还是要落到 Scalable 经纪 API 完成,LLM 负责的是"自然语言 → 订单参数"的翻译,不是"价格 × 时间 × 流动性"的最优化。
  2. 严格风控规则执行:止损、仓位上限、行业暴露、单日最大回撤这些规则,代码比 LLM 稳 100 倍。LLM 会"创造性解释"这些规则,在压力下容易找到绕过规则的理由。JC 2026 25 的治理要求在这一点上和工程现实完全对齐——管理层必须为风险偏好负责,而不是把责任甩给模型。
  3. 极端行情下的稳定输出:2020 年 4 月负油价、2022 年 3 月伦镍逼空、2024 年 8 月日经单日暴跌 12% 这些极端事件,LLM 在训练数据里几乎没见过,它的输出会从"聪明"瞬间切换到"胡说八道"。JC 2026 25 把这一点升级成网络风险——前沿 AI 模型本身可能成为漏洞发现与利用的加速器。
  4. 可复现的回测报告:2605.19337 的 0/19 R3 复现率说明,即便论文作者自己也很难让自己的 LLM Agent 回测结果被别人独立复现。这个问题不解决,任何"我的 LLM Agent 比 baseline 高 36%"的宣称都缺乏可信度。Scalable Capital 的 Agentic Investing 跳过回测直接上实盘,等于把 R3 复现的命题变成"实盘能不能跑出论文那种回报"——这个问题的答案,可能需要几年真实交易数据才能回答。

十、2026 下半年,LLM 量化的真正落地路径

基于这九份一手材料,2026 下半年 LLM 在量化交易领域的落地路径应该是清晰的。

第一层:数据基础设施。Tick、K 线、资金流、新闻的实时采集和存储。这一层 LLM 完全不参与,PostgreSQL + 时序分区 + ETL 是标准配置。核心指标是延迟、吞吐量、数据完整性。JC 2026 25 在这一层要求 IT 资产清单必须含 AI/ML 组件,意味着任何 LLM 调用接口、embedding 数据库、向量索引都要进入资产台账。

第二层:传统量化层。因子计算、信号生成、风险控制、回测协议。这一层 LLM 可以辅助生成 SQL 草稿,但 SQL 规则、硬阈值、回测框架本身必须是确定性的、可复现的、第三方可独立验证的。这一层是任何 LLM Agent 落地的"地基",地基不稳,上面建什么都会塌。R3 复现率是这条层的核心考核指标。

第三层:Agent 决策层。异动归因、报告生成、策略假设。这一层 LLM 是主力,但每一个 LLM 输出都必须有人工 review 留痕审计。LLM 的输出不能直接触达交易执行,中间必须有确定性的"闸门"——风控规则、仓位限制、合规检查。ESMA 2026-02 算法交易 briefing 要求年度自评必须覆盖 AI 决策路径,这是一道硬门槛。

对应 ESMA 2026-02 与 JC 2026 25,任何想要在欧盟市场合规部署 LLM 量化系统的机构,都必须:

  • 把 LLM 决策纳入 MiFID II 算法交易年度自评,按 RTS 6 做预交易控制、年评、压力测试(2026-02 briefing)
  • 建立 AI 治理委员会,管理层为 frontier AI 网络风险负责(2026-07-31 JC 2026 25)
  • 保留 LLM 决策的完整推理链,确保人工审查员能够理解和复现
  • 把 frontier AI 风险纳入风险偏好框架,新增专门指标和容忍阈值
  • 接受 DORA Lead Overseers 对 critical ICT third-party providers(包括 OpenAI、Anthropic、xAI 等)的延伸监管

十一、回到 TiMi:理性驱动到底是什么意思

TiMi 论文标题里的 "rationality-driven" 很容易被误读成"LLM 变得理性了"。但论文的实际设计恰恰相反——理性不是 LLM 自己产生的,是工程框架给它的。

TiMi 的"理性"体现在三道关上。第一道关是数据可验证性:所有市场数据必须可回溯到原始数据源,LLM 不能"编"一个数字。第二道关是逻辑一致性:推理链每一步必须与前一步自洽,LLM 不能"A 因此 B"但 A 和 B 之间没有逻辑关系。第三道关是风险约束对齐:决策必须符合预设风控参数,LLM 不能"擅自"突破仓位上限。

这三道关本质上是用确定性规则约束概率性生成。LLM 自己不会变理性,工程框架让它"看起来理性"。这和 ESMA 2026-02 算法交易 briefing 里的"年度自评 + RTS 6 预交易控制"、JC 2026 25 里的"管理层负责 + 风险偏好指标"是同一件事的不同表达——监管层在用法规的形式,要求每一个 LLM 决策都经过这三道关。Scalable Capital 那种把 LLM 推到执行层的做法,等于把"理性"这道关的合规成本全部转嫁给了投资者和 AI 提供商——这是 2026 年 9 月这个时间点上欧盟监管框架还没有完全定论的事。

十二、结论:LLM 是 Quants 的 Copilot,不是替代品

沿着 TiMi、QuantAgents、FinAgent、FinMem、Vincent 项目、2605.19337 元综述、ESMA 2026-02 算法交易 briefing、JC 2026 25 frontier AI 声明、Scalable Capital Agentic Investing 公告这九份一手材料画完这条边界,最终的判断是:

LLM Agent 在量化交易里不是"革命",也不是"泡沫"。它是确定性的量化工程之上的一层"理解力 + 推理力",能解决传统量化无法解决的"归因"和"叙事"问题,但解决不了"实时决策""严格风控""极端行情稳定输出"和"可复现回测"这四个根本性问题。在可复现性审计、MiFID II 算法交易治理、DORA 网络风险治理这三层监管压力下,LLM 在量化交易里的角色被严格收窄到"Copilot",而不是"Trader"。

TiMi 的 "rationality-driven" 不是让 LLM 变理性,而是用架构让 LLM 看起来理性。QuantAgents 的 299% 三年收益在牛市背景、日频数据、无第三方复现的三重折扣下需要打折。2605.19337 的 0/19 R3 复现率提醒整个领域还在过拟合的深水区。ESMA 2026-02 算法交易 briefing 把 AI 纳入 MiFID II 自评,JC 2026 25 把 frontier AI 列为系统性网络风险。Scalable Capital 在 8 月 25 日把 LLM 推到零售经纪执行层,是 LLM 第一次坐到真实交易席位上,但同时也把合规和责任问题从学术推到了监管前线。

当 2027 年出现第一篇 R3 完全可复现、真实交易成本、第三方独立验证的 LLM 量化论文时,再来讨论 LLM 是否能独立做交易决策。在那之前,LLM 在量化交易里的角色清晰而有限:写代码、解读报告、做归因——不在执行层。这是 ICLR 2026 给出的最克制也最可靠的结论。


本文数据来源:

  • arXiv:2510.04787 v2 — Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading, ICLR 2026, 同济 + 微软亚研 + 复旦 + 布里斯托, Zifan Song 等 8 人, 17 页 6 图
  • arXiv:2510.04643 v1 — QuantAgents: Towards Multi-agent Financial System via Simulated Trading, EMNLP 2025, NASDAQ-100 Financial Dataset 2015-2023, Xiangyu Li 等 5 人
  • arXiv:2402.18485 v3 — FinAgent: A Multimodal Foundation Agent for Financial Trading, 6 datasets / 9 baselines / 92.27% peak return, Wentao Zhang 等 13 人
  • arXiv:2311.13743 v2 — FinMem: A Performance-Enhanced LLM Trading Agent with Layered Memory and Character Design, Yangyang Yu 等 9 人
  • arXiv:2605.19337 v1 — Agentic Trading: When LLM Agents Meet Financial Markets, 77 项研究 / 19 项审计 / 0/19 R3 复现, Yihan Xia 等 7 人, 59 页 15 图 27 表
  • ESMA Supervisory Briefing on Algorithmic Trading, 2026-02-26(AI 适用 MiFID II 算法交易 + RTS 6 年度自评)
  • JC 2026 25 — ESAs' statement toward a consistent and risk-based approach for ICT risks from frontier AI models, EBA + EIOPA + ESMA, 2026-07-31(DORA Art. 4 三策略 + 管理层负责 + 风险偏好指标)
  • ETF Express / Tech Times 报道 — Scalable Capital Agentic Investing 上线, 2026-08-25(MCP 协议 + ChatGPT/Claude/Grok + €60B AUM)
  • GitHub: Vincent-chao-lang/quant_llm_pub(2026-02-05 首 commit, MIT License, 0 star, 默认股票列表 5 只白马蓝筹)