ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

FORESIGHT‑9:面向自适应交易智能体的前瞻性与过程感知评测基准

FORESIGHT‑9:面向自适应交易智能体的前瞻性与过程感知评测基准 FORESIGHT‑9:面向自适应交易智能体的前瞻性与过程感知评测基准arXiv:2608.29372v1摘要传统回测对自适应交易智能体的测试能力存在局限:无法排除历史数据污染、无法检验智能体对单一市场路径的敏感性,也无法暴露长时序自适应过程中发生的内部退化问题。本文提出FORESIGHT‑9,一套具备可审计能力的前瞻性评测基准,基于2026年7月共享信息边界,衍生出9条反事实压力世界线。每条世界线包含分阶段宏观金融事件、多资产联合锚点;确定性生成器生成价格轨迹,严格按照模拟世界时间披露观测数据。统一评测合约标准化观测与执行接口,同时保留各智能体原生自适应循环逻辑。本文基于两套基座大模型,对两套自适应交易智能体框架完成36组长时序仿真实验。实验结果表明:智能体在不同世界线、不同基座模型下的排名波动巨大;简单的等权重固定策略在36组实验中有31组表现优于被测智能体。过程遥测数据能够揭示终端收益无法反映的故障现象:某一组高收益实验中,智能体内部有效因子库已经完全失效,实际持仓收敛至等权重兜底策略,但决策记录仍然显示存在活跃因子组合。因此FORESIGHT‑9不仅评估组合最终收益表现,同时检验自适应智能体在多条备选未来路径下内部状态与实际执行行为是否保持一致。本文开源全部世界线面板、价格轨迹、审计追踪记录与复现脚本。1 引言大模型智能体越来越多地被用于金融研究、因子挖掘与投资组合构建,但目前主流评测手段仍然依赖真实历史的回溯回测。该模式存在三类典型缺陷:无法区分可迁移决策能力与历史记忆过拟合:漂亮的回测结果完全可能来自智能体对单条历史路径的过拟合。单条真实路径无法检验智能体在不同宏观金融环境下的鲁棒性。只关注最终收益结果,忽略过程层故障:长时序智能体会出现循环停滞、因子库退化、策略静默冻结、决策记录与实际持仓不一致等问题,这些问题会被最终收益分数掩盖。本文提出FORESIGHT‑9前瞻性评测基准,在9条可审计反事实未来场景下评测大模型交易智能体,包含分阶段宏观金融事件、多资产锚定条件、时间门控观测机制。智能体只能获取模拟时间点之前披露的数据,需要完成因子搜索验证、因子准入、信号排序、组合构建、交易执行,同时维护自身因子库与研究记忆。评测合约统一资产池、调仓频率、约束条件、交易成本、故障处理逻辑,但保留智能体原生搜索与自演化机制。图1 FORESIGHT‑9整体流程。交易智能体在共享边界前的历史数据上完成预热因子挖掘;从共享信息边界开始,在9条世界线中在线挖掘因子、构建组合、执行交易。评测输出两层结果:结果层(净值、最大回撤、夏普比率)、过程记录层(因子列表、交易记录)。本文三项核心贡献:多世界线前瞻性评测:摒弃单条真实测试路径,使用9条受控反事实压力未来场景,全部从同一信息边界分叉;每条世界线包含分阶段宏观金融事件、多资产锚点、确定性生成逻辑、时间门控数据集面板。过程感知评测:基准完整记录持久化研究状态、组合提案、实际持仓、因子全生命周期事件、故障状态。实现区分结果好坏与内部退化、执行不一致问题。保留智能体原生逻辑的评测合约:标准化观测数据、组合约束、调仓频率、交易成本、时间隔离与执行逻辑,但不修改智能体自身搜索与自适应循环。本文选取两套智能体框架:AlphaCrafter(AC,多智能体挖掘‑筛选‑交易系统)、FactorMiner(FM,自适应因子研究智能体);分别使用gpt‑5.6‑terra、deepseek‑v4‑flash(DS)两套基座模型。完成2×2×9=36组完整仿真,全部运行至2035‑12‑31,初始资金完全一致。实验发现:智能体性能在不同世界线、不同基座模型下差异巨大;简单等权重策略在36组中的31组优于被测智能体,说明单纯绝对正收益不能证明自适应机制带来增量价值。过程追踪发现部分实验虽然收益可观,但内部自适应机制已经静默失效。开源资源:9套世界线面板与场景叙事、全部36组仿真轨迹(净值、持仓、每次决策因子使用情况、带准入/驱逐原因的因子库审计记录、因子组合历史)、分阶段因子清单(预热库、在线新增因子、挖掘阶段候选及计算公式)、等权重基线、可复现全部图表指标的处理脚本。2 相关工作金融智能体的回溯回测存在固有缺陷大模型智能体可以完成alpha因子挖掘、信号筛选、投资组合管理,但大多只在单条真实历史路径上回测评估,容易出现未来信息泄露、路径过拟合。KTD‑Fin在真实金融历史评测时控制模型记忆;FORESIGHT‑9则直接把评测环境拓展到真实历史之外,同时审计持久自适应状态与执行状态。单条历史排行榜无法区分性能来自决策质量还是运气。现有金融智能体研究大多聚焦智能体机制本身,评测环境的变化维度不足。合成路径、预定义压力场景作为评测环境存在不足压力测试在合成不利场景评估策略;生成式时序模型从历史动力学生成替代轨迹;反事实评估从历史日志估计离策略性能。这些方法可以生成备选路径或预设压力,但并不适合长周期大模型自适应智能体:被测智能体需要在模拟环境中运行数年模拟时间,维护跨阶段状态,严格不能看到未来数据。FORESIGHT‑9的世界线就是专门为此设计、带完整文档说明的反事实延续场景。长运行智能体的过程感知评测智能体基准已经从静态数据集走向交互式环境;后续工作增加轨迹级打分:中间状态、工具调用质量、时延、开销;过程监督区分中间步骤反馈与仅结果监督。FORESIGHT‑9将前向场景变化与完整过程遥测结合用于金融决策环境:因子准入驱逐记录作为步骤级研究决策记录,运行证据层把运行故障、恢复作为一等评测对象。3 FORESIGHT‑9基准评测单元称为世界线(worldline,WL):一套完整前向市场路径,包含锚定表、分阶段机制转换、波动率配置、事件新闻时间。9条世界线均为受控压力测试场景,不是市场预测;场景辩论得到的10年概率仅作为溯源元数据,不会作为采样权重用于评测。3.1 共享信息边界与面板合约全部9条世界线分叉于统一信息边界t0=2026‑07‑15t_{0}=2026‑07‑15t0​=2026‑07‑15。t0t_0t0​之前,所有运行读取完全相同的20个时序序列:15个可交易标的:权益指数{SPX, NDX, SOX, SX5E, N225, HSI, 000300.SH, 000688.SH};大宗商品{XAU, COPPER, WTI};加密货币{BTC, ETH};主权收益率{US10Y, CN10Y}。5个仅观测信号:DXY、USDCNY、USDJPY、EURUSD、VIX。主权收益率以点位报价,作为合成收益率敞口直接交易:多头在收益率上行时盈利,附录C详细说明盈亏计算方式。全部标的收益以本币百分比计算,不做外汇转换;投资组合为跨市场归一化配置,而非某一货币计价账户。t0t_0t0​之后每条世界线独立演化至2035‑12‑31,约2468个交易日。在模拟时间ttt,智能体只能看到日期≤t\le t≤t的数据;任何越界读取都会触发数据审计失败。面板构建细节与数据质量边界见附录C。3.2 场景来源:专家智能体团队辩论生成场景集由三类金融研究智能体(策略、宏观金融、首席分析师综合)在商业金融数据智能体平台生成。每个角色提出3套2026‑2035场景,经过三轮交叉评审(独立推导、双向复核、答辩反馈);从逻辑严谨性、10年累计概率、冲击严重程度打分。最终输出分阶段事件叙事、多资产终点锚点,交给轨迹生成器。完整打分矩阵作为溯源工件开源见附录G;锚点溯源文档见附录C。3.3 生成器:带桥接噪声的场景锚定每条世界线分为4‑5个阶段,每个阶段包含命名叙事终点、终止日期。价格在对数空间于阶段终点间插值;收益率、波动率路径遵循阶段设定;没有显式轨迹的外汇序列通过DXY与声明β推导。每个阶段内部使用带种子布朗桥生成局部波动,严格保证阶段终点与场景锚点完全吻合。ℓu=T−uT ℓ0+uT ℓT+σ ⁣(Bu−uTBT),u=0,…,T \ell_{u}=\tfrac{T-u}{T}\,\ell_{0}+\tfrac{u}{T}\,\ell_{T}+\sigma\!\left(B_{u}-\tfrac{u}{T}B_{T}\right),\qquad u=0,\ldots,Tℓu​=TT−u​ℓ0​+Tu​ℓT​+σ(Bu​−
返回列表