新浪财经

AI投研新范式:2026年AAAI与ICLR前沿论文综述 | 国联民生金工

市场资讯 07.16 19:00

(来源:叶尔乐 尔乐量化)

- 报告摘要 -

SUMMARY

➤ AI在量化投研中的研究重心正在从“调用通用模型”转向“围绕金融约束重构模型”

从AAAI2026、ICLR2026主会及金融AI Workshop代表论文看,前沿研究已不再满足于把大语言模型、强化学习或Transformer直接套用到交易任务,而是更强调延迟、回测有效性、非平稳性、交易成本、风险约束和可解释性等金融场景硬约束

➤ LLM更适合承担离线研发、因子生成、语义校验和投研辅助,而非直接承担低延迟交易执行

TiMi、AlphaAgentEvo、AlphaBench等研究显示,模型能力的关键不只在参数规模,更在搜索机制、反馈设计和标准化评估体系

➤ 深度学习方法正在补齐量化金融对非结构化、多模态和关系型信号的建模短板

Text to Alpha、Relational Probing、GAP-TGN、FinZero、Diffusion Copulas和WaveLSFormer分别从企业披露语义漂移、股票关系图适配、政治信息渠道识别、图像化时序预测、多资产尾部依赖和频域交易模型切入,说明量化信号正在从传统价量因子扩展到文本、关系网络、多模态时序、联合分布和频率结构等更复杂的数据形态

➤ 量化策略研究从单一预测精度转向稳健性与可部署性

MetaTrader、ArchetypeTrader、MARS等论文围绕分布迁移、市场状态切换和风险自适应展开,反映强化学习量化正在从静态回测走向压力场景下的稳健决策

➤ 金融基础模型和仿真系统开始形成专用表示

Kronos、DigMA、CTBench等工作分别从K线tokenizer、情景化市场仿真和生成数据评测切入,说明金融数据不能简单视为普通时间序列,模型设计需要嵌入市场结构

➤ 金融大模型评测结果仍偏谨慎

EDINET-Bench、FinSearchComp、FinMMDocR等研究表明,通用大模型在复杂财报理解、跨文档检索和多步金融推理中仍有明显短板,短期更适合作为投研辅助工具,而非替代分析师判断

01

引言

CHAPTER

截至2026年7月,AI与量化金融研究呈现出由“直接迁移通用模型”转向“围绕金融约束重构模型”的明显趋势。大语言模型、强化学习和Transformer不再被简单嵌入交易任务,而是根据金融场景对延迟、回测有效性、非平稳性、交易成本和可解释性的要求,重新设计其在策略研发、信号建模、组合决策和风险控制中的功能。只有将这些约束纳入模型设计和部署流程,通用模型能力才可能转化为可复现、可评估和可落地的投研工具。

本文聚焦AAAI2026与ICLR2026主会及相关金融AI Workshop论文,对上述两个会议的量化金融前沿研究进行阶段性梳理。AAAI、ICLR、ICML与IJCAI是人工智能与机器学习领域的重要顶级会议。目前,基于已取得的AAAI2026、ICLR2026及ICML2026相关公开论文,本报告仅对AAAI与ICLR展开分析,重点覆盖以下八个方向:

  • LLM交易智能体与技术面推理

  • Alpha因子挖掘与评估

  • 深度学习

  • 强化学习的泛化与市场情境自适应

  • 金融基础模型与市场仿真

  • 端到端决策与模型约束

  • 模型可靠性与安全评估

  • 金融大模型评测与投研流程自动化

02

前沿方向梳理

CHAPTER

2.1 LLM交易智能体与技术面推理

从所梳理论文看,LLM在量化交易中的价值更多体现为对策略研发、代码生成、语义校验和可解释推理等环节的辅助,而非直接承担交易下单功能。

2.1.1 Trade in Minutes! (TiMi,ICLR2026)

研究目的:TiMi讨论的是LLM交易智能体如何真正进入量化执行场景。既有研究常把大模型包装成“分析师”或“交易员”,依赖新闻、观点和角色扮演来给出买卖建议,但这会带来情绪化表达、外围信息滞后以及在线推理延迟等问题。该研究希望把大模型的语义理解、代码生成和数学反思能力用于策略研发,而把分钟级交易执行交还给稳定、可复现、低延迟的程序化模块。

研究方法:TiMi将系统拆成离线策略研发和在线分钟级执行两个阶段。离线阶段由多个专长不同的LLM智能体协作完成宏观模式识别、微观交易规则定制、代码实现和参数约束设定,并通过回测结果触发反思,不断修正策略逻辑、风控阈值和执行细节;在策略稳定后,系统把策略蒸馏为可直接运行的交易程序,使在线阶段不再持续调用大模型。在线阶段只执行已固化的代码,根据最新行情快速完成信号计算、仓位调整和风险控制,回测与模拟部署反馈再回流到离线环节,形成“生成-验证-修正-部署”的闭环。

研究结论:实验覆盖股票和加密货币市场的200多个交易对,结果显示TiMi在盈利稳定性、动作效率和风险控制上均优于单纯依赖在线LLM推理的交易智能体。它的启示在于,金融场景不应简单追求“让大模型直接下单”,而应让大模型承担策略发现和工程化迭代,把真实交易中最敏感的延迟、复现和风控问题交给确定性程序处理。

2.1.2 Reasoning on Time-Series for Financial Technical Analysis(ICLR2026)

研究目的:VTA关注的是LLM能否参与技术分析,而不是只处理财报、新闻和研报等文本材料。金融价格序列本身包含趋势、动量、超买超卖等可解释信号,但原始数值序列很难直接被LLM稳定理解。该研究希望在“数值预测”和“自然语言推理”之间搭桥,使模型既能输出更准确的时间序列预测,也能给出贴近分析师习惯的技术解释。

研究方法:VTA(Verbal Technical Analysis,语言化技术分析)是论文提出的核心框架,思路是让LLM先用自然语言完成一段技术分析、再用这段分析去驱动价格预测。具体而言,VTA先把OHLCV价格序列转化为MACD、RSI等技术指标及其自然语言注释,让LLM围绕趋势强弱、动量变化和关键价量关系生成可读的技术分析轨迹;随后,框架通过联合条件训练,从推理模型生成的时间序列结果中提取最大值、最小值和均值等,并将其与时序骨干模型的预测结果结合,生成条件化的价格预测。训练阶段以逆均方误差构造奖励,使预测误差越小的推理轨迹获得越高奖励;实验还邀请具有金融市场分析经验的行业专家,对模型生成的推理与预测进行盲评,以检验其在清晰度、分析深度、准确性、连贯性和相关性等方面的表现。

研究结论:在美国、中国和欧洲股票数据上的实验表明,VTA能在保持可解释技术分析的同时提升预测准确率。它补充了TiMi这类执行型智能体的另一侧:大模型未必适合承担低延迟下单模块,但可以作为信号诊断、技术面归因和投研沟通工具,帮助研究员理解模型为何看多、看空或保持谨慎。

2.2 Alpha因子挖掘与评估体系

Alpha因子挖掘是LLM较易嵌入量化流程的场景,其核心价值主要体现在公式生成、搜索引导和语义评估三个环节

2.2.1 Navigating the Alpha Jungle(AAAI2026)

研究目的:该研究面向公式化Alpha因子挖掘中的两项长期难题:一是候选公式空间组合爆炸,传统遗传规划或强化学习搜索效率不高;二是自动生成的因子常常像“黑箱公式”,虽然可能短期有效,却难以解释、复用和纳入投研库。论文希望利用LLM的语义理解与推理能力,提高符号因子搜索的方向感,同时保留回测指标对因子质量的硬约束。

研究方法:框架把因子挖掘组织成LLM与蒙特卡洛树搜索协同的迭代流程。每个节点对应一条候选因子公式,LLM根据当前公式、可用字段、算子库和历史高质量因子提出修改方向;MCTS则依据回测反馈选择更值得深入探索的分支。候选因子被放入统一回测器中计算预测能力、稳定性、换手率,与已有因子的相关性以及过拟合风险等指标,客观分数再反向指导树搜索。论文还设计了频繁子树规避机制,避免搜索反复生成结构相近的公式,从而提高因子库的多样性。

研究结论:在真实股票市场数据上的实验显示,该框架能够挖掘出预测能力和交易表现更好的公式化因子,并且相比纯自动搜索方法更容易被研究员理解。它的价值不只是“多找几个高分因子”,而是把因子生成、回测反馈、相似度控制和人工可解释性放进同一条流水线,更接近实际量化团队维护AlphaZoo的工作方式。

2.2.2 AlphaAgentEvo(ICLR2026)

研究目的:AlphaAgentEvo将Alpha挖掘从一次性搜索推进到持续进化。传统方法往往遵循“生成-回测-失败后重来”的循环,模型很难从失败经验中沉淀规律,也难以形成长周期规划能力。该研究希望让智能体在多轮因子演化中积累经验,学会如何修正公式、何时保留结构、何时探索新方向,从而提高因子搜索的连续性和样本效率。

研究方法:论文提出自进化的Agentic Reinforcement Learning框架,以层级奖励引导智能体逐步学习。低层奖励先保证工具调用、公式合法性和基础回测流程正确;更高层奖励再关注因子表现的持续改善、跨市场可迁移性和多样性。智能体在每一轮根据历史尝试、回测指标和失败原因进行反思,形成新的修改计划,再调用算子库与数据接口生成下一批候选因子。这样的过程使搜索不再是独立试错,而是沿着可解释的演化轨迹逐步优化。

研究结论:实验表明,AlphaAgentEvo能比多种进化搜索和LLM驱动方法更高效地产生多样、可迁移的Alpha。值得注意的是,论文报告一个参数规模较小的开源模型经过该框架训练后,也能超过部分调用闭源强推理模型的方案,说明Alpha挖掘的关键不只在基础模型规模,更在于是否把回测反馈、长期规划和反思机制设计成稳定的学习过程。

2.2.3 AlphaSAGE(ICLR2026)

研究目的:AlphaSAGE针对的是强化学习式因子挖掘容易“塌缩”的问题。量化实务中通常需要一组预测能力强、彼此低相关、经济含义不重复的因子,而普通RL往往会把策略推向少数高奖励公式,导致搜索结果同质化。论文希望在公式结构表示、探索目标和奖励设计上同时改造,使模型能在高质量区域保持多峰探索。

研究方法:AlphaSAGE通过语法树表示、GFlowNet采样和多目标奖励,在多个高质量公式模式之间保持结构化探索。具体而言,框架首先把每条公式表示为语法树,并用关系图卷积网络编码算子、变量和层级关系,使模型理解公式的结构语义,而不是将公式当作线性Token串处理。其次,框架引入GFlowNet,使公式被采样的概率与其综合奖励成比例,从而在多个高价值模式之间分配概率质量。奖励函数不仅考虑预测能力,还纳入结构对齐、新颖性和与已有因子的差异度,以缓解稀疏奖励和单一最优模式带来的探索不稳定。

研究结论:实验结果显示,AlphaSAGE在预测性、多样性和新颖性上均优于传统强化学习和遗传搜索基线。它的重要性在于把Alpha挖掘从“追求最高分公式”转为“构造可组合的因子集合”,更符合多因子组合、风险分散和长期因子维护的实际需求。

2.2.4 AlphaBench(ICLR2026)

研究目的:AlphaBench不提出新的因子生成算法,而是为LLM参与公式化Alpha挖掘建立可比较的评测体系。现有研究在数据范围、提示模板、回测设定和搜索流程上差异很大,导致不同方法的结果难以横向判断。该研究希望把研究员日常工作中的因子生成、因子评价和因子搜索拆解成标准任务,明确LLM在各环节的优缺点。

研究方法:AlphaBench将公式化Alpha挖掘拆成三类核心任务:因子生成、因子评价和因子搜索。因子生成考察模型能否按照字段与算子约束写出有效公式;因子评价考察模型能否判断因子的经济含义、稳定性和潜在风险;因子搜索则考察模型能否在多轮反馈中持续改进。论文在统一数据、提示和回测口径下评估不同开源与闭源LLM,并比较思维链、思维树、经验链和进化式搜索等提示与推理策略的差异。这样可以把模型能力、提示范式和搜索机制分开观察,避免把流程差异误判为模型差异。

研究结论:LLM在自动化因子挖掘中确有潜力,但在稳健性、搜索效率和实际可部署性上仍存在短板。AlphaBench的贡献在于给这一方向提供了“量尺”:未来新算法不应只展示少数回测结果,而应说明其在生成、评估、搜索三个环节分别改进了什么,以及这些改进能否在统一口径下稳定复现。

2.3 深度学习表征、多模态预测与量化信号建模

2.3.1 Text to Alpha(ICLR2026 Workshop)

研究目的:论文考察LLM能否比命名实体识别或关键词匹配更准确地识别企业披露中管理层关注重点的跨期变化。传统方法常用命名实体识别或关键词匹配从企业披露文本中提取业绩指标,既无法保留上下文,也难以识别表述不同但语义等价的指标,导致对管理层强调重点变化的刻画失真。已有研究表明,管理层跨期转移强调指标对未来收益具有预测力;本文探讨LLM能否更准确地捕捉这种“移动目标”式的语义漂移。

研究方法:该研究采用“LLM提取、嵌入度量”的两阶段框架。先以大模型作为提取器,对历年盈利电话会议记录做结构化抽取,输出保留上下文限定的业绩指标集合;再用文本嵌入模型将各指标映射到共享向量空间,通过当期与上年同期指标集的最大余弦相似度匹配计算跨期“持续率”,并以其补数定义移动目标得分——数值越高,代表管理层越大幅偏离历史强调重点。最后据该得分构建五分位多空组合,以Fama-French因子模型检验其超额收益,并与命名实体识别基准对照。

研究结论:在论文样本和设定下,基于LLM提取构建的移动目标组合在多因子调整后仍具有显著超额收益,明显优于统计上并不显著的命名实体识别基准,表明大模型能捕捉后者遗漏的语义等价与上下文信息。对投研而言,该框架提供了一种从公开财报文本前置识别管理层战略重心漂移的文本因子,可用作基本面选股或风险预警的补充信号。

2.3.2 Relational Probing(ICLR2026 Workshop)

研究目的:Relational Probing旨在通过可端到端训练的轻量适配机制,直接从语言模型内部表示中构建股票关系图,并使其与下游预测目标对齐。现有基于LLM的金融关系图构建,多依赖自回归解码生成结构化文本、再解析为图,推理延迟高、格式易错,且图构建与下游预测目标相互脱节;提示工程在多重约束下的稳定性也不足。Relational Probing探讨能否用一种可端到端训练的轻量适配机制,直接从语言模型的内部表示中诱导出股票关系图,并与预测目标对齐。

研究方法:Relational Probing框架以带股票代码标注的金融新闻为输入,先由语言模型主干编码得到逐token的隐层表示;再由一个轻量Relation Head以可学习的股票嵌入为查询、隐层表示为键值,通过注意力与双线性打分得到股票两两关联强度,跨当日新闻聚合并阈值化后形成当日有向加权关系图。该动态图与历史价量特征一并输入图注意力网络,输出个股涨跌趋势分类。训练时,下游预测损失的梯度端到端回传至Relation Head乃至语言模型,使关系归纳与预测目标显式对齐,省去人工解析环节。

研究结论:在股票趋势分类任务上,该框架诱导的关系图在多项抗类别失衡指标上均优于词共现基线,且增益随主要模型规模扩大而提升。对投研流程而言,它把文本理解、关系归纳与趋势预测整合为一个可微目标,消除了提示解析环节,并可在单卡上完成全量微调,为新闻驱动的动态关系图构建提供了稳健且低成本的落地路径。

2.3.3 GAP-TGN(ICLR2026 Workshop)

研究目的:GAP-TGN旨在把议员与企业之间的关系网络纳入国会交易预测,以识别可能带来超额收益的结构性信息渠道。国会议员因监管权限与委员会任职形成的信息优势,长期引发市场公平性争议。既有研究多以孤立的时序信号分析其交易,忽视游说、竞选捐款与地理关联等结构性背景;金融场景下较长的收益结算窗口,也使标准时序图模型在预测期内依赖过时的节点表征。

研究方法:GAP-TGN将多模态时序图、门控融合和异步传播结合起来,统一建模政治关系、市场特征与滞后收益标签。作者将议员交易、游说关系、竞选捐款与企业基本面编码为随时间演化的议员-企业二部图,各边按公开披露时间戳对齐,以防止前视偏差。模型先分别编码每笔交易的成交属性与市场技术特征,再经图注意力聚合历史邻居信息,得到节点的结构嵌入;随后由门控多模态融合层动态权衡结构信号与市场动量的贡献,判断该笔交易能否跑赢大盘。为应对收益结算滞后,框架对尚未结算的交易赋予潜在标签,并持续更新节点记忆,避免因丢弃未标注交互而截断信息。

研究结论:在较长的评估窗口下,该模型在正样本识别的稳定性上明显优于树模型基线,验证了关系位置特征可作为“政治Alpha”的领先指标。对投研流程而言,它提供了一种将议员-企业结构性关联前置为决策约束的信号挖掘思路,可用于监测政治信息渠道与辅助异常交易预警。

2.3.4 FinZero(AAAI2026 Workshop)

研究目的:FinZero旨在同时解决金融时序预测中的信息损耗、跨资产泛化受限和置信度缺失问题。现有金融时序预测多依赖数值标准化编码,会损失原始序列的局部形态信息,固定的窗口长度与变量维度也限制了跨资产泛化;同时模型输出普遍缺乏可解释的不确定性度量,难以直接支撑带风险约束的决策。FinZero针对信息损耗、泛化受限与置信度缺失这三重痛点,尝试以多模态推理模型重构时序预测。

研究方法:FinZero采用“时序图像化+不确定性调整强化学习”的两阶段框架,同时学习涨跌方向和预测置信度。该研究先把价格、成交量与技术指标构成的金融时序转化为标准化图像,并配以文本描述与预测问题,构建跨资产、跨频率的多模态图文数据集;再以多模态大模型为主干,通过不确定性调整强化学习算法进行微调。该算法在分组相对策略优化的基础上引入组内与跨组两层相对优势估计,并以模型自评的置信度对优势加权,使高置信输出获得更强激励;奖励函数同时考虑预测准确性、推理文本质量与输出格式。最终,模型逐条给出涨跌方向及可量化的置信度,供下游按阈值筛选高质量信号。

研究结论:FinZero以较小的参数量在价格与波动率方向预测上超过了更大的通用多模态模型,且其置信度评分与实际准确率显著正相关,高置信子集的准确率明显更高。对投研流程而言,它把预测的不确定性前置为决策约束——通过置信度阈值过滤低质量信号,可在不额外依赖估值模型的情况下有助于获得更稳健的方向性交易信号。

2.3.5 Diffusion Copulas(ICLR2026 Workshop)

研究目的:多资产联合预测中,端到端扩散模型普遍存在“正态性偏差”:以共享评分函数联合训练时,边际分布的校准质量被牺牲,尾部风险被系统性低估,市场同步下跌这类极端联合事件常被误判为几乎不可能发生。对风险计量而言,这意味着VaR、ES等指标在市场大幅波动和风险传导阶段的有效性可能下降。该研究把边际分布与依赖结构分开建模,使预测分布同时保留重尾边际与非高斯联合依赖。

研究方法:Diffusion Copulas先独立建模各资产的重尾边际,再在Copula尺度上学习资产间的非高斯依赖。框架分两阶段。先对各资产边际独立建模:以历史窗口拼接波动率、趋势强度等条件特征,用混合密度网络输出Normal、Laplace、Student-t的动态混合参数,保证边际具备重尾覆盖能力;再将各资产边际CDF值经概率积分变换映射到单位超立方体,在Copula尺度上引入分类-扩散模型——前向扩散逐步破坏样本间的依赖结构,训练分类器区分“依赖态”与“独立噪声”,其密度比即为Copula密度的近似。采样时以Langevin动力学抽取联合样本,再经各资产逆CDF还原为收益率,得到重尾边际与非高斯依赖兼备的多变量预测分布。

研究结论:在加密货币高频数据上,该框架在边际校准与联合极端事件预测两个维度均优于端到端扩散基线,能把市场同步崩跌识别为“可预期的下跌”而非“黑天鹅”。对投研流程而言,它把系统性扩散风险显式写入预测分布,为尾部敏感的组合构建、多资产ES估计和压力测试情景生成提供了更可靠的分布基础。

2.3.6 WaveLSFormer(ICLR2026 Workshop)

研究目的:WaveLSFormer旨在将可学习的频率分解与交易决策纳入统一框架,并直接以风险调整后收益为优化目标。金融时序建模长期存在两处脱节:一是模型多以均方误差等点预测损失为目标,与策略实际盈亏路径错位,预测得准不等于交易得好;二是主流小波-神经网络方案把固定小波变换当作预处理,频带划分无法随下游交易目标调整,高频噪声还容易干扰稳定的低频趋势表征。WaveLSFormer希望把频率分解与交易决策放进同一个可学习框架,直接以风险调整后收益为优化目标。

研究方法:WaveLSFormer通过可训练频率分解、跨频门控融合和收益导向损失,将多资产时序表征直接映射为多空仓位。模型以行业内多资产的小时级收益率为输入,先经DTW相似度与非参数Granger因果检验,筛选与目标资产存在显著预测关系的辅助序列;随后由两组可训练的FIR卷积核分别充当低通和高通滤波器,并在频域施加频带分离、能量守恒等谱正则,将序列拆分为低频趋势与高频残差两条支路。跨频融合采用“低频引导、高频注入”的设计:注意力权重仅由低频表征计算,高频信息经门控残差按可学习比例注入,避免噪声主导趋势判断。融合表征经Transformer编码后直接输出多空仓位,训练目标由软标签交叉熵、ROI过拟合惩罚与Sharpe正则共同构成,使模型优化目标与部署指标保持一致。

研究结论:在美股多行业五年的小时级数据上,WaveLSFormer相比原始Transformer将平均ROI与Sharpe比率大幅提升,并在论文覆盖的行业组与主干网络组合下一致优于带固定小波前端的MLP、LSTM与Transformer基线,最大回撤同步收窄。对投研流程而言,它展示了把频率分解、信号生成与风险约束统一进端到端训练的可行路径;但其评估尚未计入交易成本与市场冲击,实盘迁移仍需谨慎验证。

2.4 强化学习的泛化与市场情境自适应

泛化仍是强化学习在量化交易中的核心难题。

2.4.1 MetaTrader(AAAI2026)

研究目的:MetaTrader关注强化学习交易策略的泛化问题。许多离线RL策略在历史数据上表现很好,但本质上是在记忆训练区间中的最优买卖路径,一旦市场结构、趋势方向或波动状态变化,就会产生价值高估和动作失真。该研究希望把组合优化重新定义为部分离线强化学习问题,让策略在训练阶段就面对分布外市场情境。

研究方法:论文设计双层学习框架:内层在原始历史数据上优化组合收益,外层则通过多种市场变换构造训练集外场景,例如反转强势资产价格、反向整体市场趋势以及对时间序列降采样等,使智能体必须在被扰动的环境中保持有效。针对离线数据有限时常见的价值过估计问题,MetaTrader进一步提出保守的TD估计方法,从一组变换后的TD目标中近似最坏情况目标,用更谨慎的价值更新约束策略学习。

研究结论:在两个公开股票数据集上的结果表明,MetaTrader相比传统RL交易模型和“预测后买入”的固定规则有更好的样本外表现。它强调的不是在一段历史回测中榨取最高收益,而是在训练时主动暴露策略弱点,使模型学到更能穿越市场状态变化的决策规律。

2.4.2 ArchetypeTrader(AAAI2026)

研究目的:ArchetypeTrader试图解决市场状态切换下策略选择粗糙的问题。过去常用趋势、波动率等人工标签划分市场,再训练不同子策略,但这些标签很难覆盖真实行情中的复杂交易情境。论文希望从专家轨迹中学习更细致的“策略原型”,让强化学习智能体在面对新行情时先识别可借鉴的交易模式,再进行局部修正。

研究方法:ArchetypeTrader依次完成策略原型提取、市场情境匹配和局部修正,在复用专家经验的同时保留对当前行情的适应能力。系统先从历史专家交易轨迹中抽取若干离散的战略原型,每个原型对应一类可复用的交易方法,而不是简单的牛市、熊市或高波动标签。运行时,系统根据当前市场特征选择最匹配的原型,再由RL智能体在原型动作的基础上调整仓位、交易方向和执行强度。该设计既保留了专家轨迹中的策略经验,也允许模型根据当前行情偏离原型,避免机械复制历史动作。

研究结论:ArchetypeTrader提供了一种更可解释的策略迁移路径:模型表现不再只由一个黑箱策略网络决定,而可以追溯到“当前选择了哪类原型、又做了怎样的修正”。对实务而言,这有助于研究员理解同一策略在不同市场阶段为何失效或恢复,也有助于把策略切换从人工规则推进到可学习的原型选择。

2.4.3 MARS(AAAI2026)

研究目的:MARS把强化学习组合管理中的两个问题放在一起处理:一是金融市场非平稳,单一策略在环境切换时容易失效;二是风险管理常被写成事后惩罚,无法在决策当下主动约束尾部风险。论文希望构建一个由多类风险偏好智能体组成的系统,让组合能在不同市场状态中动态调配激进与保守策略。

研究方法:MARS以异构风险偏好智能体和元自适应控制器构成双层架构,在不同市场状态下动态平衡进攻与防守。底层由具有不同风险画像的智能体组成,覆盖资本保护型到增长进攻型等不同策略。每个智能体配有Safety-Critic网络,用于评估自身动作可能带来的风险,并在风险超过阈值时对策略梯度施加约束。上层的Meta-Adaptive Controller根据实时市场状态、收益风险表现和各智能体的适配程度动态分配权重,使组合在牛市中更多调用进攻策略,在回撤或高波动阶段转向保守策略。

研究结论:在多个主要国际指数上的实验显示,MARS能显著降低最大回撤和波动,同时保持有竞争力的收益。与MetaTrader强调训练阶段泛化、ArchetypeTrader强调原型选择不同,MARS的重点在于在线组合多类风险偏好,使风险管理从单一奖励项变成系统结构的一部分。

2.4.4 Multiagent RL for Liquidity Games(AAAI2026 Workshop)

研究目的:该研究旨在解释分散、自利且无法通信的债券交易参与者,能否通过局部激励共同提升市场流动性。场外债券市场的流动性依赖大量异质参与者的分散报价,但现有模型往往只刻画微观结构约束,或依赖集中协调,难以解释个体利益与市场整体成交目标如何兼容。论文由此聚焦个体激励与市场整体成交最大化之间的关系,考察局部学习信号能否支持系统级流动性目标。

研究方法:该研究以差分奖励衡量单个智能体对全局成交量的边际贡献,从而把系统级流动性目标分解为可独立学习的局部激励。研究将双边债券交易建模为Markov团队博弈:每位智能体在随机配对后私下报出成交量,由清算规则决定实际成交,并以全市场累计成交量作为系统级目标。各智能体以自身持仓为状态、报价量为动作,仅凭差分奖励采用表格式Q-learning更新,全程不进行跨智能体通信。论文分别在精确匹配和允许部分成交两种清算规则下,与本地奖励、全局奖励及非学习基准进行对照。

研究结论:采用差分奖励的智能体在允许部分成交的环境下实现了最高的总流动性与单体吞吐,明显优于本地奖励、全局奖励及非学习基准,并在严格匹配下更快收敛到较高的成交命中率。对投研而言,该框架提供了一种激励相容的流动性建模范式,可用于量化个体参与者对市场整体流动性的边际贡献,为市场机制设计与压力情景分析提供参考。

整体来看,强化学习相关的量化研究正在从静态回测转向动态适应。模型不应只在一段历史数据上最大化收益,更应在扰动、市场状态切换和分布迁移下保持稳健。对实际投研流程而言,训练阶段需要引入压力场景,评估阶段也要关注跨阶段稳定性,而不只是单期夏普比。

2.5 金融基础模型与市场仿真

2.5.1 Kronos(AAAI2026)

研究目的:Kronos尝试为金融K线建立类似“金融市场语言模型”的基础模型。通用时间序列基础模型在金融行情上往往不如专用模型,原因在于价格、成交量、波动和订单活动共同构成市场语言,不能简单视作普通传感器序列。论文希望通过专用tokenizer和大规模预训练,让模型掌握跨资产、跨市场的K线表示。

研究方法:Kronos通过专用离散化Tokenizer和大规模自回归预训练,构建可跨资产、跨市场迁移的K线基础表示。模型首先将连续的价格动态和交易活跃度压缩为Token序列,相当于为行情数据构建一套金融“词表”;随后在来自45个全球交易所、超过120亿条K线记录的大规模数据上进行自回归预训练,学习价格形态、成交量变化和跨资产共性。预训练后的模型可通过零样本或少量适配方式,迁移至价格预测、收益预测、波动率预测、K线生成和投资模拟等任务。

研究结论:论文在Rank IC、波动率预测误差和合成K线保真度等指标上均优于多类基线,显示大规模预训练在金融时序任务中开始具备通用底座价值。其意义在于,金融基础模型不只是把文本大模型迁移到投研文档,还可以直接从行情数据中学习“市场语言”,为预测、生成和策略仿真提供统一表征。

2.5.2 Controllable Financial Market Generation with Diffusion Guided Meta Agent(AAAI2026)

研究目的:DigMA旨在生成既符合市场微观结构、又可按指定情景调节的订单流。金融市场的核心问题是如何生成既逼真又能按指定情景调节的订单流。传统基于规则的市场仿真依赖手工假设,难以贴近真实市场微观结构;纯学习式生成又常缺乏控制能力。该研究希望构建一个能够指定高波动、低流动性等市场状态的生成环境,用于高频策略训练、压力测试和市场机制研究。

研究方法:DigMA将市场生成拆成“状态分布生成”和“订单流生成”两个环节。首先,条件扩散模型刻画中间价收益率、订单到达率等市场状态参数随时间演化的分布,并根据目标情景生成对应的市场状态路径;随后,一个带金融经济先验的元代理从这些状态分布中采样并生成逐笔订单,使订单流既服从生成模型给出的统计状态,又遵循买卖报价、成交和订单到达等市场微观规则。生成出的订单流可被回放成完整市场环境,用于下游高频交易任务测试。

研究结论:实验显示,DigMA在生成保真度和情景可控性上优于已有市场仿真方法,并能作为高频交易任务的生成式训练环境。它说明金融生成模型的实用价值不只在“造数据”,还在于可按目标风险情景重放市场,从而帮助策略在真实极端行情到来前完成压力检验。

2.5.3 CTBench(ICLR2026)

研究目的:CTBench旨在同时评估加密时间序列生成的统计保真度和交易可用性。加密市场24小时交易、波动剧烈、环境切换快,通用时间序列生成评测往往只看统计相似度,不能说明生成数据是否真的可用于预测、套利或风险评估。论文希望把生成质量与交易可用性一起纳入考察,避免模型生成“看起来像”的序列却无法服务策略开发。

研究方法:CTBench构建了覆盖452个加密代币的开源数据集,并从5个维度设计13项指标,涵盖预测准确性、排序保真度、交易表现、风险评估和计算效率。评测框架包括两类下游任务:Predictive Utility用于检验合成数据是否保留时间依赖和横截面关系,Statistical Arbitrage用于检验重构序列是否支持均值回复型交易信号。论文比较了5个方法家族中的8类代表模型,并在4种市场状态下分析模型表现差异。

研究结论:统计拟合好并不必然带来可交易性,不同生成模型在保真度、风险刻画和下游收益之间存在明显取舍。CTBench的价值在于把金融时序生成从单纯分布匹配推进到“生成数据能否支撑策略”的层面,也提醒研究者在评估金融生成模型时必须纳入市场环境和交易目标。

2.6 端到端决策与模型约束

本节两篇论文的共同思路,是将金融动力学、参数稳定性、预测不确定性和投资约束显式纳入模型,使输出更容易接入定价与组合配置流程。传统量化流程通常将预测与决策分开:先预测收益,再进行组合优化;但预测误差最小,并不意味着组合收益或风险调整后收益最优。

2.6.1 Physics-Informed Koopman Neural Estimation of the Heston Model(AAAI2026)

研究目的:该研究关注Heston随机波动率模型在高频观测下的参数估计。Heston模型能刻画资产价格与随机波动率的联合演化,但真实数据中波动率是潜变量,价格与方差过程又存在非线性耦合,导致传统估计方法容易受噪声、初值和计算成本影响。论文希望把金融工程中的连续时间结构作为先验写入神经估计框架,提高参数恢复的稳定性。

研究方法:Koopman-PINN将潜在波动率估计、Koopman线性化和Heston方程约束结合起来,在数据驱动学习中保留金融模型结构。框架先利用非参数ART-filter从高频价格路径中估计潜在波动率,并通过矩估计法给出初始参数;随后使用神经Koopman算子,将Heston非线性动力系统映射到高维线性表示空间,以学习其连续时间演化。模型还引入基于随机微分方程无穷小生成元的损失,约束网络输出符合Heston方程的结构。由此,估计过程能够同时利用数据驱动表示和金融模型先验,减少纯黑箱拟合带来的不可解释偏差。

研究结论:在多组市场条件和参数组合上的实验表明,Koopman-PINN能稳健恢复Heston模型五个核心参数,并优于多类既有估计方法。该工作代表了金融AI中“模型约束学习”的路线:不是用神经网络替代金融模型,而是用神经网络帮助传统模型在复杂高频数据中更稳定地校准。

2.6.2 STABLE(ICLR2026)

研究目的:STABLE面向市场环境切换下的组合配置问题。许多深度学习组合模型先预测未来收益,再把点预测送入优化器,这会在预测不确定性上升时把误差直接放大成仓位风险。论文希望把宏观环境、个股动态和预测不确定性一并传导到资产配置环节,使组合在不同市场状态下保持更稳健的风险收益权衡。

研究方法:STABLE将条件扩散生成的收益分布转化为Black-Litterman投资观点及其置信度,再求解风险分散后的组合权重。模型以宏观经济环境和个股历史信号作为输入,利用条件扩散模型为每只股票生成多条未来收益路径,从而得到适应当前环境的预测收益分布和协方差结构。模型不直接输出仓位,而是将预测均值视为投资观点、将协方差视为观点置信度,并通过Black-Litterman框架与历史先验进行贝叶斯融合。当某只股票的预测不确定性较高时,其投资观点对最终配置的影响相应降低。

研究结论:在基于历史数据的回测中,论文在美国、中国、欧洲和韩国等市场上报告了更高的夏普比、更低的组合波动和回撤,同时在时间序列估计误差上也优于生成式基线。STABLE的启示是,金融AI的落点不应停在预测精度,而要把不确定性、协方差和投资约束一并纳入决策,有助于更贴近真实组合管理。

2.7 金融文本模型的鲁棒性与安全评估

金融文本模型的风险不只来自预测误差,也来自输入端的攻击与扰动。

2.7.1 Semantics-Preserving Adversarial Attacks on Event-Driven Stock Prediction Models(AAAI2026)

研究目的:Chameleon Attack检验事件驱动股票预测模型在金融文本输入端的对抗鲁棒性。金融新闻、公告和社交文本往往会被模型直接用于情绪分析或股价预测,一旦攻击者能在不改变语义的情况下操纵措辞,就可能诱导模型输出错误信号。该研究说明金融LLM与事件驱动预测模型面临的安全风险不只是预测误差,还包括不改变原意且难以察觉的文本攻击。

研究方法:Chameleon Attack通过潜在空间扰动搜索与语义回译两阶段流程,生成能够误导模型且保持原意自然的金融文本。论文先从理论上分析离散Token对抗优化与连续空间松弛之间的关系,说明连续优化可为离散攻击提供有效下界。第一阶段在向量空间中通过Adaptive Latent-Space Optimization搜索最能误导模型的扰动方向;第二阶段利用Semantic-Translation Module将连续扰动转换回自然语言,使生成样本在语法、流畅度和语义上尽量接近原文。攻击对象包括FinBERT等金融模型,并在FinancialPhraseBank等金融文本基准上进行评估。

研究结论:Chameleon Attack可达到较高攻击成功率,同时保持文本自然性和语义一致性。对金融应用而言,这意味着只做常规准确率评测远远不够,新闻驱动预测、情绪因子和自动研报系统都需要纳入对抗样本、输入校验和鲁棒训练,否则模型可能在看似正常的措辞变化下发生方向性误判。

2.7.2 CAIA(AAAI2026 Workshop)

研究目的:CAIA利用加密货币市场的对抗性和可核验性,评估大模型智能体在高风险、不可逆决策场景中的稳健性。现有AI基准多在可信、合作的封闭环境中衡量任务完成率,难以反映真实部署中的对抗性错误信息、不可逆损失与信息碎片化的挑战。加密货币市场兼具主动欺骗、即时财务后果与链上可核查真相三重属性,构成极端的对抗性测试场域。CAIA以此为背景,检验前沿大模型智能体在高风险、不可逆决策场景下的稳健性。

研究方法:CAIA通过可核验的高风险金融任务和工具调用实验,系统评估大模型在对抗环境中的准确性、成本与失效模式。基准从大量社区提交的真实分析查询出发,经过自动化过滤、领域专家复评、格式标准化与可复现真相校验,形成涵盖链上分析、项目调研和代币经济学等类别的高质量任务。每道题均绑定可通过工具核验的答案,并锚定到区块高度或时间戳,以降低训练数据污染的影响。评测分别设置“有工具”和“无工具”两种条件,让多款主流大模型在标准化推理-行动框架下多次运行,并以多数投票准确率为主指标,同时记录一次通过率、多次通过率、单题成本及工具调用失效模式。

研究结论:无工具时各模型准确率仅一两成,配备专业工具后最强模型也仍明显低于初级分析师水平;更关键的是,模型半数以上的工具调用优先选择通用网络搜索而非权威链上接口,暴露出“工具选择”上的系统性缺陷——短板不在知识储备,而在对信息源可靠性的辨别能力。对投研而言,试错式的多次通过指标在不可逆决策中并无意义,应把对抗稳健性作为智能体可部署性的前置门槛。

Chameleon Attack和CAIA分别从输入扰动和对抗信息环境两个层面揭示了金融AI的可靠性风险。前者提醒文本信号模型需要关注语义一致的对抗样本,后者则说明智能体在高风险场景中还需要具备稳定的工具选择和证据甄别能力。

综合来看,金融AI的可靠性正在从单点鲁棒性测试走向系统化风控:既要检查文本攻击和行情扰动,也要评估智能体在对抗信息环境中的工具选择、证据链和决策稳定性。后续若将新闻、公告、社媒信号或自动交易智能体接入量化流程,应把鲁棒性、可追溯证据和反事实解释纳入上线前检查。

2.8 金融大模型评测与投研流程自动化

金融大模型评测与投研流程自动化是2026年上半年金融AI研究的另一条主线,相关论文普遍表明,跨文档整合、专业推理和多步计算仍是通用大模型的主要短板。相较于前几节对交易、组合和定价等具体环节的讨论,本节更关注模型能力如何被客观评估,以及这些能力能否稳定嵌入真实投研流程。

2.8.1 EDINET-Bench(ICLR2026)

研究目的:EDINET-Bench评测大模型能否处理真实财务报表中的复杂判断,而不是只回答短文本问答。日本上市公司年报同时包含长文本、表格和会计披露,造假识别、盈利预测与行业分类都需要跨章节整合证据。该研究希望用更接近专业分析师工作的任务,衡量LLM在长上下文财务推理中的真实能力。

研究方法:基准基于日本EDINET系统十年上市公司年报构建,任务包括会计造假检测、盈利变化预测和行业分类。评测时,模型需要阅读完整年报或关键报表材料,将表格中的数值变化、文本中的经营解释和行业信息综合起来输出判断;论文同时设置逻辑回归等传统基线,比较大模型在端到端长文档输入下是否真正学到了专家级推理能力。

研究结论:即便是先进LLM,在造假检测和盈利预测等二分类任务上也只比逻辑回归略有优势,说明“把完整年报直接塞给模型”并不能自动产生可靠财务判断。EDINET-Bench的意义在于提醒金融评测要贴近真实工作流:模型需要配套检索、信息结构化、专用推理流程和任务支持,而不是只依赖长上下文窗口。

2.8.2 FinSearchComp(ICLR2026)

研究目的:FinSearchComp关注金融智能体的搜索与推理能力。分析师时常需要在网页、数据库和公司披露中查找信息,再综合多源证据形成判断;而现有金融问答基准多是静态题库,难以评估端到端检索、工具调用和知识落地能力。该研究希望构建一个更接近真实投研工作的开放域金融搜索评测。

研究方法:基准由70名专业金融人员参与标注和质检,包含635个覆盖全球市场与中国市场的问题,并拆分为三类任务:时间敏感数据获取、简单历史查找和复杂历史调查。每道任务都要求模型或智能体通过网络搜索、金融插件或其他工具获取证据,再完成推理与回答。论文评测了21个模型或产品,并区分是否使用网页搜索、金融插件等条件,以观察工具能力、地区市场覆盖和模型本身推理能力之间的差异。

研究结论:配备网页搜索和金融工具后,金融智能体表现显著提升,但不同模型在全球市场与中国市场上的优势并不一致。FinSearchComp的价值在于把金融评测从“模型是否记得答案”转向“模型能否像分析师一样查证、筛选并综合证据”,这对投研流程自动化尤其关键。

2.8.3 FinMMDocR(AAAI2026)

研究目的:FinMMDocR旨在评估模型处理真实长篇金融文档、跨页证据和多步数值计算的能力。FinMMDocR把金融多模态推理的难度推进到真实研报和产业材料场景。现有多模态基准常停留在较短文本或单图问答,而真实投研材料往往长达数十页,图表、表格、正文和市场情景交织在一起。该研究希望考察模型能否同时完成场景识别、长文档理解和多步数值计算。

研究方法:基准包含837份中英文金融文档,覆盖公司研究、行业报告等9类材料,平均长度超过50页;题目由专家标注,共1200道,其中大量问题嵌入了投资组合管理、商品贸易、宏观冲击等隐含金融情景。模型需要先理解问题对应的业务假设,再跨页定位图表或表格中的数值,并执行平均11步左右的抽取与计算。论文还比较不同RAG方法在该任务中的表现,考察检索质量对多模态推理结果的影响。

研究结论:在该论文的评测范围内,表现最佳的多模态大模型准确率仍只有约58%,且RAG方法之间差异明显,说明金融多模态推理的瓶颈不只是视觉识别,而在于跨页证据组织、隐含场景建模和长链条计算。对投研自动化而言,FinMMDocR说明模型需要被嵌入可追溯的检索和计算流程,而不能只依赖端到端生成答案。

2.8.4 FinMathBench(AAAI2026)

研究目的:FinMathBench专门评估大模型在金融数学推理中的能力,并处理传统人工题库容易被训练数据污染的问题。金融分析、风险评估和投资决策中大量任务都要把业务场景映射为公式,再完成多步计算;模型若只会套常见题型,无法说明其具备可靠的金融推理能力。

研究方法:论文以自建金融公式库为核心,采用公式驱动的问题生成方式。单公式题通过Mask-for-Solve机制生成可自动求解的标准答案,多公式题则借助层级树状DAG合成,使不同公式之间形成依赖关系并控制难度。最终基准包含946道题、4个复杂度层级,并在40个LLM上评测。评测不只看最终数值,还分析模型是选错公式、列式错误、计算错误,还是对极端但有效的金融数值进行了错误“纠正”。

研究结论:模型在单公式题上表现尚可,但随着公式链条变长准确率快速下降,例如部分强模型在四公式任务中的表现远低于单公式任务。FinMathBench说明金融数学推理的瓶颈不只是算术,而是业务语义、公式选择和多步依赖关系的稳定结合,这也是自动化财务分析必须重点解决的环节。

这些结果指向一个更务实的结论:模型可以辅助阅读、检索和初步整理,但高价值金融判断仍需要可追溯的数据来源、明确的推理链和人工复核。值得注意的是,部分专门金融大模型在复杂任务上并不稳定,说明继续在金融语料上预训练不能自动转化为分析师能力。

2.8.5 FinRpt(AAAI2026)

研究目的:FinRpt将“自动生成股票研究报告”正式定义为一个数据、模型和评测一体化任务。过去金融大模型多聚焦问答、情绪分析或短摘要,而完整研报需要同时完成信息筛选、财务分析、风险提示、趋势判断和文字组织。论文希望为研报生成建立可复现的数据集、评价指标和多智能体生成框架。

研究方法:FinRpt以自动化数据管线、11项评价指标和多智能体生成框架,构成完整的自动研报研究体系。数据层面,FinRpt整合7类金融数据,生成可用于训练与评估的权益研究报告数据集;评价层面,从数字准确性、逻辑一致性、风险覆盖、结构完整性和表达质量等角度衡量报告;生成层面,FinRpt-Gen由不同智能体分别承担数据收集、财务分析、预测判断、风险归纳和报告撰写,并通过监督微调和强化学习进一步提升生成质量。

研究结论:FinRpt构建的数据集与评价指标能够较系统地衡量研报质量,FinRpt-Gen也展示了多智能体流水线在自动研报生成中的潜力。它的意义在于把投研流程从单轮问答推进到可评测的报告生产,但也说明自动生成内容必须配套指标体系与人工复核,否则容易把格式完整误认为分析可靠。

2.8.6 TermGPT(AAAI2026)

研究目的:TermGPT解决金融与法律文本中专业术语辨析不充分的问题。通用LLM的嵌入空间常存在各向同性现象,导致专业词在向量空间中过度接近;在贷款、监管、风控等场景中,一两个术语的细微差异就可能改变结论。论文希望通过术语适配,让模型更准确地区分金融监管文件中的概念边界。

研究方法:TermGPT通过句子图建模和句子、Token双层对比微调,强化专业术语的细粒度区分能力。作者先构建句子图表示语义关系和结构关系,并基于上下文与拓扑线索生成正负样本,使表述相近但含义不同的术语被显式区分。句子层面对比学习用于对齐整体语义与上下文,Token层面对比学习则专门拉开易混淆术语的表示距离。论文还构建了来源于官方监管文件的金融术语数据集,用于检验模型在专业概念辨析和下游金融风险理解任务中的表现。

研究结论:TermGPT在金融和法律术语区分任务上优于既有基线。对金融大模型应用而言,提高模型能力不只靠扩大语料或增强推理,术语粒度的表示质量同样关键;若模型对于“监管主体”、“担保责任”、“信用风险缓释”等细微概念辨析不足,后续推理链再长也可能建立在错误语义上。

2.8.7 CLER(AAAI2026)

研究目的:CLER面向多模态金融推理中的错误修正问题。金融图表和文本混合输入常涉及术语理解、逻辑一致性和数值计算,即便强多模态模型也容易在这些环节出错;而直接调用更大的闭源模型成本较高。该研究希望让模型通过“学习其他模型犯过的错”来提升推理质量,以较低成本改善金融多模态问答与计算任务。

研究方法:CLER以跨模型错误案例库和细粒度检索器驱动测试时反思,使目标模型在作答前先定位并修正常见错误。论文构建FinErrorSet,收集8000多组来自不同开源多模态模型的错误与修正样本,覆盖图表理解、金融术语、计算链条和逻辑判断等常见错误类型。测试时,检索器根据当前问题匹配结构相近的历史错误案例,引导目标模型先识别可能出错的环节,再对照修正样例检查自身的推理和计算。该方法主要增加测试阶段的反思成本,不要求全面重训闭源大模型。

研究结论:在三个金融多模态基准上的实验显示,CLER能稳定优于常规自我反思和其他基线,说明“跨模型错误经验”本身可以成为有效监督信号。对金融AI落地而言,它提供了一种实用思路:与其只追求模型一次性答对,不如系统化沉淀错误案例库,让模型在高风险场景中先查错、再作答。

2.8.8 PMADS(AAAI2026 Workshop)

研究目的:PMADS考察结构化多智能体辩论能否提升非财务信用分析的严谨性、可解释性和可审计性。企业信用评估中的非财务因素分析高度依赖客户经理的主观判断,过程难以标准化、认知负担重。现有LLM研究多把非财务信息当作分类输入,缺乏对信用评估的因果推理链,报告解释性不足、难以嵌入合规审查。本文探讨以结构化多智能体辩论替代单智能体顺序推理,能否提升论证的严谨度与实务可用性。

研究方法:PMADS以结构化多智能体辩论组织非财务信用分析,使正反论证、证据引用和最终结论均可追溯。系统先由数据采集智能体从数据库与实时检索中汇集目标公司的非财务信息,形成结构化知识库;随后按照Karl Popper辩论协议,调度正反两方共六个智能体展开多轮论证。正方论证还款能力改善,反方论证还款能力恶化或存在潜在风险,双方依次完成立论、交叉质询与反驳,每一步均需援引评估准则中的可证伪依据,并通过检索补充时效信息。最后,聚合智能体将全过程整理为结构化分析报告,保留正反论证脉络与证据引用,以支持事后审计。系统产出定位为分析师的决策参考,而非直接替代人工判断。

研究结论:该系统生成的报告在解释充分性、实务适用性与系统可用性上均显著优于单智能体基线,其推理精化程度也明显更高,说明结构化辩论能促使模型就同一因素形成多层次、可追溯的论证。对投研流程而言,它提供了一种把非财务定性分析显式写入审查约束的自动化路径,有助于提升信贷报告的稳健性与可审计性,但计算时延可能达到单智能体方案的数倍。

2.8.9 VeritasFi(AAAI2026 Workshop)

研究目的:现有金融RAG系统在处理SEC申报文件时面临两重制约:其一,文件天然混合文本、表格与图表等异构内容,多数管道将其线性化为纯文本,语义接地不完整;其二,通用检索器缺乏对特定公司实体的专项适配,跨公司部署时性能明显衰减。这两点共同制约了金融问答系统在合规与投研场景中的实用化。

研究方法:VeritasFi由知识构建、混合检索与自适应重排三个环节组成。构建阶段先将多模态文件切块,用视觉语言模型把表格改写为趋势性描述、图表转为结构化说明,再经语义去重、共指消解与元数据生成形成语义自足的语料,并对高频定量查询预建记忆库。检索阶段将查询规范化后并行走三条路径:稀疏、密集与元数据三路语义检索、记忆库快速查表,以及实时获取行情等动态数据的工具调用。三路证据汇聚后,由一个两阶段重排模块精排——先在实体匿名化的通用金融数据上以对比学习训练可迁移的基础重排器,再以目标公司检索结果为信号做轻量微调、快速适配到具体实体,最后将排序结果与对话历史交由大模型生成答案。

研究结论:在多个金融问答数据集上的端到端评测中,VeritasFi的综合表现优于图RAG、轻量RAG等基线,在部分数据集上的提升尤为明显;消融实验表明知识构建、三路混合检索与两阶段重排三个模块互补、缺一不可。对投研流程而言,该框架为机构将通用大模型适配为面向特定公司的文件问答系统,提供了兼顾稳健性与低成本快速专化的可部署架构。

综合前文可以看到,金融AI在2026年呈现三条主线:一是把交易、组合和定价中的硬约束嵌入模型,二是通过深度表征学习、动态图建模、多模态时序预测、联合分布建模和频域分解拓展量化信号来源,三是用更贴近真实投研的基准暴露大模型短板并改进投研辅助流程。第一条主线关系到模型能否进入投资流程,后两条主线分别关系到模型能否发现更复杂的信号,以及能否稳定承担研究辅助和风险识别角色。

03

结语

CHAPTER

从AAAI2026、ICLR2026主会及金融AI Workshop代表论文看,金融量化AI正在从“借用通用模型”转向“围绕金融约束重构模型”。LLM更适合承担离线研发、语义校验、技术面解释和投研辅助;因子挖掘从公式生成走向搜索策略和标准化评估;深度学习方法开始在文本语义漂移、动态关系图、多模态时序预测、多资产尾部依赖和频域交易模型中拓展信号来源;RL研究更加重视分布迁移、市场状态和微观流动性;金融基础模型开始围绕K线、订单流和情景仿真建立专用表示;组合与定价模型也开始把金融动力学、风险目标和估计不确定性直接写入训练过程。

04

      1)本文为AAAI2026与ICLR2026主会及相关金融AI Workshop代表论文的阶段性综述,主要基于公开论文及论文作者披露信息整理,不代表任何投资建议。文中对论文方法、结论和应用前景的归纳仅供研究参考,不构成对相关模型、策略、资产或行业的投资判断。2)文献覆盖可能存在不完整风险。本文仅纳入当前已取得公开信息、且可对应至AAAI2026、ICLR2026主会或相关金融AI Workshop的代表性论文,未覆盖全部金融AI相关研究。Workshop论文与主会论文在审稿口径、论文成熟度和后续版本稳定性上可能存在差异,后续论文集、OpenReview条目或作者版本更新可能影响综述结论。3)论文结论存在外推风险。学术论文中的实验多基于特定数据集、市场区间、回测假设和评估指标,结果未必能直接迁移至真实交易环境。实际应用中仍需考虑交易成本、冲击成本、容量约束、滑点、风控限制和合规要求。4)AI模型和量化策略存在模型风险。大语言模型、强化学习、生成模型等方法可能存在幻觉、过拟合、数据泄露、样本外失效、鲁棒性不足和解释不稳定等问题,相关研究成果不代表模型已具备稳定可部署能力。5)市场环境变化风险。金融市场具有非平稳性,宏观环境、监管政策、流动性结构和投资者行为变化均可能导致论文中观察到的规律、因子或策略效果失效。6)综述解读可能存在偏差。本文对英文论文进行了归纳、翻译和研究判断,可能存在理解偏差、表述简化或遗漏细节等风险,具体方法、实验设定和结论应以原论文为准。

报告信息:

叶尔乐  S0590525110059  yeerle@glms.com.cn

吴正宇S0590526030002 wuzhengyu@glms.com.cn

本文来自国联民生证券研究所于2026年7月16日发布的报告《AI投研新范式:2026年AAAI与ICLR前沿论文综述》,详细内容请阅读报告原文。

重要提示

《证券期货投资者适当性管理办法》于2017年7月1日起正式实施,通过本微信订阅号/本账号发布的观点和信息仅供民生证券的专业投资者参考,完整的投资观点应以国联民生证券股份有限公司(下称“国联民生证券”)发布的完整报告为准。若您并非国联民生证券客户中的专业投资者,为控制投资风险,请取消订阅、接收或使用本订阅号/本账号中的任何信息。本订阅号/本账号难以设置访问权限,若给您造成不便,敬请谅解。国联民生证券不会因为关注、收到或阅读本订阅号/本账号推送内容而视相关人员为客户;市场有风险,投资需谨慎。

免责声明

国联民生证券股份有限公司(下称“国联民生证券”)已获中国证监会许可的证券投资咨询业务资格,本平台推送观点和信息仅供国联民生证券研究服务客户参考,完整的投资观点应以国联民生证券研究所发布的完整报告为准。若您非国联民生证券研究服务客户,为控制投资风险,请勿订阅、接受、转载或使用本平台中的任何信息,若给您造成不便,敬请谅解。国联民生证券不会因订阅本平台的行为或者收到、阅读本平台推送内容而视相关人员为客户。任何未经国联民生证券同意或授权而对本平台内容进行复制、转发或其他类似不当行为均被严格禁止。对于使用本平台包含信息所引起的后果,国联民生证券概不承担任何责任。

本平台及国联民生证券研究报告所载资料的来源及观点的出处皆被国联民生证券认为可靠,但国联民生证券不对其可靠性、准确性、时效性或完整性做出任何保证。本平台推送内容仅反映国联民生证券研究人员于发出完整报告当日的判断,本平台所载的资料、意见及推测有可能因发布日后的各种因素变化而不再准确或失效,国联民生证券不承担更新不准确或过时的资料、意见及推测的义务,在对相关信息进行更新时亦不会另行通知。在任何情况下,本平台所载信息、意见不构成对任何人的投资建议,所述证券或金融工具买卖的出价或征价,评级、目标价、估值、盈利预测等分析判断亦不构成对具体证券或金融工具在具体价位、具体时点、具体市场表现的投资建议。本平台所包含的观点及建议并未考虑获取本平台包含信息的机构及个人的具体投资目的、财务状况、特殊状况、目标或需要,客户应当充分考虑自身特定状况,进行独立评估,并应同时考量自身的投资目的、财务状况和特定需求,必要时就法律、商业、财务、税收等方面咨询专家的意见,不应单纯依靠本报告所载的内容而取代自身的独立判断。在法律允许的情况下,国联民生证券及其关联方可能持有本平台推送内容中提及的公司所发行证券的头寸并进行交易,也可能为这些公司提供或正在争取提供投资银行、财务顾问、咨询服务等相关服务。客户应充分考虑可能存在的利益冲突,勿将本平台推送内容作为投资决策的唯一参考依据。对任何直接或间接使用本平台所载信息和内容或者据此进行投资所造成的任何一切后果或损失,国联民生证券及/或其关联人员均不承担任何形式的法律责任。

法律声明

本微信号及其推送内容的版权归国联民生证券所有,国联民生证券对本微信号及其推送内容保留一切法律权利。未经国联民生证券事先书面许可,任何机构或个人不得以任何形式转载、翻版、复制、刊登、发表、修改、仿制或引用本订阅号中的内容。任何订阅人如引用或转载本平台所载内容,务必注明出处为国联民生证券研究所,且转载应保持完整性,不得对内容进行有悖原意的引用和删改。转载者需严格依据法律法规使用该文章,转载者单方非法违规行为与我司无关,由此给我司造成的损失,我司保留法律追究权利。

加载中...