HyperAIHyperAI

Command Palette

Search for a command to run...

FinanceHarness:自主式金融深度研究框架

摘要

得益于大语言模型与自主智能体的进步,深度研究已成为应用最广泛的智能体产品之一。然而,大多数深度研究系统生成的是通用报告,难以胜任金融深度研究。金融研究需要专业知识来分析历史模式并预测未来事件。因此,自动化金融深度研究既需要一个分层式框架来驱动研究智能体,也需要一个可验证、时间点明确的基准,以防止未来信息泄露。我们提出 FinanceHarness,一个运行金融导向工具和从业者引导工作流的框架,实现端到端的自动化金融深度研究:涵盖环境与数据构建、智能体执行循环以及奖励建模。我们进一步提出 FinanceGym,包含由论点驱动的研究问题以及结合截止前与截止后标准的评分细则。经专业专家验证,其通过率达到 82%。即使领先的大语言模型和智能体在评分细则上的得分也低于 40%,表明 FinanceGym 具有挑战性并留有巨大的提升空间。在相同开源权重基座模型下,FinanceHarness 将总体评分从 25.3% 提升至 32.4%。

一句话总结

Google Cloud AI Research 与加州大学洛杉矶分校推出 FinanceHarness,一个自主的金融深度研究框架,该框架集成了面向金融的工具和从业者指导的工作流,并结合 FinanceGym,一个可验证的时点基准,融合了截止日期前和截止日期后的评估标准。结果显示,即使是领先的 LLM 和 agents 得分也低于 40%40\%40%,而 FinanceHarness 将评分标准得分从 25.3%25.3\%25.3% 提升至 32.4%32.4\%32.4%

核心贡献

  • FinanceGym 作为一个时点金融深度研究基准被提出,包含 400 个专家标注的问题和 2,464 个评分标准项,经过专业专家验证,通过率达到 82%。
  • FinanceHarness 作为一个端到端的框架被提出,利用面向金融的工具、从业者指导的工作流和奖励模型,在与 FinanceGym 相同的时控环境中自动化金融深度研究。
  • 领先的 LLM 和 agents 在 FinanceGym 上的得分低于 40%,而 FinanceHarness 使用相同的开源权重骨干将评分标准得分从 25.3% 提升至 32.4%,随后的 GRPO 训练进一步增加了 0.4 分。

引言

由大型语言模型驱动的深度研究 agents 已被广泛用于回答复杂的多跳问题并生成长篇报告。然而,这些通用系统在金融等专业领域表现不佳,分析师需要从不同来源收集证据、验证论断、理解金融实体和事件之间的关系,并对未来结果进行推理。现有的基准要么测试孤立的 NLP 技能,要么缺乏防止未来信息泄露到报告中所必需的时点评估,因此不适合衡量真正的金融研究能力。

作者通过构建一个时点金融搜索沙盒来解决这些不足,该沙盒对大规模网络语料库实施截止日期访问控制。他们利用这个沙盒构建了 FinanceGym,一个经过专家验证的基准,包含 400 个研究问题,并配有截止日期前和截止日期后的评分标准,分别评估证据检索和未来结果推理。他们还引入了 FinanceHarness,一个由专家知识引导的 agent 框架,在严格的时间约束下自动化环境构建、agent 执行和奖励建模,使评估和环境内优化能够共享同一框架。

数据集

作者在时点金融搜索沙盒之上构建 FinanceGym。该沙盒基于一个包含超过 1 亿篇文章的大规模网络语料库,这些文章来自数千个公共网络域名。每篇文章都带有可靠提取的发布日期,并通过标准化的元数据获得干净的文本。语料库特意保留了网络规模金融搜索的噪声和广度。在检索方面,文章使用 Qwen3-Embedding-4B 进行嵌入,并存储在通过轻量级 API 提供的 FAISS IVF-SQ8 索引中。该 API 强制执行时间访问契约:agents 可以搜索和阅读历史文档,但不能访问在指定截止日期之后发布的文章。

FinanceGym 本身通过多阶段流水线生成:

  • 从语料库中提取金融实体图,通过筛选金融相关来源并使用 Gemini-3.5-Flash 生成实体-关系三元组。在过滤掉通用或格式错误的节点后,工作图包含 437 万条边,涵盖来自 120 万篇源文章的 111 万个唯一实体。
  • 通过三种互补模式从图中挖掘细粒度情境:跨类别关联、围绕高度数实体的时间叙事弧线,以及两极分化(例如,升级与降级)。实体预算防止大型公司主导基准。
  • 每个候选情境都与一个截止日期配对,该截止日期由一个平衡事件量、实体多样性和关系熵的目标函数选择。然后,LLM 生成一个基准记录,包含分析师风格的问题、参考投资论点以及双层评分标准。截止日期前标准测试在截止日期前可发现的事实,而截止日期后标准测试仅在之后可验证的结果,将证据检索与前瞻性综合分析分开。
  • 生成后应用自下而上的分类法:LLM 将问题分类为自然类别,然后合并为三个轴:主题、行业和推理类型。
  • 生成的问题通过 LLM 质量门控,测试可行性、机构相关性、连贯性、依据性和平衡性。这从 29,669 次无约束生成中产生了一个由数据确定的 2,078 个问题池。
  • 整数线性规划选择一个 500 个问题的子集,在分类轴和月度截止日期桶的平衡约束下最大化质量。
  • 平衡子集经过外部专家标注和 LLM 辅助策展。标注员对问题的可行性和清晰度进行评分,并将每个评分标准项标记为可行或不可行。策展保留问题足够清晰且具有足够可行评分标准的记录:500 个标注问题中有 411 个达到此标准(82% 通过率)。每个样本大约需要 1.2 小时的专家工作。
  • 最终发布关卡应用人类专家审查,检查质量、隐私和出处。未通过任何检查的问题将被移除。底层语料库不公开发布;仅发布研究问题和报告提交代码,评分通过私有评分标准排行榜进行。

发布的 FinanceGym 基准包含 400 个专家标注的问题和 2,464 个标注的评分标准项(平均每个问题 6.16 项)。数据集在 9 个主题、11 个行业(合并为 9 个叶子)、6 种推理类型和 12 个月度截止日期桶之间联合平衡。行业覆盖范围包括医疗保健/生物技术、科技/半导体、非必需消费品、金融服务、房地产、能源/自然资源、工业/运输、宏观/政策、大宗商品、加密货币/数字资产和固定收益。专家标注策展过程紧密保留了 ILP 行业平衡。

方法

作者构建了一个全面的基准基础设施,包括一个时点(PIT)金融搜索沙盒、FinanceGym 基准和 FinanceHarness 执行栈。端到端流水线集成了语料库处理、基于图的情境挖掘、约束问题生成和专家策展,以支持评估和模型优化。

该系统的基础是 PIT 金融搜索沙盒。作者构建了一个包含超过 1 亿篇文章的大规模网络语料库,使用 htmldate 提取发布日期,使用 trafilatura 获取干净文本,以强制执行严格的时间访问。文章使用 Qwen3-Embedding-4B 进行嵌入以生成归一化密集向量,并在 FAISS IVF-SQ8 服务器中建立索引。此设置确保 agents 只能检索在特定截止日期或之前发布的文档。

为了生成基准,作者首先通过使用 Gemini-3.5-Flash 从语料库中提取实体-关系三元组来构建金融实体图,得到一个包含 437 万条边的工作图。他们不是进行广泛的聚类,而是通过三种模式挖掘反映金融分析师工作流程的特定情境:跨类别关联、围绕高度数实体的时间叙事弧线,以及两极分化,如盈利超预期与未达预期。每个候选情境都与一个截止日期配对,该截止日期通过一个平衡事件量、实体多样性和关系熵的目标函数选择:

score(d)=z(ν(d))(1+e(d))(1+r(d)10).\mathrm{score} (d) = z \big (\nu (d) \big) \left(1 + e (d)\right) \left(1 + \frac {r (d)}{1 0}\right).score(d)=z(ν(d))(1+e(d))(1+10r(d)).

给定一个情境和截止日期,LLM 生成一个分析师风格的问题、一个参考投资论点以及一个双层评分标准,不进行类别引导。截止日期前标准测试可检索的事实,而截止日期后标准测试前瞻性综合分析。

生成后,作者通过将问题分类为自然类别来分配自下而上的分类法,并将其合并为主题、行业和推理类型轴。400 个问题的 FinanceGym 子集在这些轴上的分布如下图所示。

生成的问题经过严格的 LLM 质量门控,测试可行性、机构相关性、连贯性和依据性。然后,整数线性规划选择一个平衡的 500 个问题子集。该子集经过专业专家标注,标注员对可行性和清晰度进行评分,并验证评分标准项。该标注池的质量控制指标,包括专家评分和评分标准深度,详见下图。

评估契约依赖于基于评分标准的评分。LLM 评判员根据问题特定的评分标准,以 0 到 4 的 5 级量表评估 agent 报告。主要指标是结果得分,计算为所有问题中获得的评分标准分数的平均比例:

Outcome=1QqQcR(q)score(q,c)4R(q).\text {Outcome} = \frac {1}{| Q |} \sum_ {q \in Q} \frac {\sum_ {c \in \mathcal {R} (q)} \operatorname{score} (q, c)}{4 | \mathcal {R} (q) |}.Outcome=Q1qQ4∣R(q)cR(q)score(q,c).

在评估期间,FAISS 服务器严格执行 PIT 协议,使任何检测到时间泄露的运行无效。

FinanceHarness 作为围绕此契约构建的可执行环境。它暴露了一个分层的金融工具接口,而不是通用的网络搜索。架构包括一个模型和服务层,托管编排器骨干和一个轻量级阅读器,对系统其余部分保持不透明,以允许模型替换。运行时层充当控制平面,管理有界的 agent 循环、模式验证和工具注册表,而不包含模型智能。工具表面是分层的,以保持提示简短同时保留广泛的能力,始终加载的核心操作和通过紧凑目录加载的延迟工具。系统支持多种提示变体模式,例如研究模式和分析模式,并利用可重用的工作流技能进行结构化分析。接地机制确保引用正确组成,操作护栏如 URL 预取和搜索预算上限管理成本和稳健性。由于框架工具调用直接命中 PIT 搜索沙盒,并使用相同的评分标准评判器作为奖励信号,因此在 FinanceHarness 内训练的模型在测试时会经历完全相同的工具使用分布。

实验

FinanceGym 通过从金融实体图中挖掘分析师风格的情境,生成带有截止日期前和截止日期后评分标准的无约束问题,并通过 LLM 质量门控和专家标注进行过滤,以产生一个平衡的 400 个问题基准。评估使用时点协议,agents 搜索经过截止日期过滤的语料库,并由基于评分标准的 LLM 评判员对回顾性综合分析和前瞻性推理进行评分。实验比较了微调的开源权重模型、带有固定搜索包装器的基础模型以及 agentic 搜索系统,结果表明骨干模型的选择比脚手架设计带来更多的性能差异,而截止日期前和截止日期后得分之间的持续差距凸显了基准在预测未来结果方面的难度。

FinanceGym 通过将长篇报告生成与可复现的、每个问题有发布日期截止的语料库以及双层评分标准相结合,填补了金融深度研究评估的空白,该评分标准将历史证据检索与前瞻性结果预测分开。大多数现有基准要么缺乏领域特异性,要么依赖实时网络访问,要么没有隔离截止日期前和截止日期后的表现,而这对于分析师风格的金融研究至关重要。FinanceGym 是唯一一个同时要求长篇金融领域报告、使用可复现的固定语料库、强制执行每个问题的发布日期截止,并应用可验证的双层评分标准的基准。现有的金融基准如 FinanceBench 评估基于文件的短篇问答,而不是 FinanceGym 所针对的长篇、实体关联研究。其他可复现的基准如 BrowseComp-Plus 和 DeepResearchGym 没有应用每个问题的发布日期截止,而 DeepScholar-Bench 与不断变化的 arXiv 索引绑定,而不是受控的金融语料库。DeepResearch Bench II 和 ResearchRubrics 提供了丰富的评分标准,但没有将截止日期前的证据检索与截止日期后的结果预测分开,而这正是金融深度研究的核心难点。

在 FinanceGym 上微调的开源权重模型总体得分从 21.2 到 28.2,其中 Tongyi-DR 领先。截止日期前的表现始终比截止日期后高几倍,凸显了基准在前瞻性项目上的难度。在 27B 骨干上的任务匹配框架优于所有开源权重模型和最佳的 agentic 搜索系统,仅次于两个专有骨干。在微调的开源权重模型中,Tongyi-DR 取得最高总体得分(28.2),其次是 OpenResearcher(27.2)和 MiroThinker(21.2)。在所有系统中,截止日期前得分大约是截止日期后得分的 3-5 倍,反映了前瞻性金融分析的挑战。FinanceHarness,一个带有检索框架的 27B 开源权重系统,超越了最佳微调开源权重模型和顶级 agentic 搜索系统,接近专有前沿性能。

添加一个简单的框架比仅搜索有所改进,而完整的未训练 FinanceHarness 带来了进一步的提升,而在单独训练集上的 GRPO 微调仅提供了微小的额外改进。截止日期前得分始终比截止日期后高几倍,反映了基准的核心难度而非检索差异。完整的未训练框架将总归一化评分标准均值从 25.3(仅搜索)提高到 32.4,截止日期前得分从 36.1 攀升至 45.7。GRPO 强化微调仅比未训练框架增加了 0.4 分,将总分从 32.4 提高到 32.8,因此被视为改进而非主要结果。在所有配置中,截止日期前得分比截止日期后高几倍,表明前瞻性项目仍然是主要挑战,与检索设置无关。

FinanceGym 引入了一个可复现的金融深度研究基准,以长篇报告生成为中心,使用固定语料库,每个问题有发布日期截止,并采用双层评分标准,分别评估历史证据检索和前瞻性结果预测。微调的开源权重模型取得了适度的总体得分,截止日期前的表现始终比截止日期后高几倍,凸显了前瞻性金融分析的难度。在 27B 骨干上的任务匹配检索框架显著提高了性能,超过了仅搜索和微调模型,接近专有前沿结果,而强化微调仅提供了微小的额外收益。基准的核心挑战仍然是截止日期后的前瞻性项目,与检索配置无关。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供