Command Palette
Search for a command to run...
Iris:攀登搜索前沿
Iris:攀登搜索前沿
Ziyuan Liu Hengqi Liu Zichuan Wang Yang Qin Jiachen Liang Xu Chu Shaowei Chen Yuantao Gu Mu Chuan
摘要
我们提出了 Iris-mini 和 Iris-pro 两个搜索智能体,分别在 35B-A3B 和 397B-A17B 规模上训练,并介绍了其背后的数据流水线和训练方法。任务是从网络语料库的超链接结构中反向构建:我们从种子页面及其外链中提炼实体图,编写多跳链,将每个非答案实体改写为描述性引用,使得任何线索都无法通过字符串匹配解决,并且只保留那些参考模型在闭卷情况下无法回答、但在提供支持证据后能够解决的问题。这些问题随后被转化为轨迹,并在监督微调(SFT)之前进行两次过滤:首先在轨迹层面检查正确性、简并性和搜索深度,然后通过一个由数据归纳而非人工编写的评判标准在回合层面进行过滤。随后,策略通过强化学习(RL)在实时搜索中进行优化,奖励评判器和观察摘要器在训练集群内运行,过长的回放会在请求级别被中断,并在下一步从其已提交的前缀恢复。我们将两个阶段交替进行,称之为 SFT–RL 攀升,将每轮 RL 中最难解决且最高效的回放返回给下一轮监督训练。由于推理时的上下文管理在这些基准测试上的价值超过大多数系统间报告的差异,我们在启用和不启用上下文管理两种情况下评估每个基准,保持工具集、上下文限制和评判器不变。所有结果均来自单个 ReAct 智能体,没有子智能体,也没有测试时验证。启用上下文管理后,在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 Humanity's Last Exam 上,两个模型分别达到 82.2/84.8/86.9/52.3 和 88.6/85.1/92.9/56.4,在各自参数范围内的开源搜索智能体中取得了最强的综合结果。我们计划发布模型权重以及数据构建、训练和评估的完整方法。
一句话总结
AllSpark团队推出Iris-mini和Iris-pro,分别为35B-A3B和397B-A17B规模的搜索agent,通过反向构建的多跳任务和新颖的SFT–RL迭代提升流程进行训练,在BrowseComp、BrowseComp-ZH、DeepSearchQA和Humanity's Last Exam上分别取得82.2/84.8/86.9/52.3和88.6/85.1/92.9/56.4的成绩,并具备上下文管理能力,在各自参数范围内达到开源模型最强结果。
核心贡献
- 推出Iris-mini和Iris-pro,分别在35B-A3B和397B-A17B规模上训练的搜索agent,其数据流水线从网页超链接结构反向构建多跳任务,重写实体以阻断字符串匹配捷径,仅保留参考模型在闭卷模式下无法回答但提供证据后能正确解答的问题。
- 结合轨迹级和回合级过滤(后者使用从数据中归纳出的评判规则),随后针对实时搜索进行强化学习,采用集群内评判与观察摘要,并配合迭代SFT–RL提升流程,将最难解决且最高效的rollout反馈到监督训练中。
- 在启用推理时上下文管理且固定其他所有组件的条件下,在BrowseComp、BrowseComp-ZH、DeepSearchQA和Humanity's Last Exam上分别取得82.2/84.8/86.9/52.3和88.6/85.1/92.9/56.4的成绩,为各自参数范围内开源搜索agent中的最强整体结果。
引言
搜索agent通过支持与外部工具交互和动态信息检索,将语言模型扩展到闭式推理之外,这要求模型决定搜索什么、如何解读证据以及何时停止。与任务、上下文和计算预算固定的传统语言模型评估不同,搜索需要长时程策略和稳健的训练数据,然而以往工作的性能差异往往更多来自推理时harness的选择而非底层策略。一个关键挑战是上下文管理(CM),长轨迹可能耗尽上下文窗口,从而压缩有效搜索预算;现有的摘要或历史删除等缓解手段模糊了性能究竟来自策略还是harness,限制了公平评估。
作者提出了一套构建搜索agent的端到端方案,涵盖数据构建、训练和评估。他们从网页图结构构建多跳任务,通过实体重写移除易于搜索的锚点,仅保留困难且可验证的问题。他们收集经过多阶段过滤的教师轨迹,随后通过针对实时搜索的强化学习优化策略,交替进行SFT和RL以强化成功行为。其系统Iris-mini和Iris-pro在四个基准(BrowseComp、BrowseComp-ZH、DeepSearchQA和Humanity's Last Exam)上取得开源agent中的最优性能,并通过固定其他组件隔离了CM的影响。该工作还发现搜索数据和模型能够正向迁移到通用工具使用和协同工作场景,表明搜索是一种原子能力而非垂直专门化,对更广泛的agentic训练具有启示意义。
数据集
作者构建了一个完全由LLM驱动的数据流水线,从网页语料的超链接结构反向构建问题。该流水线包含三个阶段:网页图构建、任务合成和双标准验证。
数据集构成与来源
- 语料被建模为有向图,节点为网页,边为超链接。
- 每个合成实例从种子页面开始,采用答案锚定模式采样,即固定目标答案实体并检索描述该实体的页面。
- 种子沿其出链扩展为局部子图,保留每个页面的完整文本并截断到固定预算。
- 真实出链集合从结构化语义镜像(RDF三元组)与渲染后的页面标记合并恢复,以最大化链接召回率。
任务合成
- 原始页面被提炼为包含至多n个实体和带类型语义关系的紧凑连通实体图,保留跨页链接结构。
- 提取器仅保留位于朝向种子主题的多跳路径上的实体和关系,形成密集的关系骨架。
- 问题与推理路径一起生成,硬约束为路径至少包含N个耦合关系,强制多跳依赖。
- 锚点抽象算子将每个非答案实体重写为描述性指称,移除可直接搜索的表面字符串。重写后的问题保留推理结构和答案,要求通过推理而非字符串匹配进行消歧。
双标准验证
- 参考模型在两种设置下评判每个问答对:
- 难度:模型在无工具条件下无法正确回答。
- 可解性:模型在给定实体图作为上下文时能正确回答。
- 仅保留同时通过两项标准的问答对,丢弃可从记忆中直接回答的简单问题以及答案错误或非唯一的问题。
- 答案等价性由语义匹配评判器判定。
数据使用
- 通过验证的抽象多跳问题集(每个问题配有已验证的唯一答案)用于轨迹生成。
- 作者还在生成数据之外加入了一些内部和开源问题集,但本节未详述具体混合比例。
方法
2 数据流水线
作者旨在训练一个能够处理无法仅凭参数记忆回答、需要综合多个来源分散证据的问题的搜索agent。自然出现的网页问题很少同时满足这两个条件,而手写问题成本高且难以规模化。因此作者构建了一个完全由LLM驱动的数据流水线,从网页语料的超链接结构反向构建问题。该流水线分为三个阶段:网页图构建、任务合成和双标准验证。
2.1 网页图构建
作者将语料建模为有向图,节点为页面,边为超链接:
G=(V,E),Out(v)={u∈V∣(v,u)∈E}.每个合成实例从采样策略抽取的种子页面开始:
v0∼Pseed(V),其中作者使用答案锚定模式,即固定目标答案实体并检索描述该实体的页面。种子随后沿其出链扩展为局部子图:
Gsub=({v0}∪N,Esub),N={vi}i=1k⊆Out(v0),保留每个页面的完整文本并截断到固定预算。由于渲染页面的阅读服务会剥离内联锚点,作者从语料的结构化语义镜像(RDF三元组)与渲染后的页面标记中恢复v的真实出链集合,并合并两个来源以最大化链接召回率。
2.2 任务合成
给定子图Gsub,该阶段通过三个步骤生成一个经过遮蔽的多跳问题:将页面提炼为实体图、在该图上编写问题、以及抽象掉所有可直接搜索的锚点。
实体图提取。 原始页面带有大量干扰问题生成的噪声。作者将Gsub提炼为紧凑的连通实体图:
Ge=(Ve,Re)=fext(Gsub),∣Ve∣≤n,其中Ve为显著实体,Re为保留Gsub跨页链接结构的带类型语义关系。提取器仅保留位于朝向种子主题的多跳路径上的实体和关系,形成可在其上精确编写问题的密集关系骨架。
多跳问题生成。 令y=theme(v0)表示种子主题,作者将其作为目标答案。他们在实体图上生成初始问题及其推理路径:
(q0,P)=fgen(Ge,y)s.t.∣P∣≥N∧y∈/q0,其中P=(e1⟶r1e2⟶r2⋯y)是Ge中的一条路径,其遍历唯一地得出y。硬约束∣P∣≥N强制问题至少依赖N个耦合关系。
锚点抽象。 具体锚点使agent能够通过直接搜索表面字符串绕过预期推理。作者通过抽象算子A移除这一捷径,将每个非答案实体重写为描述性指称:
A(e):name(e),alias(e)∈/A(e)∧A(e) uniquely identifies e,∀e∈Ve∖{y}.初始问题随后被重写为抽象形式:
q~=fabs(q0,A),将每个提及的实体e替换为A(e),同时保留推理结构和答案y。得到的q~要求通过推理消歧而非字符串匹配。
2.3 双标准验证
作者仅接受同时满足困难且可解条件的配对(q~,y),由参考模型Mref在两种设置下评判:
cdiff(q~)=I[Mref(q~)=y],csolv(q~)=I[Mref(q~∣Ge)=y],并且仅保留交集:
D={(q~,y)∣cdiff(q~)⋅csolv(q~)=1}.难度标准(闭卷、无工具)丢弃模型已能从记忆中回答的简单问题;可解性标准(提供Ge作为上下文)丢弃答案错误或非唯一的问题。答案等价性由语义匹配评判器判定。通过验证的抽象多跳问题集D(每个问题配有已验证的唯一答案)随后用于轨迹生成。
3 训练方案
作者通过监督微调(SFT)和强化学习(RL)的迭代循环来训练搜索agent。
3.1 监督微调
轨迹生成。 作者提示强教师模型MT在ReAct范式下解决D中的每个问题q,将推理、工具调用和观察与实时搜索工具交错进行。轨迹是推理步骤、工具调用和观察的序列,以最终答案结束:
τ=(r1,a1,o1,…,rT,aT,oT,rT+1,y^)∼πMT(⋅∣q,T),其中rt为第t步的推理,at∈T为工具集T={SEARCH,SCRAPE}中的工具调用,ot为返回的观察,y^为最终答案。每个观察是实时生成的文档级摘要而非原始页面,使轨迹保持在有界上下文预算内。
粗过滤。 令Draw={(q,τ)}为收集的轨迹池。每个样本必须通过轨迹级阶段,该阶段仅在τ正确、非退化且非平凡时接受。正确性是双重门控:rollout必须成功终止,且其答案必须被LLM评判器J对照参考y∗判定为正确:
ccorr(q,τ)=I[success(τ)]⋅I[J(q,y^τ,y∗)=CORRECT].作者随后移除退化轨迹:重复循环、失控的工具调用、未终止的思考块等病态情况。主要检测器是滑动窗口压缩比,在解码文本上以O(n)复杂度计算:
ρcr(w)=∣zlib(w)∣∣w∣,cdegen(τ)=I[wmaxρcr(w)≥τcr].重复文本的压缩程度远高于流畅文本,因此任何窗口的比率达到τcr即表明存在循环,无论其周期如何、从何处开始。辅助检测器覆盖压缩比单独无法捕捉的情况:周期性重复行、长单字符序列、以及参数逐字节相同的连续工具调用。最后,作者仅保留至少包含K次工具调用回合的轨迹,丢弃直接查找即可解决的浅层情况:
cdepth(τ)=I[Ttool(τ)≥K].对完整消息序列进行精确去重后,丢弃逐字节相同的轨迹,同时保留同一问题的不同rollout,得到粗过滤集:
Dsft=dedup{(q,τ)∈Draw∣ccorr⋅(1−cdegen)⋅cdepth=1}.细过滤。 粗过滤保留或丢弃整条轨迹。然而当问题接近教师能力边界时,正确轨迹中仍可能包含局部不佳的回合:冗余搜索、幻觉工具名称、或与实际采取动作不一致的推理。作为回合级细化,作者使用LLM评判器标注单个回合。难点在于,孤立看似浪费的回合往往是合理的探索步骤,且由于没有人工介入,评判器必须自行划定界限。因此作者从数据中归纳标准而非手工编写。具体而言,他们采样部分轨迹并让评判器以自由形式进行批评,然后将反复出现的失败模式(如误解问题)整合为最终评判提示中使用的明确规则。对于每个助手回合,评判器接收问题、参考答案和固定大小的周围回合局部窗口,输出KEEP或MASK,表示为mt∈{0,1}。为防止过度过滤,作者在任意轨迹中最多遮蔽10%的助手回合。被遮蔽的回合保留在上下文中但不参与训练损失,从而在不丢弃有用交互历史的情况下提供更干净的学习信号。
训练目标。 对于每个助手回合,令C<t表示其可见历史,由harness的重放算子从追加式对话中重建,以保持与agent在推理时条件化的内容逐字节一致。作者在D^sft上最大化教师输出的似然:
LSFT(θ)=−E(q,τ)∼Dsftt=1∑T+1mtlogπθ(ut∣C<t),其中ut为第t个回合的助手输出,即对于t≤T为推理和工具调用(rt,at),对于t=T+1为最终推理和答案(rT+1,y^)。回合级掩码mt∈{0,1}由细过滤提供;观察、用户和系统token按构造不产生损失。
3.2 强化学习
作者随后针对实时搜索使用组相对策略梯度优化agent。为使长时程rollout在不必完全异步的情况下保持可负担,他们通过请求级部分rollout将rollout机制置于在线和离线策略之间。为避免训练时依赖外部API,他们在集群内共同部署一个内部模型,同时充当奖励评判器和观察摘要器。
部分rollout与前缀复用。 长时程rollout具有重尾分布:少数会话运行时间远超其他会话并阻塞同步步骤。作者没有像任务级流式处理那样丢弃未完成的工作,而是在请求级中断。一旦一个步骤已提交足够多的完成轨迹,进行中的过采样会话将被中止,并在下一步从其已提交前缀恢复。Rollout组织为森林结构,节点为消息状态,每个节点缓存其token、损失掩码、对数概率和权重版本增量,因此恢复的轨迹是将不同策略权重下生成的前缀拼接起来的路径,作者通过截断重要性采样修正这一不匹配。完成的回合因此被复用而非丢弃,这使得在同步、共置调度下rollout GPU保持忙碌,代价是约2×的过采样作为余量。
集群内奖励与摘要。 作者不调用外部API,而是在训练集群内与actor和rollout引擎一起运行多个内部Qwen3.5-397B-A17B模型的FP8引擎。作为生成式奖励模型(GenRM),该模型对提取答案y^τ对照参考y∗给出二元判定来评分rollout:
R(q,τ)=I[GenRM(q,y^τ,y∗)=A],无附加格式项,因为空答案或思考中途截断的答案提取为∅,无需调用评判器即得0分。作为摘要器,相同引擎将每个检索页面压缩为简短、与查询相关的摘要,提供式(10)中的观察ot。这是rollout中唯一的上下文缩减机制,没有消息历史剪枝或滑动窗口,因此策略条件化的上下文与训练时的上下文完全一致。在集群内同时承担两个角色消除了训练循环中的外部API依赖,一次分配同时覆盖训练、rollout和奖励。
3.3 迭代提升
作者在迭代循环中交替进行SFT和RL。每轮RL探索当前策略,之后一小部分高质量rollout通过监督微调蒸馏回策略中;RL随后从更新后的模型继续。作者将每个这样的循环称为一次提升。这种交替互补了两种目标的优势:RL通过相对奖励改进当前策略采样的行为,而监督微调直接强化罕见但成功的轨迹,而非依赖其对组相对梯度的贡献。
对于每个查询q,作者从其现有RL样本中最多保留一个rollout。令Rˉ(q)表示其rollout组内的通过率。他们选择满足0<Rˉ(q)≤1/2的查询,针对可解决但尚不可靠的情况。在成功rollout中,要求至少Krft次工具调用回合,然后选择最短的有效轨迹:
Sq={τi∣R(q,τi)=1,Ttool(τi)≥Krft},τq⋆=τ∈SqargminTtool(τ).深度约束过滤掉侥幸或琐碎的解决方案,而最短轨迹标准抑制不必要的搜索。所得集合经去重后用于下一轮RL之前的SFT。由于难度区间由当前策略的通过率定义,随着策略改进,它会自动向更难的示例移动,提供简单的自定进度课程,并在候选池缩减时给出自然的停止信号。
实验
评估覆盖四个基准(BrowseComp、BrowseComp-ZH、DeepSearchQA和HLE),涉及两种模型规模Iris-mini和Iris-pro,在无上下文管理和全部丢弃两种设置下测试。Iris-mini在三个基准上领先其参数范围,而Iris-pro在全部四个基准上领先或持平,两个模型与更大系统相比均表现出竞争力。上下文管理一致地提升结果,增益与模型耗尽上下文的频率相关,重试策略可推高分数但推理成本显著,因此全部丢弃被作为默认报告配置。
在30–35B参数范围内,Iris-mini在四个基准中的三个上取得最佳结果,在BrowseComp和BrowseComp-ZH上优于同规模竞争者,但在DeepSearchQA上落后。在约400B范围内,Iris-pro在全部基准上领先或持平,包括在BrowseComp和HLE上相对于XYZ-Aquila-pro的显著提升。模型在无上下文管理时也展现出较强的内在搜索能力,而上下文管理一致地提升性能,较小模型的增益更大。Iris-mini在BrowseComp上以3.4分领先XYZ-Aquila-mini,但在DeepSearchQA上落后。Iris-pro在其规模范围内全部四个基准上领先或持平,最大差距出现在BrowseComp。无上下文管理时,Iris-mini在BrowseComp和BrowseComp-ZH上优于FORT-Searcher、OpenSeeker-v2和RED-Searcher。上下文管理对Iris-mini的性能提升大于Iris-pro,因为较小模型更频繁地耗尽上下文。在BrowseComp-ZH上,三种配置收敛到相同分数,表明存在基准特定的上限。
上下文管理(CM)一致地提升搜索agent相对于无CM基线的性能,较小模型Iris-mini的增益大于Iris-pro。CM的收益在需要长时程信息搜索的基准上最为显著,此时上下文耗尽成为限制因素,而将全部丢弃与重试结合可获得最高分数,但推理成本显著。CM在所有评估设置中均提升相对于无CM基线的性能,Iris-mini在BrowseComp上的增益最高达21.2分。Iris-mini从CM中获益多于Iris-pro,因为较小模型更频繁地耗尽上下文,有更多可恢复的空间。最大的CM增益出现在BrowseComp上,该基准需要长时程搜索,而HLE增益较小,因为其瓶颈在于知识和推理而非上下文。将全部丢弃与重试结合在大多数设置中取得最强结果,但增加的推理成本使其成为上界探索而非主要配置。无CM时,Iris-mini和Iris-pro在BrowseComp和BrowseComp-ZH上优于若干现有搜索agent,表明其具有较强的内在搜索能力。
在30–35B参数范围内,Iris-mini在四个基准中的三个上领先,在BrowseComp和BrowseComp-ZH上优于同规模竞争者,但在DeepSearchQA上落后。在约400B范围内,Iris-pro在全部基准上领先或持平,最大优势出现在BrowseComp。两个模型在无上下文管理时均表现出较强的内在搜索能力,而添加上下文管理一致地提升性能,较小模型的增益更大,因为它更频繁地耗尽上下文。收益在BrowseComp等长时程任务上最为显著,而HLE因知识和推理瓶颈增益较小;将全部丢弃与重试结合可获得最高分数但推理成本显著,在BrowseComp-ZH上三种配置收敛到相同分数,表明存在基准特定的上限。