Command Palette
Search for a command to run...
SearchOS-V1:迈向稳健的开放域信息搜索智能体协作
SearchOS-V1:迈向稳健的开放域信息搜索智能体协作
摘要
工具集成大语言模型的最新进展使网络搜索成为信息搜索智能体的核心能力。然而,随着交互历史增长,智能体越来越难以跟踪任务进展。当搜索尝试未能产生有用证据时,当前的单智能体和多智能体系统可能陷入重复循环,浪费搜索预算,最终损害最终输出的质量和完整性。我们提出SearchOS,一个系统级多智能体框架,将脆弱的隐式搜索进展转化为显式、持久且共享的状态。首先,我们将开放域信息搜索形式化为带接地引用的关系模式补全,其中智能体发现实体,填充关联表中的属性,并将每个值锚定到源证据。然后,我们设计了面向搜索的上下文管理(SOCM),将演化状态外部化为前沿任务、证据图、覆盖图和失败记忆。基于SOCM,SearchOS应用管道并行调度机制,重叠执行子智能体,并持续用针对未解决覆盖差距的任务重新填充释放的槽位,以提高利用率和吞吐量。为调度和控制搜索智能体的执行,SearchOS引入搜索工具中间件控制层,拦截模型和工具交互以记录接地证据并对停滞或预算耗尽做出反应,并提供可重用的分层技能系统,包括策略和访问技能,以增强智能体的搜索过程并避免跨运行重复失败的搜索模式。在WideSearch和GISA上,SearchOS在所有评估的单智能体和多智能体基线中领先所有指标,为稳健的信息搜索协作铺平了道路。
一句话总结
SearchOS,一个来自中国人民大学和蚂蚁集团的多agent框架,通过面向搜索的上下文管理(SOCM)将隐式的搜索进度转化为显式的共享状态,该管理包含前沿任务、证据图、覆盖图和失败记忆,并采用流水线并行调度,实现了鲁棒的开放域信息搜索协作,在WideSearch和GISA上超越了基线模型。
核心贡献
- 面向搜索的上下文管理(SOCM)将搜索进度外化为前沿任务、证据图、覆盖图和失败记忆,并配合流水线并行编排,将未解决的覆盖缺口分派给专门的agent。
- 搜索工具中间件框架拦截模型与工具的交互,以锚定证据、执行搜索预算并检测停滞或重复,将执行控制移出agent提示之外。
- 分层技能库提供可复用的搜索策略和特定站点的访问流程,增强agent行为并防止跨会话重复失败的搜索模式。
引言
作者们致力于解决从大型语言模型构建可靠、长时程网络搜索agent的挑战。虽然工具增强的LLM可以迭代搜索和综合信息,但随着交互历史的增长,它们会遇到困难:证据被淹没,覆盖缺口被忽视,agent在冗余或死胡同查询上浪费预算。多agent设置往往因重复工作和闲置工作者而加剧这些问题,因为协调状态仅短暂存在于对话日志中,而非显式维护。作者们引入了SearchOS,一个将搜索进度外化为共享、系统管理状态的框架。它将开放域信息搜索形式化为带有锚定引用的关系模式补全,然后通过流水线并行编排协调专门的agent,持续分派未解决的缺口。中间件框架执行预算限制、锚定证据并检测停滞,而分层技能库提供可复用的搜索策略和特定站点的访问流程。
方法
作者们将开放域信息搜索形式化为带有锚定引用的关系模式补全。给定自然语言请求,系统构建一个关系搜索模式,包含具有属性和主键的表,以及外键关系。目标是发现实体,填充值矩阵,并维护一个将每个值链接到源URL和锚定摘录的引用矩阵。
为实现此目标,作者们引入了SearchOS,一个有状态的闭环系统,使执行与不断演变的搜索状态对齐。
如框架图所示,SearchOS通过编排器分派未解决的模式缺口,通过面向搜索的上下文管理(SOCM)提交观察结果,并通过中间件锚定交互。系统采用编排器-工作者架构,其中编排器构建模式并确定缺口优先级,探索agent识别候选者,搜索agent收集锚定证据,写作者生成最终的引用报告。
SOCM将长时程搜索信息外化为持久的共享状态,包括前沿任务、证据图、覆盖图和失败记忆。前沿任务充当依赖感知的任务池,根据优先级和依赖关系调度工作。证据图存储原子发现及其细粒度溯源,而非页面级摘要,将值与来源和支持片段链接。覆盖图物化模式单元格以跟踪其状态,确保进度可衡量。最后,失败记忆记录不成功的行动,防止agent重复已穷尽的路径。
为避免同步批次导致的空闲时间,作者们将流水线并行应用于角色范围的工作。编排器根据前沿优先级,持续从就绪集合向可用执行槽分派任务。每次完成后,SOCM更新,释放的槽被重新填充,允许角色在依赖关系允许时重叠执行。
在长时程搜索过程中,agent面临模型级故障和系统级中断。为解决此问题,作者们引入了一个系统级的搜索工具中间件框架,在模型和工具边界拦截agent循环。
如下图所示,该框架由三个组件组成。上下文中间件通过投影共享状态、检索技能并在每次模型调用前修剪历史,准备角色特定的模型上下文。证据提取中间件处理工具观察结果以提取模式绑定的候选者,要求在原子更新证据图和覆盖图之前进行模式绑定和片段锚定。传感器中间件测量覆盖和证据进度以检测停滞并执行资源限制,决定是继续执行、注入修正还是停止分支。
由于搜索需要在不同操作层面具备可复用的知识,作者们将其组织成分层搜索技能:编排器技能、策略技能和访问技能。
如下图所示,SearchOS-V1包含280个跨不同领域的预构建技能。编排器技能提供任务分解和模式对齐的全局剧本。策略技能编码与来源无关的查询重构和推理方法。访问技能处理数据库、政府门户和其他目录的特定来源检索和提取。启动时,编排器技能作为共享剧本注入,而策略和访问技能根据任务需求检索和执行。
实验
SearchOS在WideSearch和GISA两个基准上进行了评估,这两个基准分别用于大规模信息收集和一般信息搜索任务。它超越了单agent和多agent基线,在召回率和完整性敏感的指标上增益最大,展示了关系模式补全和覆盖感知分派的好处。消融研究证实,搜索时的模式规划、连续流水线调度、循环传感器干预和分层技能均有助于提高有效性和效率,其中技能显著减少了会话时间,同时提升了行级一致性。
工具分配强制执行严格的职责分离:仅编排器管理模式、实体和任务协调,而搜索和探索agent共享浏览器工具进行证据收集。写作者被赋予大纲管理、共享上下文访问和技能加载,以生成结构化报告,搜索agent也可以加载技能来指导检索。只有编排器可以访问模式和实体的CRUD操作及任务队列工具,集中全局规划和协调。搜索和探索角色均被授予简单的浏览器工具,但都不能修改模式或任务队列。写作者角色被赋予大纲管理和SOCM读取权限,使其无需直接浏览即可构建最终报告。技能目录工具在搜索和写作者角色之间共享,允许可复用的检索模式为证据收集和报告生成提供信息。
SearchOS在WideSearch和GISA两个基准的所有主要F1指标上均领先。在WideSearch上,它将项目级F1提高了4.3个百分点,超越最强基线,这得益于大幅的召回率提升,同时保持了最高的精确率。在GISA上,最大的增益出现在集合问题上,它比最佳基线高出13.4个百分点,展示了答案枚举的强完整性。在WideSearch上,SearchOS取得了最佳的项目级精确率(83.9)和召回率(79.7),F1达到80.3,比最强基线提高了4.3个百分点,增益集中在召回率上。在GISA上,SearchOS在集合问题上的F1达到76.5,领先最佳基线13.4个百分点,并且在表级F1的项目(76.9)和行(59.7)层面也位居榜首。
自主模式规划优于任何固定模式选择,即使由预言机为每个任务选择单表或多表模式中较好的一种。多表模式相对于单表模式的优势因任务而异,SearchOS通过主要选择单表结构来适应,同时仍超越预言机。这些结果表明,模式规划应作为搜索过程的一部分,而非预先固定。固定多表模式相比固定单表模式将项目F1提高了十多个百分点,但收益依赖于任务。为每个案例选择较好固定模式的预言机仍落后SearchOS超过八个项目F1点。SearchOS在大多数任务中自主选择了单表模式,却取得了最高的总体得分。SearchOS与预言机之间的持续差距表明,动态模式规划捕捉到了固定模式所遗漏的任务特定结构。
连续调度在重复运行中持续减少端到端时间和token消耗,同时提高检索质量。在三轮配对中,中位时间下降28.6–32.6%,每轮项目F1均上升,平均时间减少24.3%。收益来自立即重新填充释放的槽,消除了批次屏障处的空闲容量。三轮中中位端到端时间下降28.6–32.6%,显示出稳定的效率提升。所有轮次的项目F1均有改善,中位增益最高达15个百分点。
与WideSearch上的批次调度相比,连续流水线并行调度将端到端时间减少了24.3%,同时提高了槽利用率、任务吞吐量和项目F1。该策略消除了批次屏障处的空闲容量,以更少的LLM调用实现了更高的效率和更好的检索质量。连续调度将平均时间从629秒降至476秒,并将槽利用率从34.6%提高到41.7%。它将项目F1提高了约7个点(从79.66到86.75),每分钟任务数从2.99提高到3.37,同时LLM调用减少了13%。
SearchOS中严格的角色分离集中了规划和协调,仅编排器管理模式和任务,而搜索和写作者角色共享适当的工具。在WideSearch和GISA基准上,SearchOS取得了最先进的结果,这得益于大幅的召回率提升和集合问题上的强完整性。自主模式规划甚至优于预言机选择的最佳固定模式,而连续调度消除了空闲容量,持续减少端到端时间和token消耗,同时提高检索质量。