Command Palette
Search for a command to run...
Dr. Claw:面向氛围研究的人工智能科学家工作空间
Dr. Claw:面向氛围研究的人工智能科学家工作空间
摘要
命令行编码代理(例如 Claude Code、Gemini CLI)已经能够读写文件并维持长时间会话,然而端到端研究仍然分散在聊天工具、IDE、终端和写作环境中,而且使研究可审计的决策很少被保留。我们提出了 Dr. Claw,一个开源工作空间,它包装现有的编码代理执行器,在可控且可审计的人机协同工作流程中运行,而不是引入另一个自主代理。持久化状态对象、可复用的技能库以及多执行器协调将人类决策与人工智能执行联系起来,将规划、执行和写作转化为一个可追踪、可恢复的循环。我们通过一个交互式三视图场景和一个故障恢复演练来演示 Dr. Claw,并将其与共享相同后端执行器的裸命令行代理进行评估,从而对比整个编排层(任务图、状态对象和技能库)与其所包装的代理。在保持执行器固定的情况下,Dr. Claw 在研究完整性方面得分更高,同时持久化了可审计、可恢复的过程轨迹。演示访问:仓库 https://github.com/OpenLAIR/dr-claw,以 AGPL-3.0 许可证发布,包含 GPL-3.0 上游组件。
一句话总结
来自理海大学、伊利诺伊大学芝加哥分校、宾夕法尼亚大学、马里兰大学、圣母大学和不列颠哥伦比亚大学的研究人员提出了 Dr. Claw,一个开源工作区,将现有的编码 agent 执行器封装在可控、可审计的人机协同工作流中,利用持久化状态对象、可复用的技能库和多执行器协调机制将人类决策与 AI 执行相连接,并证明在保持执行器不变的情况下,与裸命令行 agent 相比,它实现了更高的研究完整性和可追踪、可恢复的过程轨迹。
核心贡献
- 形式化了 Vibe Research,一种人机协同的研究编排范式,将 AI 执行与人类决策职责分离,区别于端到端自主方法。
- 在 Dr. Claw 中实现了该范式,这是一个开源工作区,封装现有的命令行编码 agent,具有以任务图为中心的编排、聊天驱动的规划器、模块化技能库(五个研究阶段映射了 58 个技能,部署目录中有 171 个)以及与主流编码 agent 兼容的多 agent 执行层。
- 一项受控试点评估(保持后端执行器固定)表明,Dr. Claw 通过弥补研究卫生缺口,在研究完整性上得分高于裸 agent,同时持久化可审计、可恢复的过程轨迹;一项回顾性研究进一步将集成工作流与非集成工作流相比,关联到效率、质量和可用性的提升。
引言
大型基础模型和 agent 工具推进了五项核心研究操作,命令行编码 agent(如 Claude Code 和 Gemini CLI)通过驻留在终端中并维持上下文,在执行方面表现出色。然而,这些 agent 优化的是执行而非控制:使研究可审查的计划、中间决策和产物散落或丢失,留给人类的明确接管点很少。瓶颈已转向全流程编排,因为研究人员仍需在分解、调度、跟踪、验证和写作之间切换不同工具,这削弱了可复现性和交付可靠性。人机交互证据表明,协作成本主要由验证和上下文维护主导,过程可见性和可中断控制至关重要,但现有演示在改善可用性的同时,未解决跨阶段状态连续性或产物闭环管理问题。
作者提出了 Dr. Claw,一个一站式工作区,将规划、执行和写作统一为可控、可追踪、可恢复且可审计的研究循环。他们形式化了一种名为 Vibe Research 的范式,这是一种人机协同方法,用户以自然语言陈述高层目标和约束,AI 将其编译为可执行循环,而人类保留对方向、评估标准和最终验收的控制。Dr. Claw 封装现有的命令行编码 agent,而非引入新的执行器,增加了这些 agent 所缺乏的状态、控制和审计层。它具备以任务图为中心的编排、聊天驱动的规划器、包含 58 个阶段映射技能的模块化技能库,以及多 agent 执行层。作者通过保持后端执行器固定来评估 Dr. Claw,表明它通过弥补研究卫生缺口在完整性上得分更高,同时持久化可审计的过程轨迹;一项回顾性人类研究将集成工作流与非集成方法相比,关联到效率、质量和可用性的提升。
方法
3 系统概述
Dr. Claw 围绕一个核心问题设计:如何让研究人员在连续工作流中完成问题定义、实验推进和论文产出,而非在孤立工具之间切换。它将研究建模为显式可追踪的工作流,将人类决策与 AI 执行组织为稳定的协作结构。
3.1 设计目标与系统抽象
Dr. Claw 编排四个状态对象:任务图、产物存储、决策日志和执行轨迹。它们共同将交互历史转换为可审查的过程,支持迭代编排而非一次性生成:用户提供高层目标和约束,系统将其映射为可执行任务,并支持持续检查和接管。一次任务交互是一次状态转换:
Statet+1=f(Statet,Actiont,Obst),其中 State 表示时间 t 时的工作流状态(由任务图、产物存储、决策日志和执行轨迹共同构成),Actiont 是系统或用户触发的动作,Obst 是观察到的反馈。这一表述强调 Dr. Claw 优化的是迭代状态更新,而非单一响应。
3.2 三层系统架构
Dr. Claw 使用三个协作层:
- 交互:用于聊天、任务视图、文件和版本操作的综合工作区。
- 编排:从高层意图到阶段任务的状态和生命周期管理。
- 执行:跨异构执行器的后端调用、结果返回和异常处理。
该设计支持在不改变工作流语义的情况下切换后端,同时保持统一的状态和审计视图。
参考框架图:
3.3 以工作流为中心的交互循环
给定一个研究想法,系统生成结构化简报和依赖感知的任务计划,然后运行规划-执行-验证-写回的工作流步骤。执行输出写入产物存储,任务状态在任务图中更新,所有干预保留在决策日志和执行轨迹中。该工作流支持带显式人类检查点的长周期迭代。
3.4 基于技能的能力与多执行器协调
Dr. Claw 提供可复用的技能库,涵盖构思、文献处理、实验、分析和写作。每个技能是一个目录,包含 SKILL.md 清单,其 YAML frontmatter 声明名称和描述,通常还包括版本、许可证、允许的工具以及阶段或领域标签。技能在激活前经过版本化和模式检查,并通过三条路径到达任务:阶段-技能映射将任务的阶段和类型解析为一组建议技能,这些技能附加到任务节点并注入其下一步动作提示;对用户指令和任务文本的关键词检测可自动加载技能;用户也可以从技能仪表板手动调用任何目录技能。Dr. Claw 还在一个项目上下文中协调多个执行器,使用户可根据任务类型切换执行策略,并在失败或违反约束时重试、修订或接管,而不破坏全局状态。
3.5 安全与可控性机制
鉴于外部调用和代码执行的风险,Dr. Claw 将权限管理视为一等机制,支持细粒度的工具和命令策略,区分安全默认设置与可信扩展设置。仅当动作属于当前策略定义的动作集时才允许执行:
Actiont∈A(Policyt),其中 Policy 是时间 t 时的权限配置,A(Policyt) 是可执行动作空间,保证执行能力与安全边界之间的一致性。
实验
评估展示了 Dr. Claw 的编排层在开放式研究任务中相对于裸命令行编码 agent 的表现,表明它通过研究卫生要素(如局限性部分、亚组分析和真实引用)提高了研究完整性(合并 0.952 对 0.873),同时在建模严谨性上保持一致。该系统还通过持久化的任务图和执行轨迹提供可审计的追踪性,尽管试点结果尚未达到统计显著性。一项独立的故障恢复演示显示了从诱导错误中进行的非破坏性就地恢复,保留先前产物。一项涉及七名 AI 博士研究人员的回顾性人类研究将 Dr. Claw 与无 AI 和通用 AI 助手基线相比,关联到更短的完成时间、更高的输出质量、更少的工具切换和显著更好的用户体验。
Dr. Claw 的独特之处在于结合了持久化研究状态对象、运行中接管和封装现有 CLI agent,而先前系统通常仅支持这些能力的子集。设计强调可控性和可审计性而非原始自动化,结构化产物支持就地恢复和人类监督。Dr. Claw 是唯一结合封装 CLI agent、内置研究状态、就地恢复和运行中接管的系统。大多数端到端自主系统支持无人值守操作,但缺乏运行中接管和内置研究状态。Dr. Claw 持久化可查询的任务图、执行轨迹、决策日志和主张到证据的映射,而裸 agent 不持久化任何内容。在故障恢复演示中,Dr. Claw 就地恢复,保留所有先前文件并添加修正产物。在人类研究中,与无 AI 工具或通用助手相比,Dr. Claw 关联到更短的完成时间、更高的输出质量、更少的工具切换和更好的自我报告体验。
Dr. Claw 作为一个系统被评估,它独特地结合了持久化研究状态、运行中接管和封装现有 CLI agent,不同于仅支持这些功能子集的先前系统。设计优先考虑可控性和可审计性,结构化产物支持就地恢复和人类监督。故障恢复演示显示 Dr. Claw 保留先前文件并添加修正输出,人类研究报告了与无 AI 工具或通用助手相比更短的完成时间、更高的输出质量、更少的工具切换和更好的用户体验。