HyperAIHyperAI

Command Palette

Search for a command to run...

Cura 1T:通过人工把关的自进化循环训练的医疗专用大语言模型

Haolin Chen Leon Qi Steve Brown Deon Metelski Tao Xia Joonyul Lee Qixuan Wang Kevin Riley Frank Wang Weiran Yao

摘要

医疗领域涉及高风险沟通、专家推理和工作流程执行,但能同时覆盖这些用例的专用大语言模型仍然有限。一个医疗模型必须处理患者咨询、基于文本和图像的临床推理、交互式诊断以及电子健康记录工具的使用。这些能力在不同方面可能失效,针对某一任务的狭隘更新可能会削弱其他能力。我们提出了Cura 1T,一个通过人工把关的自进化循环训练的医疗专用大语言模型。在每个进化轮次中,训练代理规划目标能力、训练模型、评估基准轨迹,并根据观察到的失败情况优化数据混合。这种以数据为中心的循环通过有针对性的合成和精选示例来改进模型,而非进行单一的通用医疗数据更新。在医疗评估套件中,Cura 1T在顶尖基线模型中排名靠前或接近顶尖,同时在领域外推理和代理基准测试中保持竞争力。

一句话总结

Actava AI 的 Cura 1T 是一款医疗领域专用的大语言模型,通过人类把关的自我进化循环训练而成:每轮训练中,一个训练 agent 规划目标能力、训练模型、评估 benchmark 轨迹,并从观察到的失败中优化数据混合,从而产生有针对性的合成和精心筛选的示例;在医疗评估套件中,它在前沿基线中排名靠前或居于首位,同时在领域外推理和 agentic benchmark 上保持竞争力。

核心贡献

  • 人类把关的自我进化循环诊断 benchmark 失败,并迭代构建有针对性的训练数据混合,使医疗专用 LLM 能够系统性地改进,而无需进行单一的通用医学更新。
  • 通过该循环训练的 Cura 1T 在涵盖患者护理、临床推理和 agentic EHR 任务的医疗评估套件中,在前沿基线中排名靠前或居于首位。
  • 领域外 benchmark(AIME、GPQA-Diamond、τ²-Bench)显示 Cura 1T 保持竞争力,表明医疗专业化并未损害基础模型的通用推理和 agentic 能力。

引言

前沿语言模型可以回答复杂的临床问题,但将其部署在医疗领域需要一个能够可靠处理三种不同用例的单一模型:面向患者的、符合指南的响应,专家级的多模态临床推理,以及使用电子健康记录并遵循严格协议的多轮 agentic 工作流。之前的工作已经产生了强大的独立组件——基于评分量表的对话 benchmark,多模态试题,以及模拟诊断任务——然而,一个在所有三个领域都表现良好的统一模型仍未得到充分探索。构建这样一个模型主要是一个数据构建的挑战:医疗训练信号稀疏,示例分散在不同的模态和工作流中,添加数据以提升某一能力往往会损害另一能力。作者通过引入 Cura 1T 来解决这一问题,这是一个通过人类把关的自我进化循环训练的医疗专用大语言模型。在这个循环中,一个 LLM agent 规划一轮训练,训练低秩适配器,评估生成的模型,读取失败轨迹,并策划下一次数据混合,以系统地修复缺陷而不造成遗忘。

方法

作者开发了 Cura 1T,一个一万亿参数模型,在 Kimi-K2.6 上进行后训练,用于患者护理、临床推理和医疗 agentic 任务等医疗用例。为了高效训练该模型,他们围绕轻量级适配器训练栈和由训练 agent 编排的自我进化循环构建了训练基础设施。

如下图所示:

自我进化循环作为一个闭环系统运行,其中数据配方是主要的搜索对象。过程从计划阶段开始,训练 agent 定义目标行为、benchmark、指标和数据配方,然后通过人类计划审批。接下来,训练阶段执行 LoRA 适配器训练。随后是评估阶段,agent 运行 benchmark,收集轨迹并分析失败情况。优化阶段利用这些失败轨迹进行根本原因分析,合成有针对性的数据,策划下一次混合,并验证候选行。最后,人类审查关卡决定是否保留、还原、继续优化或部署候选模型。

训练协议实现为一个薄适配器训练栈,包含三个顺序阶段。监督微调(SFT)作为一个低成本的先决步骤,用于验证提议的数据混合和超参数是否格式良好并能稳定训练。一旦通过此筛选,该轮次继续通过强化学习(RL)进行奖励驱动的改进。最后一步是自蒸馏微调(SDFT),它从自身的在线策略样本中训练模型,使其逼近以额外特权上下文为条件的教师分布。对于提示 xxx、特权上下文 ccc 和学生样本 yπθ(x)y \sim \pi_{\theta}(\cdot \mid x)yπθ(x),SDFT 目标定义为: L(θ)=DKL(πθ(x)π(x,c))=Eyπθ(x)[logπθ(yx)π(yx,c)]\mathcal{L}(\theta) = D_{\mathrm{KL}}(\pi_{\theta}(\cdot \mid x) \parallel \pi(\cdot \mid x, c)) = \mathbb{E}_{y \sim \pi_{\theta}(\cdot \mid x)} \left[ \log \frac{\pi_{\theta}(y \mid x)}{\pi(y \mid x, c)} \right]L(θ)=DKL(πθ(x)π(x,c))=Eyπθ(x)[logπ(yx,c)πθ(yx)] 这里,πθ(x)\pi_{\theta}(\cdot \mid x)πθ(x) 是学生分布,π(x,c)\pi(\cdot \mid x, c)π(x,c) 是特权上下文教师分布。特权上下文 ccc 代表用于生成干净教师轨迹的额外信息,例如经过干预的轨迹或经过验证的知识。学生在此上下文移除后仅看到原始提示,将更新锚定在模型能够原生产生的轨迹上。

数据优化管道通过多种 agent 技能合成新轨迹来增强数据混合。推理修正使用前沿模型编辑失败的推理痕迹,同时保留原始问题形式以生成新问题。知识注入识别缺失的临床知识,用检索到的文档进行 grounding,并合成闭卷问答行。行为校准比较期望的和观察到的回答行为,以合成评分量表并生成条件响应。保留锚点为模型已经处理的能力添加少量示例,以防止灾难性遗忘。在进入新混合之前,这些合成行通过验证门检查格式、安全性、PII 风险、重复和覆盖范围。经过策划的数据混合,涵盖推理、行为、知识、agentic 和保留输入,随后被输入到训练栈中以产生候选模型。

实验

评估涵盖多样化的医疗 benchmark,验证面向患者的响应质量、临床推理、交互式诊断和 FHIR 工具使用的可靠性,同时领域外检查确认通用能力的保留。自我进化管道针对特定的失败模式,如脆弱的 EHR 写入、遗漏的评分量表要点、缺失的临床知识以及过早诊断,通过有针对性的合成数据和检索策略加以解决,通常会回退那些导致子集性能下降的轮次。Cura 1T 在这些任务上匹配或超越前沿对比模型,并在领域外 benchmark 上保持有竞争力的推理和 agentic 性能。

Cura 1T 在所有五个医疗 benchmark 上相对 Kimi-K2.6 基础模型均有提升,其中 HealthBench Professional 和 Hard 的绝对增益最大。在 MedAgentBench、MedXpertQA 和 AgentClinic 上的提升证实了模型在患者护理、临床推理和 agentic 任务方面的增强。领域外评估表明,这些医疗增益并未侵蚀通用推理或 agentic 能力。Cura 1T 在 HealthBench 上取得了最大增益,Professional 的评分量表分数提高了 0.159,Hard 提高了 0.146。MedAgentBench 的任务成功率从 0.847 提升至 0.940,显示出医疗 agent 工作流的显著改进。MedXpertQA pass@1 提高了 0.086,使 Cura 1T 在多模态医学推理上仅次于 GPT-5.5。AgentClinic 有 0.042 的适度增益,模型在相同的工具原生 harness 下与最佳报告的 NEJM 分数相当。领域外测试确认 Cura 1T 在数学、科学和非医疗 benchmark 上保持了前沿水平的推理和 agentic 性能。

自我进化循环结合了规划、训练、评估和优化,并采用有针对性的修正策略,将失败轨迹转化为改进的训练混合。单纯的推理修正往往会降低性能,除非同时进行知识注入并保留正确回答的案例。该方法提高了医学问答准确性和临床证据收集分数,整合后的模型既保留了专业增益,又匹配了通用推理和 agentic 能力。仅进行推理修正的轮次在 MedXpertQA 上被回退,因为它们缺乏事实覆盖并降低了整体准确率。带有保留和混合优化的知识注入将 MedXpertQA pass@1 提升至 0.636,高于基础模型。带有保留的交互式轨迹训练将 AgentClinic pass@1 从 0.754 提升至 0.807,其中 NEJM 和 NEJM-Ext 的增益最大。整合后的 Cura 1T 模型保留了大部分 AgentClinic 增益(0.796),并在领域外推理和 agentic benchmark 上的表现与前沿模型相当。

迭代的工具使用训练和轨迹保留将模型的任务成功率从 0.883 提升至 0.967,经过 harness 修复后提升至 0.973。整合后的 Cura 1T 模型达到 0.940,超过了最强的 frontier 系统(0.937),但仍低于完全优化的管道。通过两轮训练,带有保留的工具使用训练将成功率从 0.883 提升至 0.967。整合后,Cura 1T 优于最佳 frontier 模型(0.940 vs 0.937),但未达到 0.973 的峰值优化分数。

从 HealthBench 分数适中的基础模型开始,一次广泛的行为修正提升了综合性能,但损害了一个子集并被回退。随后的更干净的行为混合同时提升了 Professional 和 Hard 分数,而没有该子集损失,最终的整合模型达到了最强的 Professional 分数,同时保持接近最佳的 Hard 分数。基础模型的失败主要是遗漏了要求的评分量表要点,而非明确的惩罚违规。行为修正提升了综合分数,但在特定子集上造成了大幅下降,强制回退。干净的行为混合将 Professional 提升至 0.634,Hard 提升至 0.372,没有之前的子集退化,并被保留。整合后,Cura 1T 取得了最高的 Professional 分数 0.662,Hard 分数保持在 0.368 接近最高水平。

基础模型在 MedXpertQA 上表现中等。仅推理的干预降低了整体准确率并被回退。带有保留的知识注入,随后进行混合优化,逐步提高了分数,整合后的 Cura 1T 模型达到了最高的整体 pass@1,超越了基础模型和 Claude Opus 4.8,但仅次于 GPT-5.5。仅推理修正及其扩展变体均表现不如基础模型,导致它们被回退。带有保留和混合优化的知识注入各自提高了整体 pass@1,其中混合优化在整合前取得了最强的保留结果。Cura 1T 结合了这些增益,整体达到 0.655,优于基础模型和 Claude Opus 4.8,但落后于 GPT-5.5。

Cura 1T 通过自我进化循环优化,结合了修正策略、知识注入和成功轨迹的保留,在所有五个医疗 benchmark 上均较基础模型有所提升,其中 HealthBench Professional 和 Hard 的增益最大,同时保持了前沿水平的通用推理和 agentic 性能。进化循环揭示,仅推理修正往往会降低准确性,除非与事实知识相结合,并且迭代的工具使用训练与轨迹保留显著提升了医疗 agent 的成功率。整合后的模型在医学问答、临床推理和 agentic 任务上匹配或超越前沿系统,证实其专业化的医疗增益并未损害领域外能力。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供