HyperAIHyperAI

Command Palette

Search for a command to run...

Nanbeige4.2-3B:在紧凑模型中释放智能体能力

一键部署 Nanbeige4.2-3B:紧凑型智能体模型

跳转至 Notebook

摘要

我们提出 Nanbeige4.2-3B,一个拥有 3B 非嵌入参数的紧凑通用智能体模型。它在代码智能体、办公智能体和复杂工具使用任务上展现出强大性能,同时在数学、编程和科学领域保持极具竞争力的推理能力。Nanbeige4.2-3B 基于 28T token 从零开始预训练,采用循环 Transformer 复用层堆栈以在不增加参数量的前提下提升容量。在 SFT 数据和轨迹构建方面,我们通过真实世界部署和大规模合成,扩展了可执行环境、任务资产和智能体脚手架的多维多样性。我们的 RL 管线应用了混合模式 RLHF,对 Think 和 Non-Think 响应进行优化,以提升整体模型质量并减少失败案例;采用长度受控的推理 RL 来平衡准确性与推理效率;并利用结合结果奖励与过程奖励的智能体 RL 来稳定长周期训练。广泛评估表明,Nanbeige4.2-3B 在多种智能体基准上优于更大规模的模型,包括 Qwen3.5-9B 和 Gemma4-12B,同时在推理和对齐任务上保持竞争力。在 OpenClaw 上的性能进一步支持其作为紧凑型本地个人助理的应用。模型检查点可在 https://huggingface.co/Nanbeige/Nanbeige4.2-3B 获取。

一句话总结

南北阁LLM实验室与Boss直聘推出Nanbeige4.2-3B3\text{B}3B,这是一个3B3\text{B}3B参数的agentic模型,采用参数高效的Looped Transformer架构,从零开始使用28T28\text{T}28T tokens进行预训练,并通过混合模式RLHF、长度控制推理RL以及基于结果和过程奖励的agentic RL进行优化。该模型在代码agent、办公agent和工具使用基准测试中优于Qwen3.5-9B和Gemma4-12B等更大模型,同时在推理和对齐方面保持竞争力。

核心贡献

  • 采用Looped Transformer架构,从零开始使用28T tokens进行预训练,在不增加3B非嵌入参数预算的情况下提升模型容量。
  • 监督微调构建了跨真实和合成环境的执行轨迹,涵盖代码agent、办公agent和复杂工具使用任务,并通过执行信号和基于评分标准的评估进行轨迹级和轮次级筛选。
  • 多阶段强化学习流程应用了混合模式RLHF、长度控制推理RL以及结合结果和过程奖励的agentic RL;Nanbeige4.2-3B在多种agentic基准测试中优于Qwen3.5-9B和Gemma4-12B,并在推理任务上保持竞争力。

引言

构建能够跨多种环境充当通用agent的紧凑语言模型仍是一个开放挑战。先前的工作通常产生专用于单一领域(如仓库级编码)的小型模型,尚不清楚一个模型能否在不牺牲通用推理能力的情况下支持代码、办公和工具使用任务。作者推出了Nanbeige4.2-3B,一个3B参数的模型,结合了Looped Transformer架构、大规模预训练、跨混合环境的执行驱动监督微调以及多阶段强化学习流程。该模型实现了广泛的agentic能力,同时保持了有竞争力的推理性能,在复杂工具使用、办公agent和代码agent基准测试中优于许多更大的模型。

数据集

作者构建了一个覆盖预训练和后训练阶段的多阶段数据流程。数据集的构成、处理和使用方式如下所述。

预训练数据

  • 预训练语料库包含28T tokens,在规模和质量上均超越了先前的工作。
  • 数据混合通过提高数学、代码和合成问答数据的权重进行了优化,作者发现这对紧凑模型尤其有益。
  • 引入了少量agentic轨迹数据,作为迈向agentic预训练的第一步。

后训练数据:概述

  • 策划并合成了一个大规模、多领域的后训练语料库,涵盖Agentic软件工程、复杂工具使用和Agentic协同办公。
  • 系统性地扩展了任务的多样性和难度,以推动紧凑模型达到其性能上限。

Agentic软件工程数据

  • 来源:通过仓库级合成流程,将历史GitHub开发活动转化为可执行任务。
  • 处理步骤:
    • 能力引导的代码仓库收集:通过分析模型在种子任务上的失败模式来选择仓库,针对系统性弱点。
    • 可执行环境重建:在隔离沙箱中从父提交构建容器镜像;补丁和评分测试对agent不可见。
    • 验证与闭环任务演化:使用失败到通过和通过到通过的测试验证任务。反复出现的模型失败会反馈到仓库挖掘中,以扩展任务空间。
    • 跨多种脚手架的轨迹合成:多个agent脚手架(Claude Code, OpenHands, SWE-agent, 基于Codex的驱动)并行解决相同任务,产生脚手架无关的推理轨迹。
    • 执行驱动的轮次级筛选:仅保留补丁通过目标测试和回归测试的轨迹。在轮次级别过滤掉错误的工具调用、非终止循环、冗余操作和上下文截断。
  • 模式:所有轨迹被标准化为统一的多轮模式,包含观察到的助手消息、工具调用和环境反馈。

工具使用数据

  • 来源:从MCP市场收集的数千份MCP工具规范文档,评估其可组合性并分组为捆绑包。
  • 处理步骤:
    • 基于Python的可执行环境合成:一个环境合成agent获取真实世界数据,并将工具重建为可调用的Python函数。
    • 混合环境中的任务合成:组合了三种环境类型:在线MCP服务、本地Python实现的工具以及模型模拟的虚拟工具。
    • 难度分类与自适应任务演化:预定义的分类法(工具调用链深度、信息检索难度、参数推断复杂性)指导任务生成。求解器agent的成功/失败反馈驱动难度迭代增加。
    • 快速验证构建:构建了一个紧凑的留出任务套件,覆盖代表性捆绑包、环境类型和难度级别,用于快速开发验证;它与训练数据不相交。

Agentic协同办公数据

  • 来源:从金融、贸易、法律和医疗等领域收集的专业制品(报告、幻灯片、电子表格、PDF、电子邮件)。
  • 处理步骤:
    • 制品仓库构建:按校准比例收集材料,以实现广泛、真实的覆盖。
    • 基于嵌入的领域聚类:解析、标准化、嵌入并聚类制品;在聚类内采样多制品捆绑包。
    • 任务、评分标准和轨迹合成:一个任务合成agent在沙箱中操作捆绑包以生成任务和评估标准。难度通过跨制品依赖、工具使用要求、工作流长度、约束和验证需求进行变化。开源模型生成工具使用轨迹和交付物;独立评判员评估保真度、标准一致性和执行质量,仅保留高质量样本。
    • 闭环制品回收:经过验证的交付物被重新纳入制品仓库,以逐步扩展任务分布。

数据使用方式

  • 预训练:使用28T token混合数据训练基座模型,调整了数学、代码、合成问答和少量agentic轨迹组件的采样权重。
  • 后训练:来自所有三个领域的合成轨迹作为监督信号,用于微调紧凑模型,旨在提升软件工程、工具使用和办公工作流方面的agentic能力。快速验证套件用于开发阶段评估,不用于训练。

方法

为了在固定参数预算下提升有效深度和推理能力,作者采用了Looped Transformer架构。隐藏状态自底向上通过Transformer层后,再次被送入相同的层堆栈进行额外一次传递。这增加了有效计算深度和模型容量,而无需引入另一组参数。作者发现,从零开始训练循环架构比升级改造标准Transformer效果显著更好,因为模型在整个预训练过程中受益于适应重复层重用的表示。选择两次传递的配置,因为它在保留标准Transformer约75%的token效率的同时,提供了显著的容量增益。保留完整循环且不共享KV缓存,以优先考虑模型性能。

预训练语料库包含28T tokens。作者通过提高数学、代码和合成问答数据的采样权重来优化数据混合,这对紧凑模型尤其有益,并引入少量agentic轨迹数据作为迈向agentic预训练的第一步。

后训练流程结合了可扩展的SFT数据和跨三个领域的轨迹构建:Agentic软件工程、复杂工具使用和Agentic协同办公。

对于Agentic软件工程,作者建立了一个仓库级数据合成流程,将历史GitHub开发活动转化为可执行任务。该系统利用模型失败反馈,使任务分布与agent能力协同演化。

该流程包括能力引导的代码仓库收集、在隔离沙箱中重建可执行环境,以及使用失败到通过和通过到通过的测试进行验证。轨迹合成跨多种异构agent脚手架进行,随后进行执行驱动的轮次级筛选,仅保留高质量轨迹。

对于复杂工具使用,作者通过构建集成真实世界API、可执行工具接口和模型模拟环境组件的混合环境来扩展轨迹合成。

该框架包括MCP工具规范收集、基于Python的可执行环境合成、混合环境中的任务合成(结合在线MCP服务、本地Python工具和模型模拟的虚拟工具),以及支持自动标注和自适应任务演化的难度分类法。

对于Agentic协同办公,作者开发了一个以制品为中心的策划流程,用于合成、演化和回收复杂办公工作流的任务制品。

该流程包括跨多种专业领域的制品仓库构建、基于嵌入的领域聚类以形成多制品捆绑包、伴随迭代难度演化的任务和轨迹合成,以及闭环制品回收,其中经过验证的交付物被重新纳入以用于后续合成轮次。

训练方案包含四个阶段:监督微调(SFT)、用于混合思考的两阶段RLHF、带长度控制的推理RL,以及带行动中心评分标准的agentic RL。

从预训练检查点开始,作者使用三阶段课程进行SFT,逐步将最大训练上下文从64K扩展到128K和256K tokens。监督目标token的分布逐渐从以STEM为中心的推理转向长周期agentic交互。

在64K阶段,混合数据以推理导向的STEM数据为主。在128K阶段,转向更长上下文的指令遵循和工具使用。在256K阶段,主要目标转向agentic能力。为处理不正确的中间轮次,使用执行反馈为每个助手轮次分配二元损失掩码mtm_tmt。不可靠的轮次被排除在SFT损失之外(mt=0m_t = 0mt=0),但保留在上下文中,使模型能够从错误中学习恢复。

SFT之后,应用两阶段RLHF程序来解决不稳定的生成行为,如重复推理和延迟终止。逐点奖励模型评估响应质量,偏好正确、格式良好且正确终止的输出。作者发现,通用RLHF的行为正则化可跨任务以及跨思考和非思考模式泛化。

接下来,进行推理RL以增强思考模式能力,同时约束推理长度。一个依赖于问题的长度控制目标结合了固定长度预算和连续的、难度感知的惩罚。对于每个问题qqq,长度预算bqb_qbq设定为历史正确rollouts的中位长度。最终奖励形式为:

ri=ribaseαpq[LibqLmaxbq]01r_i = r_i^{\mathrm{base}} - \alpha p_q \left[ \frac{L_i - b_q}{L_{\mathrm{max}} - b_q} \right]_0^1ri=ribaseαpq[LmaxbqLibq]01

其中[x]01=min(max(x,0),1)[x]_0^1 = \mathrm{min}(\mathrm{max}(x, 0), 1)[x]01=min(max(x,0),1)α>0\alpha > 0α>0限制惩罚幅度,pqp_qpq是当前rollout组中完全正确响应的比例。此惩罚是难度感知的,鼓励在可靠解决的问题上简洁推理,同时在困难问题上保留探索。

最后,使用行动中心评分标准进行agentic RL,以诊断行为缺陷。这些标准衡量工具调用准确性和信息增益等维度,作为过程级奖励。作者将agentic RL限制在相对容易、轨迹短且通过率较高的任务上,以确保优化稳定。

训练动态显示,结合结果和行动中心过程奖励抑制了重复行动错误并提升了最终任务性能,标准化行动错误率下降约20%,整体得分在训练期间有所提高。

实验

预训练评估表明,将Looped Transformer架构与改进的数据配方相结合,相较于先前模型取得了持续提升,并在推理和知识基准上优于可比的基座模型。在后训练中,一个带有行动中心评分标准且数据选择聚焦于更简单、短周期任务的agentic强化学习阶段,将重复行动错误减少了约20%,并提升了整体任务得分。完整的RL流程产生了一个检查点,该检查点在推理、编码、对齐和agentic基准测试中以更少的输出token实现了更高的准确率。综合评估显示,由此产生的3B参数模型在通用agent、代码agent和大多数推理任务上超越了更大的替代模型,同时在作为统一的本地个人助理处理日常、办公和深度研究场景时也优于它们。

Nanbeige4.2-3B-Base,一个3B非嵌入参数模型,在推理导向和知识导向的基准测试中,始终优于其前身Nanbeige4-3B-Base和其他类似规模的基座模型。这些提升归功于将Looped Transformer结构与增强的预训练数据配方相结合。与Nanbeige4-3B-Base、Qwen3.5-4B-Base和Gemma4-E4B-Base相比,Nanbeige4.2-3B-Base在所有六项报告的基准测试中取得了最高分。Nanbeige4.2-3B-Base相对于其前身的最大相对提升出现在知识导向的指标上,如MMLU-Pro和SuperGPQA。在推理任务上,Nanbeige4.2-3B-Base表现强劲,尤其在GSM8K上以较大优势超越Qwen3.5-4B-Base。Gemma4-E4B-Base尽管拥有最大的总参数量,但在本次比较的所有基准测试中得分最低。

两阶段RLHF逐步减少了失败模式和输出长度,同时提升了对齐、推理和agentic基准测试的准确率。通用RLHF的行为正则化可跨任务以及从非思考模式到思考模式泛化,表明结构化生成和终止意识是共享能力而非特定于模式的技能。对齐不良案例率从SFT后的17%下降到非思考RLHF后的2%,而准确率从50%上升到57%。在LiveCodeBench上,准确率从65.45%提高到72.10%,非思考RLHF后不良案例率达到零。在对齐和推理评估中,平均响应长度大幅缩短,完整RLHF流程后下降超过一半。主要在通用查询上训练的非思考RLHF,即使在思考模式生成中也能减少循环反思和异常续写。

Nanbeige4.2-3B仅拥有3B非嵌入参数,在所有报告的通用agent和代码agent基准测试中取得了最佳结果,优于Qwen3.5-9B和Gemma4-12B等更大模型。它还在六项推理基准测试中的五项上领先,同时在对齐任务上保持竞争力,展示了在显著更小的参数预算下,agentic、推理和对齐评估之间的强大整体平衡。Nanbeige4.2-3B在GDPval Rubrics上得分为74.3,超过Gemma4-12B(68.5)和Qwen3.5-9B(61.9)。在AgentIF-Oneday上,Nanbeige4.2-3B达到67.5,超过Qwen3.5-9B(60.4)和Qwen3.5-4B(56.9)。Nanbeige4.2-3B在PinchBench-V2上得分为74.7,优于Qwen3.5-9B(68.2)和Gemma4-12B(53.8)。在OfficeQA-Pro上,Nanbeige4.2-3B得分为21.1,而Qwen3.5-9B为15.8,Gemma4-12B为15.3。Nanbeige4.2-3B在六项推理基准中的五项上领先,而Gemma4-12B在IF-Bench和Recruit-Bench对齐任务上表现更好。

在OpenClaw框架下,Nanbeige4.2-3B在所有六项本地个人助理基准测试中均优于Qwen3.5-4B和更大的Qwen3.5-9B,在办公工作流方面提升尤为显著。尽管参数量少于9B比较模型,该模型在日常任务、办公生产力和深度研究场景中展示了一致的优势。Nanbeige4.2-3B在所有六项基准测试中领先,最大优势出现在办公任务中,如GDPval(68.8 vs Qwen3.5-9B的38.0)和AgentIF-Oneday(58.9 vs 32.1)。在日常任务基准上,Nanbeige4.2-3B在Pinch-Bench-V2上得分为74.7,在Claw-Gym上得分为65.0,分别超过Qwen3.5-9B 6分和近9分。该模型在仅使用3B非嵌入参数的情况下,在两项深度研究基准测试中均取得最高分,而对比的Qwen3.5替代模型为9B参数。

第一个实验评估了Nanbeige4.2-3B-Base与其前身及其他类似规模基座模型的对比,显示架构变更和改进的预训练数据在推理和知识基准上带来了持续提升。第二项关于两阶段RLHF的研究表明,行为正则化减少失败模式和输出长度,同时提升了对齐、推理和agentic任务的准确率,其益处从非思考模式生成转移到了思考模式生成。对完整Nanbeige4.2-3B模型的后续评估显示,尽管只有3B非嵌入参数,它在通用agent和代码agent基准上优于更大的替代模型,并在大多数推理任务上领先,同时保持有竞争力的对齐结果。最后,在OpenClaw框架下,Nanbeige4.2-3B在所有本地个人助理基准测试中均超越了更小和更大的比较模型,在办公工作流和深度研究场景中的优势尤为明显。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供