Command Palette
Search for a command to run...
RecGPT-V3 技术报告
RecGPT-V3 技术报告
摘要
大语言模型(LLMs)正在将推荐系统从匹配历史行为中的共现模式,转变为推理驱动行为的意图。RecGPT-V1 在淘宝上开创了这一范式,将真正理解用户置于流程核心,而 RecGPT-V2 通过协调多智能体推理进行了扩展;两者均已部署生产,并在用户体验和商业利益上取得了持续提升。然而,大规模运行 RecGPT 系列暴露出三个根本挑战:(1)无状态行为建模,每次请求都从头处理用户完整历史,导致冗余计算并丢弃先前分析;(2)标签到物品的信息瓶颈,自然语言标签在用户理解与物品关联之间形成有损信息通道;(3)低效的显式推理,其冗长的思维链带来了难以承受的延迟和计算开销。为解决这些挑战,我们提出 RecGPT-V3,一个有状态、混合模态的推荐系统,能高效地结合自然语言进行开放世界知识推理,并利用语义 ID(SIDs)实现具体物品关联。作为系统引擎,记忆中心维护一个结构化、持续演化的用户记忆,将长周期行为提炼为压缩记忆单元,将用户建模计算量降低 55.8%。为连接推理与检索,混合模态基础模型使 LLM 能联合推理文本标签和 SIDs,打开通往物品空间的高带宽通道。为使推理在延迟和计算预算下可行,潜在意图推理将冗长的推理过程内化为紧凑可学习的潜在令牌,这些令牌仍可解码为可读解释,将输出令牌成本降低 200 倍。部署于淘宝“猜你喜欢”信息流后,RecGPT-V3 在大规模在线 A/B 测试中取得持续提升,IPV 提高 +1.28%,CTR 提高 +1.00%,TC 提高 +1.97%,GMV 提高 +3.97%,同时大幅削减端到端服务资源消耗 52.4%。这些结果表明,LLMs 可作为工业级业务系统的智能大脑,同步提升推荐准确性和服务效率。
一句话总结
RecGPT 团队提出 RecGPT-V3,一个有状态的推荐系统,利用记忆中枢将用户历史压缩为精简的记忆单元,通过混合模态基础模型联合推理自然语言标签与语义 ID,并借助潜在意图推理将冗长的推理过程内化为潜在 token,使 token 成本降低 200×;部署在淘宝“猜你喜欢”信息流中,GMV 提升 +3.97%,同时服务资源消耗降低 52.4%。
核心贡献
- 记忆中枢维护一个结构化的、持续演进的用户记忆,将长周期行为浓缩为记忆单元,使面向用户建模的计算量降低 55.8%。
- 混合模态基础模型使大语言模型能够联合推理自然语言标签和语义 ID,打通从意图到物品 grounding 的高带宽通道,突破标签到物品的瓶颈。
- 潜在意图推理将冗长的思维链压缩为紧凑的可学习潜在 token,在保持可解码解释的前提下将输出 token 成本降低 200 倍;完整的 RecGPT-V3 系统使 IPV 提升 +1.28%,CTR 提升 +1.00%,TC 提升 +1.97%,GMV 提升 +3.97%,服务资源消耗降低 52.4%。
引言
传统推荐系统根据历史日志中的共现模式预测下一次交互,却忽略了底层用户意图,并加剧了信息茧房。虽然大语言模型能够推理意图,但早期基于 LLM 的方法 RecGPT-V1 和 RecGPT-V2 存在无状态行为建模,每次请求都需要重新处理完整历史,以及有损的标签到物品瓶颈导致检索精度受限,以及昂贵的显式思维链生成等问题。作者通过 RecGPT-V3 解决这些局限,引入有状态的记忆中枢来提炼和演进用户记忆,提出混合模态基础模型在自然语言和语义物品 ID 上联合推理以 grounding 意图,以及潜在意图推理将冗长的推理过程压缩为紧凑、可解码的 token,在工业级规模上同时实现精度提升和显著的计算节省。
方法
作者引入记忆中枢,将无状态的全序列编码转变为有状态的记忆驱动推理。该模块通过将长行为序列整合为一组紧凑的、符合模式定义的记忆单元,解决了重复处理长序列的高计算成本问题。如下图所示,记忆中枢通过两个主要机制运作:结构化行为压缩和演进式记忆管理。
结构化行为压缩首先将用户的完整历史行为序列 B={b1,b2,…,bN} 初步整合为一组紧凑的结构化记忆单元 M={m1,m2,…,mK},其中 K≪N。每个单元围绕一个行为模式标识和一个偏好摘要,并辅以代表性行为索引和时间分布等元数据。演进式记忆管理则通过定期融合新观察到的行为 ΔB(t,t+δ) 来保持记忆的时效性。它定义了一个增量更新函数 G,根据相关的新行为选择性地更新现有记忆单元,并从无匹配行为中提取新模式,从而得到一个紧凑、可追溯且可演进的用户表示,无需进行全量重新编码。
为突破仅依赖粗糙物品标签的纯文本 LLM 专家的瓶颈,作者提出混合模态推荐基础模型。该架构以 Qwen3-14B 为 backbone,扩展了语义 ID(SID),即编码物品语义的离散编码,作为与自然语言并列的第二模态。整体流程如下图所示。
该模型采用混合 tokenization 方案,通过多模态编码器融合文本、图像和辅助信息等物品特征,并使用残差量化将其量化为多层级离散编码。这构建了一个两层码本结构,向词表中新增 65,536 个 SID token。训练过程分为两个阶段。首先,持续预训练阶段使用 SID-grounding 数据与通用领域数据混合,将 SID token 对齐到自然语言空间,以避免灾难性遗忘。其次,指令微调教会模型在各种任务中应用这些 token,包括 SID 与文本之间的双向翻译、直接在 SID 空间进行的序列推荐,以及通用领域任务以保持原有能力。
为保留显式思维链推理的优势,同时避免自回归生成带来的高昂 token 成本,作者开发了潜在意图推理。该方法将冗长的推理轨迹内化为一段短序列的可学习潜在 token。框架如下图所示。
推理内化机制通过确定性位置划分,将显式轨迹 R 压缩为潜在 token z=(z1,…,zK)。后训练流程包含两个阶段。阶段一,显式到隐式的思维链对齐,从强教师模型中蒸馏推理过程,生成显式轨迹,再将其压缩为潜在 token。这通过多任务课程实现,包括潜在 token 预热和多粒度对齐,模型需从潜在 token 中重建轨迹中被掩码的片段,涵盖单片段、多片段和完整轨迹三个层次。阶段二,基于排序反馈的强化学习,直接针对在线业务目标优化潜在模型。作者采用从生产排序模型衍生的密集 CTRScore 替代稀疏的准确率奖励,并结合用于对齐、多样性和长度的约束奖励塑造,通过 GRPO 进行优化。
实验
RecGPT-V3 在淘宝首页推荐上进行评估,在线 A/B 测试证实其在参与度和交易指标上均优于 RecGPT-V2。记忆中枢对行为序列进行高精度压缩,将全局规划器的计算成本降低 55.8%,同时在基础模型训练中混合通用领域数据避免了灾难性遗忘,并提升了后续推荐质量。潜在推理将思维链压缩为十个潜在 token,在保持可比性能的同时实现 3.46 倍推理加速,且整体系统资源节省 52.4%。进一步分析表明,语义 ID 和文本标签是互补的模态,案例研究展示了记忆压缩和潜在推理如何实现精准且可解释的推荐。
一个结构化的记忆单元将用户行为模式压缩为两个核心字段:一个类别行为模式标签和一个自然语言偏好摘要。以 K-pop 粉丝圈为例的示例展示了该单元如何同时记录代表性行为索引、偏好品牌和活动时间等辅助元数据。“行为模式”字段是一个类别标签,如“K-pop 粉丝圈”,源自预定义的电商行为原型分类体系。“偏好摘要”则描述用户在该模式下的全生命周期参与、收藏倾向和物品保留习惯。
增量记忆管理在有新证据时选择性更新已有用户偏好单元,保留缺乏相关新行为的单元不变,并为未见过的兴趣创建新单元。示例展示了婴儿护理单元如何从婴儿需求转向幼儿需求,烹饪单元如何演进到高端厨具,以及宠物养育单元如何从新行为中涌现。仅当新行为与已有模式对齐时,现有单元才被更新,如婴儿护理单元转向 6–12 个月物品并添加幼儿玩具。没有相关新交互的单元保持不变,如户外跑步和摄影被原样保留。全新的兴趣,如首次养宠物的用户,会导致创建新的记忆单元,而不是强行匹配到已有单元。
面向 SID 对齐的指令微调包括 SID 与文本(标题、标签、商品类别)之间的双向翻译任务,以及完全在 SID 空间进行的序列推荐任务。其中,下一点击 SID 预测任务获得了最大比例的微调数据,而单独的一部分通用领域数据用于保持模型更广泛的语言能力。sid2sid 序列推荐任务在 SID 相关任务中占比最高(20%),直接从 tokenized 点击历史中教会模型协同过滤信号。双向标题映射(sid2title 和 title2sid)合计占 SID 微调数据的 28.5%,强调物品标识符与文本之间的核心语义链接。标签到 SID 映射是频率最低的 SID 对齐任务(6.2%),而另有 20% 的指令数据专门用于通用领域任务,以维持推理和指令遵循能力。
表格展示了潜在推理 token 如何替换显式思维链轨迹的片段,使模型能够从上下文重建被掩码的内容。与语义 ID 相比,文本标签展现出更高的跨用户重叠度和更广泛的嵌入分散度,而 SID 则形成更紧密的聚类,反映它们在覆盖世界知识和协同特异性上的互补性。结合两种模态的混合检索优于单独使用任一模态,证实了它们的协同效应。潜在 token 替换了完整的显式推理轨迹,大幅降低推理成本,同时仍能重建原始推理过程。文本标签的跨用户重叠度明显高于语义 ID,表明它们捕获的是共享的世界知识而非用户特定信号。嵌入投影显示,标签匹配的物品分散在不同区域,而 SID 匹配的物品则集中在紧密的邻域内。同时使用文本标签和 SID 的混合检索实现了比单独使用任一模态更高的命中率,体现了互补的检索优势。
阶段一的训练混合数据中,大量通用推理数据(69.58%)用于防止灾难性遗忘,较少部分的推理对齐任务(21.43%)将显式思维链压缩为潜在 token,以及标签预测部分(8.43%)仅监督输出 token 以防止潜在位置坍缩。通用推理数据以 69.58% 的比例主导混合,作为防止遗忘已有知识的保障。推理对齐任务合计占 21.43%,其中完整轨迹重建是最大的子任务(8.42%)。标签预测仅分配 8.43%,且其监督仅限输出 token,防止潜在 token 坍缩。
实验评估了一个记忆增强框架,该框架将用户行为压缩为带有类别模式标签和偏好摘要的结构化单元,然后通过更新已有单元、保留不变单元或为全新兴趣创建新单元的方式进行增量管理。指令微调通过双向翻译和下一点击预测将语义 ID(SID)与文本对齐,而潜在推理 token 替代显式思维链轨迹,显著降低推理成本同时保持对推理过程的重建。结合文本标签和 SID 的混合检索实现了比单一模态更高的命中率,同时以通用推理数据为主、辅以少量推理对齐和标签预测组件的训练混合数据防止了灾难性遗忘和潜在 token 坍缩。