Command Palette
Search for a command to run...
知识–几何解耦:面向流式推荐的可刷新预训练迁移
知识–几何解耦:面向流式推荐的可刷新预训练迁移
摘要
工业推荐系统日益采用“预训练–后迁移”范式,然而行为分布漂移引发了两个问题:从行为序列中学什么,以及在预训练模型持续刷新时如何迁移所学知识。为解决这些问题,我们提出知识–几何解耦(Knowledge–Geometry Decoupling, KGD)。在“学什么”方面,传统的下一 token 预测将邻接视为依赖,可能编码跨无关会话的虚假转移。我们引入行为多 token 预测(Behavioral Multi Token Prediction, BMTP),仅保留协同或语义相关的未来物品作为监督信号,从而产生更纯净、更可迁移的行为知识。在“如何迁移”方面,预训练知识与任务特定几何对共享参数施加了相互冲突的优化需求。为此,KGD 将它们分配到不同的参数集:一个可刷新的编码器承载行为知识,而任务学习器通过只读交叉注意力读取上下文化的编码器状态,并通过与预训练嵌入正交的锚定校准残差(Anchored Calibration Residual, ACR)写入任务特定几何。这种解耦的所有权使得知识能够持续刷新,而不会产生任务梯度干扰或使下游适配失效。在八个公开基准上,KGD 相较于强预训练–迁移基线提升了 4%–12%,并在一条为期 90 天的生产数据流上持续保持优势,而基线在该流上未见增益。KGD 已在 Shopee 全面部署。在 Shopee 首页搜索的在线 A/B 测试中,它将每用户 GMV 提升 1.75%,广告收入提升 1.53%,展现出很高的实用价值。我们在 https://github.com/FuCongResearchSquad/KGD4REC 提供了 KGD 的核心实现。
一句话总结
厦门大学与Shopee的研究者提出知识-几何解耦(KGD),这一流式推荐框架将行为知识(通过行为多token预测学习)与任务特定几何(通过只读交叉注意力和锚定校准残差捕获)解耦,从而实现持续模型刷新而无任务干扰,在八个公开基准上获得4-12%的提升,并在Shopee首页搜索中实现1.75%的GMV提升。
核心贡献
- 行为多token预测(BMTP)仅保留协同相关或语义相关的未来项作为监督,过滤掉虚假的跨会话转移,产生更干净、更可迁移的行为知识。
- 知识-几何解耦(KGD)将架构拆分为可刷新的编码器和任务学习器,任务学习器通过只读交叉注意力访问编码器状态,而锚定校准残差(ACR)将任务特定的几何正交写入预训练嵌入,从而实现编码器持续刷新而无任务梯度干扰。
- KGD在八个公开基准上相比强预训练-迁移基线提升4-12%,在90天流式生产轨迹中保持优势,并在Shopee首页搜索的在线A/B测试中,每用户GMV提升1.75%,广告收入增加1.53%。
引言
工业推荐系统越来越多地采用生成式预训练范式,在用户行为序列上训练Transformer,以下一项为目标,并将表示迁移到下游排序任务。然而,物品和受众更替带来的持续分布漂移会破坏监督信号:序列中的相邻项往往属于不相关的会话,因此将相邻性视为依赖性会注入噪声。此外,刷新预训练编码器会导致行为知识与任务特定几何在共享参数上发生冲突。先前的去噪方法降低不相关项的权重或通过大语言模型重写序列,但它们要么仍监督虚假转移,要么在规模上成本过高。迁移方法如全微调覆盖预训练知识,冻结表示禁止几何适应,而适配器调优提供的灵活性不足。作者提出知识-几何解耦(KGD)来解决学什么和如何迁移两个问题。行为多token预测(BMTP)通过协同或语义相关性过滤未来项以避免噪声监督,而任务学习器通过只读交叉注意力访问编码器状态,并通过锚定校准残差(ACR)写入自身几何,该残差与预训练嵌入正交。这种解耦允许每日编码器刷新而不使任务特定几何失效,使预训练知识和下游适应在持续漂移下共存。
方法
作者提出知识-几何解耦(KGD)来解决序列推荐中预训练行为知识与任务特定几何之间的冲突。在推荐流中,用户行为序列通常连接了不同的兴趣会话,意味着相邻并不表示依赖。此外,预训练和下游任务目标的梯度在共享参数上通常负相关或接近正交,使得单一参数集无法同时服务两个目的。
如下图所示,这些挑战表现为来自不相关会话转移的噪声表示以及微调过程中的严重梯度冲突。
为解决这一问题,KGD将预训练知识和任务特定几何分离到两个不同层,各自独立拥有。参见框架图了解架构概览。
该框架包含两个主要组件:使用行为多token预测(BMTP)预训练的序列编码器,以构建干净的基几何;以及通过解耦读写接口适配该几何的任务学习器。
行为多token预测(BMTP)
BMTP不采用标准的下一token预测(其编码了噪声会话边界),而是仅监督编码器学习那些携带持久知识的转移:协同依赖和语义依赖。对于每个位置 t,该方法保留那些与 it 的相似度超过阈值 τa 的最近后续项,基于协同轴(共现图上的接近度)或语义轴(文本嵌入的余弦相似度)。符合条件的项集定义为:
Sta={ij:j=min{j′>t,sima(it,ij′)≥τa}},a∈{col, sem}预训练损失监督这些过滤后的项:
Lpre=−t=1∑T−1a∈{col,sem}∑i+∈Sta∑log∑i′∈Iexp⟨ht,ei′⟩exp⟨ht,ei+⟩通过聚焦协同和语义关系而非原始相邻性,BMTP产生干净的基几何,免于瞬态噪声,随着数据流变化可安全地持续刷新。
解耦读写所有权
为将预训练几何适配为判别结构而不破坏它,作者将行为转移知识和任务几何分配给两个独立所有者:预训练编码器和任务学习器。它们通过两个单向接口耦合,不触及编码器权重。
锚定校准残差(ACR): 在嵌入层面,任务学习器通过将任务拥有的残差叠加到预训练嵌入的分离副本上,形成任务适配嵌入。作者观察到真实任务需要任务条件化、方向依赖的嵌入空间变形,但这种变形不能抵消预训练方向。这通过确保添加的分量与预训练嵌入 eipre 正交来实现:
e~i(k)=sk⋅sg(eipre)+Δei(k) sk=1+ReLU(s~k),Δei(k)=(Z(k)B(k)⊤)i,Δei(k)⊥eipre其中 k 索引下游任务,sg(⋅) 表示停止梯度,Z(k) 和 B(k) 是任务拥有的低秩因子,通过正则化保持与 eipre 正交。这使任务能在正交补空间中写入判别方向,而预训练嵌入保持不变。
只读交叉注意力: 在表示层面,任务学习器需要将用户的上下文化兴趣投影到任务判别空间。由于共享Transformer骨干会重新引入梯度冲突,KGD解耦骨干并以只读交叉注意力桥接。任务Transformer通过以下方式读取编码器最后一层的隐藏状态 H~:
Q=WQρ,K=WKsg(H~),V=WVsg(H~)其中 ρ 是任务侧读者token,WQ,WK,WV 归任务Transformer所有。对键和值的停止梯度确保接口严格单向,因此任务优化永远不会污染预训练知识。
训练与推理流水线
架构实例化为标准自注意力Transformer作为编码器,以及具有自注意力和只读交叉注意力的Transformer作为任务学习器。读者token ρ 的实例化遵循任务需求:对于检索任务是用户侧向量以产生单一用户嵌入,对于排序任务是候选侧token以聚合候选特征。
在每日流式调度下,训练流水线分两步操作。首先,编码器在新一天的数据上刷新一次传递。然后,冻结编码器拥有的参数,运行编码器-学习器组合图,仅更新学习器参数。这种设计确保刷新转移骨干永远不会干扰任务骨干,且由于任务几何作为锚定于预训练嵌入的残差写入,刷新将基础移动到仍有效的残差下方。在推理时,每请求延迟与单骨干基线一致,因为查询token仍通过共享编码器传递。
实验
评估涵盖公开基准、工业流式设置和在线A/B测试,以分离BMTP预训练、迁移机制和刷新计划的贡献。公开结果表明BMTP提供更丰富的行为知识,但微调会抹去这些知识,而通过KGD的解耦所有权可以保留这些知识,并让任务学习器无冲突地发展自己的判别几何。工业实验表明仅在解耦所有权下刷新才有效,冻结迁移随时间退化,消融实验揭示所有权而非容量推动增益;在线部署在可管理的成本下带来显著的GMV和收入提升。
在全微调(TE&FT)下,将下一token预测(NTP)替换为行为掩码token预测(BMTP)在八个公开数据集中的五个上提升了Recall@50,领先的是Toys(+13.4%)、Office(+11.7%)和Arts(+8.0%)。增益并不普遍:Phones显示Recall@50下降2.7%,NDCG@50下降8.2%,而Beauty和Games变化微小。BMTP在七个数据集上达到最高总体Recall@50,仅Phones上NTP优于它。在TE&FT下,BMTP相对NTP在Toys(+13.4%)、Office(+11.7%)和Arts(+8.0%)上实现最大Recall@50提升。在Phones上,BMTP相比NTP使Recall@50降低2.7%,NDCG@50降低8.2%,这是唯一BMTP在两个指标上都受损的数据集。在所有显示的TE&FT行中,BMTP在八个数据集中的七个上获得最佳Recall@50,仅Phones上NTP略占优(0.0808 vs. 0.0786)。
知识和几何的解耦所有权在28天工业流上取得最佳性能,KGD在所有指标上领先。持续刷新仅在参数解耦时有效;在共享所有权下,刷新导致退化或无帮助,移除解耦使性能降至随机初始化模型以下。互补的预训练过滤器和独立任务骨干对于稳定且可刷新的长期增益至关重要。KGD在28天流上达到最高的点击和订单AUC/GAUC。每日刷新仅在解耦所有权下改善结果;在共享参数下,TA&FT的点击AUC从0.7852降至0.7837。移除KGD的解耦接口使性能崩溃至0.7785,低于零起点模型。BMTP的图过滤和语义过滤互补:移除图过滤损害活跃用户,移除语义过滤损害低活用户。ACR至关重要;没有它直接读取预训练嵌入会降低所有指标。即使有ACR,共享骨干仍不及独立任务骨干,因为知识和几何在相同参数上竞争。没有预训练,连续方法几乎无益:缓冲回放降至0.7732,低于零起点。LoRA因容量不足以重塑几何而表现不佳。冻结迁移在短窗口内看似有竞争力,但在90天内退化,表明可刷新性必须在长轨迹上判断。
消融KGD组件发现语义和协同预训练过滤器分别对低活和活跃用户互补,而移除自适应校准模块或强制共享骨干一致降低性能,即使参数容量匹配也如此。增益源于将知识保留在编码器并将任务特定几何保留在独立学习器的解耦架构。在工业数据上,移除语义过滤器使低活用户(按活跃度后30%)AUC降低1%,而移除协同过滤器使活跃用户AUC降低0.5%。移除自适应校准模块(ACR)损害所有基准和工业指标,表明直接读取预训练嵌入无法提供任务所需的判别几何。将ACR置于共享骨干上——无论冻结还是全微调——均不及完整KGD,且将共享骨干的参数数量对齐KGD仍落后,甚至在稀疏公开数据集上退化。
在公开数据集实验中,行为掩码token预测(BMTP)相比下一token预测在全微调下通常提高召回率,尽管在Phones等特定数据集上可能表现不佳。在工业推荐流上,对预训练知识和任务特定几何分别拥有所有权的解耦架构(KGD)实现最佳长期性能,持续刷新仅在参数解耦时有益,且语义和协同过滤器分别对低活和活跃用户互补。消融研究证实移除自适应校准模块或强制知识和几何共享骨干一致导致结果退化,强调了可稳定且可刷新的增益需要解耦所有权。