跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-07-17精选AI 评分81

RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%

RecGPT-V3 Technical Report

AI 导读

淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在“猜你喜欢”信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。

推荐理由

淘宝首页推荐搬上大模型做推理引擎,记忆+混合模态+潜在推理三件套,带来 +1.28% IPV 同时节省 52.4% 算力,推荐系统真的开始重写成本公式了。

正文 · AI 翻译
摘要

大语言模型正在重塑推荐系统,使其从匹配历史行为中的共现模式,转向推理驱动行为的意图。RecGPT-V1 在淘宝上开创了这一范式,将真正理解用户置于流程的核心;RecGPT-V2 则通过协调的多智能体推理将其规模化;两者均已投入生产,并在用户体验和商业利益方面取得了持续提升。然而,大规模运营 RecGPT 系列暴露了三个根本性挑战:(1) 无状态行为建模——每个请求都从头重新处理用户的完整历史,导致冗余计算并丢弃了先前的分析;(2) 标签到物品的信息瓶颈——自然语言标签在用户理解与物品落地之间形成了有损信息通道;(3) 低效的显式推理——冗长的思维链带来了难以承受的延迟和计算开销。

为应对这些挑战,我们提出了 RecGPT-V3,一种有状态的混合模态推荐系统,它能高效地利用自然语言推理开放世界知识,并利用语义 ID(SID)进行具体物品定位。作为系统引擎,一个记忆中心维护着结构化且持续演进的用户记忆,将长期行为提炼为紧凑的记忆单元,将用户建模计算量减少了 55.8%。为了桥接推理与检索,一个混合模态基础模型使大语言模型能够联合推理基于文本的标签和语义 ID,从而开辟一条通往物品空间的高带宽通道。为了使推理在延迟和计算预算下变得可行,潜在意图推理将冗长的推理过程内化为紧凑的可学习潜在 token,这些 token 仍可解码为可读的解释,从而将输出 token 成本降低了 [原文缺失具体数值]。在淘宝“猜你喜欢”信息流中部署后,RecGPT-V3 在大规模在线 A/B 测试中取得了持续提升,使 IPV 提升 +1.28%,CTR 提升 +1.00%,TC 提升 +1.97%,GMV 提升 +3.97%,同时将端到端服务资源消耗大幅削减 52.4%。这些结果表明,大语言模型可以作为工业级业务系统的智能大脑,协同提升推荐准确度与服务效率。

Refer to caption
图 1:RecGPT 系列在淘宝上的性能与效率。每一代都在商品场景和主信息流中带来了 CTR、IPV、TC 和 GMV 的进一步提升,同时 GPU 成本稳步下降:RecGPT-V3 仅使用 RecGPT-V1 计算量的 19%,相比 RecGPT-V2 降低了 52.4%。

1 引言

一个理想的推荐系统应当理解用户真正想要什么,并呈现满足其深层需求的物品。然而在实践中,驱动当今平台的模型在很大程度上将这一目标简化为:根据历史日志中的统计规律来预测下一次交互。从矩阵分解(Rendle 等人,2009;Koren 等人,2009)到深度序列网络(Kang 和 McAuley,2018;Tang 等人,2026),这些模型的表现力日益增强,但它们却有一个共同的局限:它们匹配的是过去行为中的共现模式,捕捉的是哪些物品经常同时出现,而非这些行为背后的意图。囿于这种相关性信号,它们放大了用户已经表露过的偏好,导致曝光范围收窄(Chen 等人,2023),强化了信息茧房(Nguyen 等人,2014),并且对长尾内容服务不足(Gao 等人,2023),这逐渐侵蚀了用户体验以及推荐生态系统的健康。

大语言模型的出现为突破这一局限开辟了一条有前景的路径。通过借助广泛的世界知识和审慎推理能力(Zhao 等人,2023;Guo 等人,2025),大语言模型能够在上下文中解读用户行为,并推断每次行为背后的动机和潜在兴趣,而不仅仅是外推共现模式。这种能力将推荐重新定义为关于用户意图推理的问题——这也是我们在工作中一直追求的方向。RecGPT-V1(Yi 等人,2025b)围绕这一原则重建了工业级流水线,将兴趣挖掘、物品检索和解释生成都交由大语言模型处理,从而使推荐基于对用户行为原因的理解,而非对用户过去行为的拟合。在此基础上,RecGPT-V2(Yi 等人,2025a)协调了一个规划器与多个专业化的多专家子智能体,协同分析用户意图,在扩大覆盖范围的同时大幅降低了成本。这两个系统已在淘宝大规模部署,为消费者、商家和平台带来了持续收益,证明了大语言模型驱动的用户建模在生产环境中既前景广阔又切实可行。

尽管取得了这些进展,但在大规模运行 RecGPT 系列时,暴露出了三个制约进一步发展的关键挑战。

C1

无状态行为建模。现有大多数基于大语言模型的推荐系统(Zhou 等人,2025;Team 等人,2026;Wang 等人,2026)以一次性方式对用户的整个行为历史进行推理。随着交互的累积,每个请求都会从头重新处理全部历史记录,而不复用任何先前的分析结果。这种无状态设计导致了冗余计算,其计算量随行为序列增长而增加,更根本的是,它使得系统无法延续已经学到的关于用户的信息。

C2

标签到物品的信息瓶颈。RecGPT-V1 和 RecGPT-V2 都让大语言模型预测用户接下来可能交互的物品的自然语言标签,然后由下游模型据此确定具体物品。这种文本接口在推理与检索之间形成了一个有损通道:一个粗略的标签(例如“旋转可调节羽毛球拍支架”)对应着一组宽泛且异构的候选物品,无法传达物品空间所依赖的细粒度、ID 级别的证据,从而在大语言模型预测的意图与最终检索到的物品之间留下了无法弥合的信息鸿沟。

C3

低效的显式推理。显式的思维链有助于大语言模型理解用户并发现其潜在兴趣(Liu 等人,2025;Li 等人,2026;Zhang 等人,2026),但自回归地生成长篇推理过程(在我们的任务中平均 token 数较高)会带来相当大的推理延迟。在数十亿用户规模和高 QPS 场景下,这一成本高得令人望而却步,自然引出了一个核心问题:如何在保持 RecGPT 系列所坚持的核心设计理念——可解释推理能力——的同时,降低延迟。

Refer to caption
图 2:RecGPT-V3 概览。记忆中枢将用户的长期行为提炼为增量式管理的记忆单元;规划器及其多专家模块以这些记忆单元和近期行为为条件,结合混合模态基础模型(自然语言与语义 ID)和潜在意图推理(紧凑的潜在 token),来预测下一个要交互的物品。

为应对这些挑战,我们从三个维度对 RecGPT-V3 进行了改进,即用户建模、意图表示和意图推理,目标是共同提升推荐的准确性与效率。图 2 展示了 RecGPT-V3 的整体框架,该框架体现了以下三项关键技术革新。

S1

记忆中枢(第 2 节)。我们从无状态、单次的用户建模,转向有状态、记忆增强的推荐系统,该系统持续学习每位用户的个性化偏好,并将结构化的用户记忆置于流程核心,作为其引擎。这种记忆将每位用户的长期行为历史提炼为简洁的记忆单元,将模型 token 压缩了 94.5%(高度凝练),将每个单元链接回其原始行为以实现可追溯性(可溯源),并在新交互到来时逐步更新这些单元(可演进),从而让对用户的理解随时间累积,无需每次都从头重新发现。因此,模型利用整合后的记忆以及近期行为增量,而非原始的完整历史,在保留关键行为上下文的同时,将用户建模的计算量减少了 55.8%。

S2

混合模态推荐基础模型(第 3 节)。为了克服“标签到物品”的瓶颈,我们让大语言模型能够使用语义 ID 进行推理,语义 ID 是编码了物品语义的离散代码,作为除自然语言之外的第二种模态。这两种模态起到互补作用:自然语言通过丰富、开放的世界知识来表达意图(可泛化),而语义 ID 则将意图锚定在由协同信号增强的语义物品表示中(具体化)。因此,模型生成的意图表示与下游模型原生兼容,开辟了一条从意图推理到产品检索的高带宽通道,弥补了纯语言接口留下的差距。

S3

潜在意图推理(第4节)。我们将冗长的显式思维链压缩为紧凑的可学习潜在token,将繁琐的推理过程浓缩为几个密集的潜在思考步骤。我们引入了专用的潜在<CoT>槽位,用于编码完整的推理轨迹,将其token成本降低了200倍(高效)。关键在于,这些潜在token可按需解码回可读的推理过程(可解释),从而在低延迟推理与生产级推荐系统所要求的可解释性之间取得平衡。

RecGPT-V3已部署在淘宝首页的“猜你喜欢”场景中,这是全球最大的电商平台界面之一,服务数亿日活跃用户。通过与线上运行的RecGPT-V2系统进行大规模A/B测试,RecGPT-V3在用户参与度和业务指标上均实现了显著提升,包括IPV提升1.28%、CTR提升1.00%、TC提升1.97%、GMV提升3.97%,同时将端到端服务计算量降低了52.4%。更广泛地说,RecGPT-V3证明了大语言模型能够以低成本驱动真实的工业级流水线,使推荐应用回归其创立初衷:忠实地理解并服务每位用户的真实需求。

2 记忆中枢

在RecGPT-V2流水线中,全局规划器分析用户行为历史,将其分解为意图画像,并分派给多专家模块进行物品标签预测和检索。由于每次处理都需要重新处理完整的行为序列(高活跃用户达5.5万token),仅规划器就占用了智能体意图分析中95%的计算成本,而每次处理都会重复发现诸如复购周期、品牌忠诚度和季节性变化等模式——这些模式本可以在不同会话间持续存在并更新。为解决这一问题,我们引入了记忆中枢,这是一个持久化的结构化记忆层,将规划器的输入从无状态的完整序列编码转变为有状态的记忆驱动推理,同时实现了三个特性。

  • •

    压缩:将完整的行为序列整合为一组紧凑的、由模式定义的内存单元,实现 80% 的 token 缩减,同时仅保留连贯且高置信度的行为模式。

  • •

    可追溯:保留每个内存单元到其源行为的溯源链接,在保持下游推荐质量的同时实现可解释性。

  • •

    可演进:通过选择性更新和新模式提取,逐步纳入新出现的行为,无需完全重新编码。

记忆中枢通过两种机制构建并维护这种记忆:结构化行为压缩(§2.1)对每个用户的完整历史行为序列进行初步整合,形成结构化的内存单元;而演进式记忆策展(§2.2)则通过定期整合新观察到的行为来保持记忆的时效性。两者共同将全局规划器的计算量降低 55.8%,同时保持推荐质量。图 3 展示了记忆中枢架构的概览。

Refer to caption
图 3:记忆中枢概览。结构化行为压缩将用户的长期行为历史提炼为一组紧凑的结构化内存单元,减少了 token 使用量。演进式记忆策展随后通过选择性更新现有单元并从未匹配的行为中提取新模式,使记忆保持时效性,从而为下游推荐生成一个压缩、可追溯且可演进的用户表征。

2.1 结构化行为压缩

结构化行为压缩将用户的完整行为序列整合为一组紧凑的结构化内存单元。形式上,我们将此过程定义为一个基于大语言模型的记忆构建函数:

(1)

它作为初始扫描运行一次,生成一个持久化记忆,作为后续增量更新的基础(§2.2)。每个单元围绕两个核心字段构成,共同描述一个行为模式。第一个字段是行为模式标识符,这是一个分类标签,取自一个包含数百种模式的预定义分类体系,涵盖主要的电商行为原型;当现有模式无法捕捉高置信度聚类时,允许进行受控扩展。第二个字段是偏好摘要,以自然语言描述用户在该模式中的偏好、趋势和消费特征。作为这两个字段的补充,每个单元还记录了辅助元数据:用于溯源的代表性行为索引、偏好品牌、时间活动画像和时间戳。表 1 展示了一个完整示例。

媒体内容 · 前往原文查看
表 1:结构化记忆单元示例
字段 示例
行为模式 K-pop 粉丝圈
偏好摘要 某 K-pop 女团的忠实粉丝。从专辑预购到周边收藏和现场演唱会参与的全生命周期互动。对收藏完整性和物品保存有强烈关注。
代表性索引 549, 553, 558, 563, 564, 565, …
偏好品牌 SingBA, 时代良品, 珍琢, …
时间活动 首次出现于 2023 年 3 月;高峰期为 2023 年 6 月及 8 月至 10 月。
时间戳 创建时间:2023-10-31
媒体内容 · 前往原文查看
表 2:从 到 的记忆列表增量整理。行颜色表示操作类型:更新(用新证据刷新摘要)、保留(因缺乏相关新行为而保持单元不变)、新增(从现有单元无法匹配的行为中创建新单元)。
单元 模式() 在 时的摘要 在 时的摘要 操作
婴幼儿护理 0–6 个月婴儿配方奶粉、尿布和婴儿服装的频繁购买者。 转向 6–12 个月。新增幼儿玩具和学步车。 (1) 更新
户外跑步 跑鞋、GPS 手表和马拉松营养补剂。 (未变化) (1) 保留
家庭烹饪 性价比高的厨房小工具和烘焙用品。 转向高端炊具和空气炸锅配件。 (1) 更新
摄影 无反相机配件和镜头滤镜。 (未变化) (1) 保留
养宠新手(新增) — 宠物食品与美容用品。首次养宠用户。 (2)新增

2.2 演进式记忆整理

结构化行为压缩(§2.1)建立了初始记忆状态,但用户兴趣会随着偏好涌现、消退以及人生阶段和季节更替而随时间漂移。静态记忆会逐渐偏离用户,削弱推荐相关性。演进式记忆整理通过周期性增量更新来对抗这种漂移,将新观察到的行为融入现有记忆。全局规划器随后基于这份紧凑记忆以及近期行为增量进行推理,而非每次重新编码完整行为序列,从而大幅降低用户建模的计算量。

具体而言,设 表示在时间 由初始压缩或上一轮整理周期产生的记忆状态, 表示在区间 内新累积的行为交互。演进式记忆整理将增量更新函数定义如下:

(2)

其中 表示经选择性更新或保留后的现有记忆单元集合, 表示从先前未匹配行为中提取的新建记忆单元集合。最终整理后的记忆 由这两部分合并得到。按设计, 在运行时不访问完整序列 ,仅依赖压缩后的记忆 和新增量 。

(1)现有单元的选择性更新。

对于每个现有记忆单元 ,模型判断新的行为增量中是否包含与该模式相关的交互:

(3)

其中 表示与 语义相关的新行为子集, 表示分配给现有记忆单元的所有新行为的并集。当触发时,更新操作会刷新该单元的摘要及所有支撑元数据;否则,该单元保持不变。这种选择性策略遵循"有证据则更新,无扰动则保留"的原则。由此得到的更新或保留后的记忆集合为:

(4)
(2)新模式提取。

选择性更新未分配给任何现有单元的交互构成新颖行为集合:

(5)

新的模式提取在同一整理函数中通过公式(2)执行。给定先前的记忆和新的行为增量,该函数识别出连贯的未匹配行为,并将其写入新的记忆单元:

(6)

如果未识别出连贯的新模式,则。

最终记忆将选择性更新所保留或更新的现有单元与这些新提取的单元结合起来:

(7)

在实践中,这两个操作共享一次模型前向传播,该前向传播同时更新现有单元并提取新单元,从而避免了流水线中多次顺序调用。

语义连续性。

每次选择性更新都会将受影响的单元重新合成为用户当前状态的连贯快照,而不是将新行为附加到旧摘要上,从而防止陈旧偏好和新兴偏好累积在同一个单元内。如表2所示,随着兴趣的成熟,偏好从“0-6个月”向“6-12个月”转移,并转向高端厨具,而未受影响的单元(, )保持不变,同时首次出现的兴趣形成了新单元。

总结来说,记忆中枢将每个用户的原始行为序列转化为一个结构化、持续演进的记忆,作为推荐流水线的引擎。系统不再在每次请求时从完整的交互历史中重新推导用户理解,而是基于这个紧凑、高信号强度的记忆以及最近的行为增量进行推理,从而使其对用户的理解随时间不断积累和优化。在生产环境中,增量整理每两个月执行一次,将用户建模的总计算量减少了55.8%。详细的效率分析和质量验证见第5.2节。

3 混合模态推荐基础模型

纯文本大语言模型专家通过单一自然语言通道与离散物品空间交互:它们预测自由形式的物品标签,由下游检索器将其对应到领域内物品。这种间接性使得标签成为推理与检索之间的有损瓶颈——诸如“适合马拉松训练的轻量跑鞋”这类粗粒度标签会匹配到宽泛且异质的物品集合,无法传递检索所依赖的细粒度、物品级证据,从而削弱了模型所表达意图与最终呈现物品之间的耦合度。

为克服这一瓶颈,我们提出一种混合模态推荐基础模型,该模型在 Qwen3-14B(Yang 等人,2025)骨干网络上扩展了语义ID(SID)——一种编码物品语义的离散编码——作为与自然语言并列的第二模态。推荐本质上需要同时推理用户意图并将其落实到具体物品上,这种双重需求是单一表征无法独立满足的。因此,两种模态互为补充,各自满足这一需求的一个方面:

  • •

    可泛化性:自然语言通过丰富、开放的世界知识表达意图。

  • •

    具体性:SID 将意图落实到由协同信号增强的物品表征中。

通过将两种模态纳入统一词表,模型能够输出与检索兼容的标识符而非粗粒度标签,从而在物品空间中开辟一条高带宽通道,同时保留其完整的自然语言能力。图 4 展示了整体流程,包含两个组件:一种构建语义化 SID 的混合分词方案(§3.1),以及一个两阶段训练流程——该流程将这些 token 锚定到语言中,并使模型具备对 SID 与文本进行联合推理的能力(§3.2)。

Refer to caption
图 4:混合模态基础模型概览。多模态物品特征通过 CN-CLIP 和两级 RQ-VAE 被量化为 SID token,从而扩展 Qwen3-14B 的词表。随后,持续预训练(阶段 1)和指令微调(阶段 2)将这些 token 与语言对齐,并在两个阶段中混合通用领域数据。

3.1 混合分词

混合 token 化技术通过将基于物品内容生成的语义 ID token 扩充到大语言模型的原生文本词汇表中,从而使语义相似的物品获得相近的编码。构建这些语义 ID 的过程分为两个阶段:首先通过对比学习获得具有判别能力的多模态物品表征,然后利用残差量化(RQ-VAE)(Lee 等人,2022;Fu 等人,2026;Chen 等人,2026)将其量化为离散的分层编码。下文将对每个阶段进行详细说明。

多模态物品表征。

本阶段的目标是通过融合物品的文本、图像及辅助信息,为每个物品获取统一且具有判别能力的嵌入向量。由于不存在显式标签来定义物品相似性,我们直接从用户行为中挖掘正样本对:在行为日志中频繁共现的物品构成候选对,并从中剔除多模态相似度较低的配对,以防止虚假共现的干扰。保留下来的配对用于监督对比学习。

具体而言,对于每个物品,我们提取其文本描述、图像信息以及辅助信息(例如物品属性与元数据)。我们采用 CN-CLIP(Yang 等人,2022),记为,对每种模态进行编码,输入内容决定调用哪个子网络:和,而辅助信息则先转换为文本形式再进行编码,得到。这些模态特定的特征通过 Q-Former(Li 等人,2023),记为,进行融合,从而生成统一的物品表征:

(8)

在训练过程中,我们将物品作为正样本,同一批次内的其他物品作为负样本,优化一个基于 InfoNCE 的损失函数,该损失函数同时在融合层和模态特定层上起作用:

(9)

其中表示 InfoNCE 损失函数(Radford 等人,2021)。这一对比学习目标使得后续的量化过程更加稳定:它所生成的分离良好的嵌入空间能够防止 RQ-VAE 容易出现的码本坍缩问题。

残差量化。

基于多模态物品表示,我们应用 RQ-VAE 将每个物品映射为一系列离散编码,这些编码构成了其语义 ID。在最终配置中,我们采用了两级码本结构,每级的词汇表大小为 32,768。这导致模型词汇表中新增了总共 65,536 个新 token(记为 <C_0> 至 <C_65535>)。一个物品的完整 SID 由两个码本条目组成,例如 <C_18921><C_40222>,其中第一个 token 代表粗粒度的语义聚类,第二个 token 则在该聚类内提供细粒度的区分。这种两级设计在保持细粒度物品区分能力的同时,使新增词汇表大小可控:由于相关物品共享其粗粒度编码,物品空间中的语义相似性在 SID 空间中表现为共享前缀,模型可以利用这种结构来泛化到相关物品。

3.2 预训练

新的 SID token 被附加到原始 Qwen3-14B 词汇表中,其嵌入向量随机初始化并在训练过程中学习。为了教会模型理解和生成这种混合词汇表,我们采用了两阶段流程:持续预训练(§3.2.1),将 SID token 锚定在物品语义中;随后是指令微调(§3.2.2),教会模型在各种推荐任务中应用这些 token。整个过程中的核心关注点是在注入领域知识的同时,不侵蚀模型已有的通用能力,我们通过精心设计的数据构建和策略性混合来达成这一平衡。

3.2.1 持续预训练

持续预训练追求两个目标:❶ 将新添加的 SID token 锚定在自然语言空间中,使模型能够在上下文中理解和生成它们;❷ 保留骨干模型已有的通用能力。因此,我们的语料库结合了两个互补的组成部分:SID 锚定数据,它将每个 SID 与其所指代物品的内容关联起来,教会模型直接从这些 token 中读取物品语义;以及通用领域数据,用于防止灾难性遗忘。

SID 锚定数据。

我们构建每个 SID 接地样本时,将其设计为一条自然语言陈述,将物品的语义 ID 与其文本属性(如标题和类别)配对,从而使模型学会仅凭 SID 就能还原物品的内容。例如,以下样本将 SID <C_18921><C_40222> 与该物品的标题和类别关联起来:

这一阶段为模型赋予了 SID token 的可用语义,使得后续的指令微调能够基于模型已理解的标识符进行操作,而非面对不透明的符号。

通用领域数据。

如果主要使用 SID 接地数据进行训练,存在导致模型灾难性遗忘下游部署所依赖的通用能力的风险。因此,我们在语料中混合了约 10% 的通用领域文本,涵盖数学推理、代码、科学文献、医学文本以及指令遵循数据。

3.2.2 指令微调

在持续预训练之后,我们进行指令微调,以教会模型在多种对齐任务中应用 SID token。我们将这些任务分为三类:❶ SID 与文本之间的双向翻译,❷ 直接在 SID 空间内进行的序列推荐,以及 ❸ 保留模型原有能力的通用领域任务。表 3 总结了前两类中与 SID 相关的任务。下文将详细说明每种任务类型。

SID-文本双向翻译。

这一任务族实现了 SID 与其文本描述之间的相互映射,关联了物品标题()、搜索查询()和商品()。覆盖双向翻译教会模型既能从 SID 中读取物品的语义,反过来也能针对给定的描述输出正确的 SID。

序列推荐。

该任务将序列推荐完全置于 SID 空间内进行。给定用户按多粒度时间窗口(例如 3 天、2 天、1 天、12 小时、1 小时)组织的点击历史,模型预测用户接下来会点击的 SID。由于完全基于 SID token 操作,不涉及任何物品文本描述,这为模型已通过这些 token 内化了协同过滤信号提供了最直接的证据。

通用领域任务。

为保持模型通用文本能力不受影响,约 20% 的指令微调数据由开放域监督任务构成,例如自然语言推理、实体抽取和电商相关任务。这一比例经过校准,旨在保留指令遵循的保真度,特别是生成格式规范的 JSON 输出以及满足复杂的多约束提示词,同时不削弱推荐专用的训练信号。

媒体内容 · 前往原文查看
表 3:SID 相关的对齐任务及其输入-输出映射。上方区块涵盖 SID-文本双向翻译;底部一行为基于 SID 的序列推荐。
任务 映射 描述 占比
sid2title    根据 SID 生成商品标题。 13.8%
title2sid    根据商品标题预测 SID。 14.7%
sid2tag    根据 SID 生成自然语言标签。 11.5%
tag2sid    根据文本标签预测候选 SID。 6.2%
sid2cmd    根据 SID 预测商品品类。 13.8%
sid2sid    根据用户的点击历史预测下一个点击的 SID。 20.0%

4 潜在意图推理

显式思维链推理已成为基于大语言模型的推荐系统解读用户行为、揭示隐含兴趣的常用方法,通过多步推演有效提升预测精度。然而,这种质量提升代价高昂:自回归生成一段长达数千 token 的推理过程,远长于最终输出,在十亿用户规模和高 QPS 场景下,延迟和计算成本变得难以承受。这自然引出一个问题:能否在不付出 token 成本的前提下,保留推理性推理带来的收益?

我们通过潜在意图推理来回答这个问题,该方法将冗长的推理过程内化为一组短小的可学习潜在 token,具有两个特性:

  • •

    高效:将数千步顺序解码的推理过程压缩为少量潜在 token,将成本从缓慢的自回归解码转移到可并行化的预填充阶段,使推理 token 成本降低 200 倍,并大幅降低推理延迟。

  • •

    可解释性:与不透明的潜在表示不同,这些 token 可以在需要时解码回忠实、人类可读的推理依据,从而保留了潜在推理通常为追求速度而牺牲的可解释性。

为了赋予这些无监督 token 推理语义,我们首先阐述了潜在推理机制:一种压缩方案,将冗长的显式推理轨迹压缩成少量潜在 token,同时结合多任务对齐目标,监督这些 token 忠实地编码它们所替代的推理(§4.1)。然后,我们通过一个完整的两阶段后训练流程来实现这种内化,该流程从强教师模型中蒸馏推理能力,并通过在线反馈驱动的强化学习对其进行优化(§4.2)。图 5 提供了概览。

Refer to caption
图 5:潜在意图推理概览。三个基于重建的对齐任务将显式的思维链推理轨迹压缩成一个短序列的可学习潜在 token,这些 token 忠实地对其进行编码。随后,一个两阶段后训练流程将此推理内化到模型中:显式到隐式思维链对齐首先将教师模型的推理轨迹蒸馏到潜在 token 中,然后基于排序反馈的强化学习根据在线业务奖励优化策略。

4.1 推理内化

推理模型接收输入 ,即全局规划器分配的角色以及用户最近的点击历史,其中每个被点击的商品由其语义 ID 和短标题表示。在给定 的条件下,一个显式思维链模型(例如,我们实验中的 DeepSeek-V3.2(Liu 等人,2024))首先生成一个由换行符分隔步骤组成的推理轨迹,然后输出商品标签 ,将联合分布分解为

(10)

然而,承载这些推理增益的痕迹也正是成本集中的地方:其步骤以自回归方式解码,且长度通常远超输出,成为主要的效率瓶颈。因此,我们将其内化为可学习的短隐式槽位,以新词汇 token 的形式引入,其嵌入向量随机初始化。这用隐式对应项替换了公式 (10) 中的显式分解。

(11)

还需明确 与隐式推导痕迹之间的关系。我们采用确定性位置划分:痕迹被分割成连续的、不重叠的片段,每个片段最多包含 步,隐式 token 编码片段 。隐式 token 的数量如下:

(12)

此处 设定每个隐式 token 的粒度,较大的 会将更多推理步骤折叠进单个 token,而 则限制序列长度,从而约束推理成本。当痕迹少于 步时,末尾的隐式 token 覆盖较短的或空片段;当痕迹超出此预算时,覆盖范围止于前 个片段。

表 4:针对一个运行示例(羽毛球装备专家)的三项对齐任务,每项任务对应掩码集 的一种选择。隐式 token <cot> 替换它们所编码的片段,模型根据周围上下文重建被掩码的片段。灰色锚点 和 标记输入和输出,其具体内容在此省略。
任务 输入:上下文 目标:掩码片段
单片段 偏爱全碳素球拍和高端手胶的资深羽毛球玩家。<cot2>保留最具体的 10 个标签,去掉宽泛类别术语。 <cot2> :根据近期点击,列举球拍、球线、手胶和场地鞋。
多片段 <cot1> 根据近期点击,列举球拍、球线、手胶和场地鞋。<cot3> <cot1> :偏爱全碳素球拍和高端手胶的资深羽毛球玩家。<cot3>:保留最具体的 10 个标签,去掉宽泛类别术语。
全痕迹 <cot1> <cot2> <cot3> 偏爱全碳素球拍和高端手胶的资深羽毛球玩家。根据近期点击,列举球拍、球线、手胶和场地鞋。保留最具体的 10 个标签,去掉宽泛类别术语。
黑色
隐式 Token 预热。

随机初始化的潜在嵌入向量远远落后于预训练的 token 嵌入向量:它们位于预训练嵌入分布之外,且尚未携带任何语义信息。为了将它们校准到与语言 token 兼容的表示空间中,我们随机选择轨迹中的一个或多个连续跨度,用潜在 token 替换它们以形成混合轨迹,并在混合序列上优化标准自回归目标。

(13)

其中索引表示保留的文本 token,而潜在位置仅作为上下文提供。从周围文本预测每个被掩码的跨度,将潜在嵌入向量拉入预训练表示空间,并赋予它们粗略的上下文语义,从而为后续的片段级对齐提供良好的初始化条件。

多粒度对齐。

预热阶段在表示层面校准了潜在嵌入向量,但并未确定每个潜在槽位应保留哪些信息。位置划分仅将片段与潜在 token 建立结构对应关系;这种对应关系必须转化为可学习的信息约束。我们通过多粒度下的掩码重建来实现这一约束。给定一个掩码索引集,我们构建一个混合序列,该序列将未掩码的片段保留为文本,同时将每个被掩码的片段替换为其潜在 token,其公式如下:

(14)

并且,在指示需要恢复哪些位置的任务特定提示词引导下,训练模型从该上下文中重建被掩码的片段:

(15)

每个任务的提示词模板见附录 C。这三个任务仅在如何抽取方面有所不同,范围从单个潜在 token 扩展到整个序列(如表 4.1 所示):

  • •

    单片段重建。我们将单个片段隐藏在其潜在 token 之后,同时将轨迹的其余部分保留为文本,模型重建。丰富的周围上下文使这种重建变得简单,因此最小化可将每个潜在 token 锚定到其自身片段,并产生直接的逐位置编码信号。

  • •

    多片段重建。我们同时将多个片段隐藏在它们的潜在 token 之后,模型仅恢复被掩码的文本。由于被掩码的跨度可能跨越片段边界,最小化该损失会促使每个 token 在与周围文本共同作用时保持信息量,而非孤立存在。

  • •

    全迹重建。我们对每个片段进行掩码,因此上下文缩减为,目标函数变为。这迫使潜在序列足以仅从中恢复完整的推理链。

除了压缩之外,重建目标还保留了潜在推理的可解码性。由于被训练为的充分编码,模型可以从恢复出人类可读的推理过程,从而以更低的 token 成本保留显式 CoT 的透明性。附录 C 提供了案例,展示潜在 token 如何与显式推理链相对应。

4.2 后训练

本节详细介绍了使 RecGPT-V3 具备潜在推理能力的后训练流程,该流程分两个阶段进行:(1) 显式到隐式 CoT 对齐(§4.2.1)—— 将推理从强教师模型蒸馏到显式推理迹中,然后通过 §4.1 的多任务课程将其压缩为潜在 token;(2) 基于排序反馈的强化学习(§4.2.2)—— 直接针对在线业务目标优化潜在模型。

4.2.1 阶段 1:显式到隐式 CoT 对齐

在此训练阶段,我们首先将推理从强教师模型蒸馏到显式 CoT 推理迹中,然后通过 §4.1 的多任务课程将其压缩为潜在 token。

媒体内容 · 前往原文查看
表 5:阶段 1 的训练数据混合比例。
任务 占比
❶ 推理对齐 21.43%
单片段重建 06.45%
多片段重建 06.56%
全迹重建 08.42%
❷ 通用推理 69.58%
❸ 标签预测 08.43%
(1) 推理蒸馏。

我们通过在强教师模型的显式 CoT 输出上微调模型来蒸馏推理。这些思考过程虽然有效但效率低下,平均约需 2,300 个 token,因此主导了整体推理成本。

(2) 潜在内化。

然后,我们通过第4.1节的对齐课程将每条轨迹压缩为潜在token;在特定条件下,一条轨迹最多映射为10个潜在token,压缩比约为200:1。训练采用多任务混合方式(表5),涵盖三种角色:❶ 将轨迹内化为潜在token的三项推理对齐任务,❷ 防止灾难性遗忘的通用推理数据,以及❸ 与部署格式匹配的标签预测任务——在该任务中,我们仅对输出token进行监督,以避免潜在位置坍缩。

4.2.2 第二阶段:基于排序反馈的强化学习

监督阶段仅能模仿教师轨迹,无法优化业务目标。现有RecGPT-V2(Yi等人,2025a)采用基于命中率(HitRate)的准确率奖励——即用户保留的真实物品中被其输出检索到的候选物品所占比例——但这种离线代理存在两个局限:(1)奖励稀疏性:在GRPO风格的目标函数下,组内采样结果可能获得相同奖励,导致优势归零,无法产生学习梯度。(2)流水线不一致性:由于输出必须经过服务流水线才能到达用户,在流水线外部计算的奖励可能与实际下游性能产生偏差。

为解决这两个局限,我们提出基于排序反馈的强化学习(RLRF),其核心思想是直接从决定用户最终看到内容的生成排序模型中获取奖励,从而产生既密集又与服务流水线一致的信号。具体而言,我们用从该下游排序模型读取的点击率分数(CTRScore)替代命中率准确率奖励。对于生成的物品标签输出,我们使用检索候选物品,用生产排序模型对每个物品打分,并取前个分数的平均值:

(16)

其中 是检索项中第 大的 CTRScore(在我们的实验中为 )。这一设计同时解决了两个限制:对前 个排名分数取平均,将稀疏的 HitRate 信号转化为密集信号;同时,从生产级排序模型中读取奖励,使得训练过程与输出实际经过的流水线保持一致。因此,当某个输出检索到的项目受到下游排序器青睐时,该输出就能获得高奖励,从而引导策略倾向于那些流水线更有可能呈现给用户的候选项目。

对于其余奖励项,我们保留了 RecGPT-V2 的约束奖励塑形(CRS)框架,该框架将对齐分数、多样性分数和长度分数作为主要奖励的质量约束:仅当所有三个阈值都满足时, 才会传播。对齐分数由一个基于人类偏好对训练的奖励模型生成,用于评估每个预测标签在多大程度上符合人类质量标准。最终奖励的公式如下:

(17)

其中 、 和 分别是对齐阈值、多样性阈值和长度阈值;这些术语的定义请读者参考 RecGPT-V2。我们使用 GRPO(Shao 等人,2024)来优化策略,对每个输入采样的输出组计算组内相对优势。

5 实验

我们在淘宝首页推荐场景下评估 RecGPT-V3,该场景服务于数亿日活跃用户。我们的评估涵盖五个维度:(1)针对 RecGPT-V2 基线的整体在线 A/B 测试结果(§5.1);(2)通过人工标注和计算效率分析进行记忆枢纽评估(§5.2);(3)在通用能力保持、SID-文本对齐和下游推荐质量方面的推荐基础模型评估(§5.3);(4)通过训练后效果和推理效率分析进行潜在推理评估(§5.4);以及(5)关于 SID 模态的进一步分析和案例研究(§5.5)。

5.1 在线 A/B 测试结果

实验设置。

我们将 RecGPT-V3 部署在淘宝首页的“猜你喜欢”场景中,并在以下配置下进行在线 A/B 测试:

  • •

    流量分配:实验组和对照组各获得平台总流量的 1%,在将部署风险降至最低的同时,产生具有统计显著性的结果。

  • •

    基线:RecGPT-V2 作为对照组,能够直接评估 RecGPT-V3 所带来的改进。

  • •

    评估场景:我们在两个互补的范围内分别评估性能:

    • –

      商品场景:以网格布局呈现的直接商品推荐。

    • –

      信息流场景:主信息流中的混合内容推荐流,包含商品、广告、直播及其他内容类型。

评估指标。

我们从两个维度评估系统性能:

用户参与度:

  • •

    IPV(商品页面浏览量):商品详情页的访问次数,反映用户兴趣。

  • •

    CTR(点击率):点击次数与曝光次数的比率,衡量推荐相关性。

  • •

    PV(页面浏览量):页面浏览总次数,表示整体浏览活动。

  • •

    DAU(日活跃用户数):每日独立活跃用户数量,衡量平台活跃度。

商业交易:

  • •

    TC(交易笔数):完成的交易数量,反映转化效果。

  • •

    GMV(商品交易总额):交易的总货币价值,衡量整体商业价值。

媒体内容 · 前往原文查看
表 6:RecGPT-V3 与 RecGPT-V2 基线在商品场景和信息流场景下的在线 A/B 测试结果对比。所有指标均显示相对提升百分比(% 已省略)。
场景 用户参与度 商业交易
IPV CTR PV DAU TC GMV
商品 +3.08 +0.98 +2.02 – +3.10 +7.51
信息流 +1.28 +1.00 +0.83 +0.56 +1.97 +3.97

注:– 表示该指标在给定场景中不适用。

结果与分析。

表 6 总结了在线 A/B 测试结果。RecGPT-V3 在两个评估场景的所有指标上均持续优于 RecGPT-V2。

在商品场景中,提升更为显著:IPV 增长 3.08%,CTR 增长 0.98%,PV 增长 2.02%,TC 增长 3.10%,GMV 增长 7.51%。这一模式表明,RecGPT-V3 对商品级推荐的改进不仅仅是吸引了更多点击,因为 IPV、TC 尤其是 GMV 相对更强的增长表明,用户在曝光后更有可能进入商品详情页、完成交易并产生更高的交易价值。这意味着检索出的候选商品不仅在点击阶段更具相关性,而且与用户的购买意图更加对齐。

在信息流场景中,这反映了整体平台体验,RecGPT-V3 实现了 IPV 增长 1.28% 和 CTR 增长 1.00%,表明推荐相关性和用户参与度有所提升。浏览活动量(PV)增长 0.83%,平台留存率(DAU)健康增长 0.56%,证实了这些改进覆盖了广泛的用户群体,而非集中在少数用户身上。交易指标也有显著提升,GMV 增长 3.97%,TC 增长 1.97%,这表明更强的意图理解直接转化为了购买行为。

5.2 记忆中枢评估

我们通过两项互补分析来评估第 2 节中引入的记忆中枢:人工标注以验证记忆表征的准确性(第 5.2.1 节)和计算效率分析(第 5.2.2 节)。在所有实验中,记忆中枢条件将全局规划器的完整序列输入替换为压缩后的记忆表征加上近期行为增量,同时保持下游组件不变。

5.2.1 记忆质量评估

媒体内容 · 前往原文查看
表 7:记忆单元质量的人工评估。“行为模式”衡量分配的模式标识符是否正确地对用户的聚类行为进行了分类;“行为索引”衡量代表性索引是否正确指向属于已识别模式的交互行为。
评估目标 标注数量 准确率
行为模式 2,514 82.89%
行为索引 21,268 95.27%

我们开展了一项大规模人工标注研究,针对结构化行为压缩(§2.1)产生的记忆单元,以评估记忆中枢结构化表征的事实准确性。标注人员对每个记忆单元的两个互补方面进行评估,如表7所示。在2514个标注的行为模式中,准确率达到82.89%,这表明基于大语言模型的压缩能够可靠地从嘈杂的交互序列中识别出连贯的行为原型。行为索引准确率则显著更高,在21268个标注中达到95.27%,这证实了一旦模式被正确识别,其支撑证据也能被准确归因。这一点尤为重要,因为每个记忆单元仅存储指向原始序列的整数指针(§2.1),而高索引准确率确保了这些指针在下游推理中仍是可靠的引用。综合来看,这两项指标验证了记忆中枢能够生成可靠的结构化表征。

5.2.2 计算效率

媒体内容 · 前往原文查看
表8:有无记忆中枢的用户建模计算成本,以相对于RecGPT-V2基线的比例表示。
系统 组件 成本
RecGPT-V2 完整序列
RecGPT-V3 单次推理
记忆整理
总计 44.20%

与RecGPT-V2基线相比,记忆中枢将全局规划器的计算成本降低了55.80%(表8)。主要的节省来自推理环节:每次推理现在基于压缩后的记忆和近期行为增量,而非重新编码完整的行为序列,从而将单次推理成本降至33.43%。对记忆进行周期性增量整理(§2.2)额外贡献了10.77%的成本,相对于其所带来的节省而言,这一开销是适度的。总体而言,记忆中枢将每次推理的重复性开销转化为可摊销的记忆维护成本,从而形成了随请求量增长而更具扩展性的计算模式。

5.3 基础模型评估

我们围绕两个问题对混合模态基础模型进行评估:(1) 该模型在经历领域特定训练后,是否仍能保持强大的通用语言能力(§5.3.1)?(2) 该模型能否实现准确的跨模态 SID–文本对齐,并将其转化为强大的下游推荐质量(§5.3.2)?为了厘清通用领域数据混合的贡献,我们全程对比了两个模型变体:

  • •

    含通用领域数据:基于 Qwen3-14B 初始化,并使用 SID 基础数据与通用领域数据共同训练。

  • •

    不含通用领域数据:架构与 SID 基础数据相同,但移除了所有通用领域数据。

5.3.1 通用能力保持

为回答混合模态基础模型是否保持通用语言能力,我们在四个代表性基准上评估其准确率,涵盖数学推理(GSM8K)、广泛知识(MMLU)、中文语言理解(CMMLU)以及指令遵循(IFEval)。

Refer to caption
图 6:四个基准上的通用能力评估。混合模态基础模型(含通用领域数据)保留了骨干网络的大部分能力,而移除通用领域数据(不含通用领域数据)则导致灾难性崩溃。

如图 6 所示,通用领域数据混合保留了骨干网络的绝大部分能力。GSM8K 仅下降 1.66%(94.31% → 92.65%),MMLU 下降 2.65%,CMMLU 下降 4.49%,IFEval 从 81.52% 降至 75.60%。而移除通用领域数据则导致灾难性崩溃。不含通用领域数据的变体在 GSM8K 上降至 4.70%,MMLU 上降至 0.12%,CMMLU 上降至 0.01%,IFEval 上降至 23.29%,几乎丧失了所有推理、知识和指令遵循能力。因此,通用领域数据至关重要。没有它在持续预训练和指令微调过程中提供的正则化作用,模型会过拟合于领域特定模式,从而丧失实际部署所需的通用能力。

5.3.2 SID 对齐与推荐质量

Refer to caption
图 7:四项双向翻译任务上的 SID–文本语义对齐。

我们沿着两个相互关联的维度评估基础模型:SID与文本之间的跨模态对齐,以及下游推荐质量。对齐通过四项双向任务(sid2title、sid2tag、title2sid、tag2sid)进行衡量,其中两项生成任务使用ROUGE-L,两项预测任务使用HR@30(SID)。下游质量从三个维度衡量:标签多样性(每位用户的平均唯一标签数)、类别覆盖率(将标签映射到淘宝分类体系后的不同商品类别数),以及类别级HR@30(针对两周内实际点击的命中率)。

除了缓解主干网络通用能力的灾难性遗忘(§5.3.1)之外,通用领域数据还能保持SID与语言的对齐,并提升下游推荐质量。图7显示,两个变体之间的所有四项对齐指标基本保持不变,表明混合通用领域数据不会损害从SID基础数据中学到的SID到文本的映射能力。表9进一步显示,这种数据混合使类别级HR@30提升了(),同时在标签多样性和类别覆盖率方面也取得了相当的增益,通过基于内容和上下文感知的用户意图理解,将保留的通用能力转化为实质性的更强下游性能。总体而言,这些结果证明了有意整合通用领域数据的合理性:它保留了语义对齐优势,维持了主干网络的通用知识,并将两者转化为更强的下游性能。

媒体内容 · 前往原文查看
表9:下游推荐质量对比。
模型 平均标签数 平均类别数 HR@30(类别)
含通用领域数据 28.77 41.73 0.3050
不含通用领域数据 23.88 32.49 0.2250

5.4 潜在推理评估

我们从两个角度评估潜在推理模块(§4):(1)训练后有效性,考察每个训练阶段和强化学习对推荐质量的贡献;(2)推理效率,比较显式推理与潜在推理的计算成本。

5.4.1 训练后有效性

我们逐步增加训练阶段,以考察它们各自对推荐质量的贡献。表10报告了两个指标:HR@30(类别),即前30个预测中的类别级命中率;以及CTR,即模型输出检索到的前100个物品的平均点击率。我们比较了两组模型变体:第一组基于Qwen3-14B,评估仅靠原生推理能力是否能在没有领域特定训练的情况下改善推荐(CTR不适用,因为这些变体未接入在线反馈流程);第二组基于混合模态基础模型(§3),逐步增加推理组件。

  • •

    Qwen3-14B:不具备推理能力的基础语言模型,直接从提示词生成输出。

    • –

      + 原生推理:在推理过程中启用Qwen3内置的思维链。

  • •

    混合模态基础模型:经过预训练后的基础模型,不具备推理能力。

    • –

      + 显式思维链(SFT):使用从DeepSeek-V3.2蒸馏得到的推理轨迹进行监督微调。

    • –

      + 隐式推理:通过多任务课程(§4.1)将显式推理内化为10个隐式token。

    • –

      + 强化学习:在隐式推理之上应用强化学习(完整的RecGPT-V3)。

在Qwen3-14B上,启用原生思维链仅带来微小的HR@30提升(0.2347对比0.2276),证实了没有领域特定训练的推理带来的收益有限。在混合模态基础模型上,显式思维链将HR@30从0.3050提升至0.3508,展示了结构化推理能够实现更精准的意图理解。隐式推理在将2700个推理token压缩为仅10个隐式token的同时,达到了可比的性能(HR@30 0.3462,CTR 0.0649)。通过强化学习,HR@30和CTR分别进一步提升至0.3693和0.0679,在两个指标上均超越了显式思维链。

媒体内容 · 前往原文查看
表10:后训练效果对比。上半部分评估基础语言模型上的推理能力;下半部分评估混合模态基础模型上的推理能力。“–”表示该指标不适用于在线反馈流程之外的配置。
设置 HR@30(类别) CTR
Qwen3-14B 0.2276 –
+ 原生推理 0.2347 –
混合模态基础模型 0.3050 0.0624
+ 显式思维链(SFT) 0.3508 0.0638
+ 潜在推理 0.3462 0.0649
+ 强化学习 0.3693 0.0679

5.4.2 推理效率

显式思维链的一个关键实际问题是其计算开销:每个样本生成 2,840 个推理 token 会显著增加推理延迟,因为每个 token 都需要顺序自回归解码。潜在推理通过将推理过程压缩为 10 个潜在 token 来解决这一问题,将计算成本从缓慢的顺序解码转移到可并行的预填充计算。表 11 在相同硬件条件下,基于 1,000 个样本的基准测试量化了这一优势。潜在推理模型将每个样本的输出长度从 2,840 个 token 减少到 122 个 token(减少了 95.7%),实现了 3.46 倍的端到端加速(从 1,020 秒降至 295 秒)。同时,输入吞吐量从每分钟 166K token 增加到 498K token,证实了瓶颈已从输出解码有效转移到输入预填充。结合表 10 中展示的可比推荐质量,潜在推理在生产部署中实现了效果与效率之间的有利权衡。

服务成本分析。

在输入和输出中同时使用语义 ID,并结合潜在意图推理,会增加上下文长度,从而与 RecGPT-V2 专家模型相比,给专家模型带来 15% 的计算开销。然而,这一局部开销被全局规划器带来的系统级节省所抵消——在当前部署中,全局规划器的计算成本大约是专家模型的 20 倍。借助记忆机制将规划器端的计算量减少 55.8%,加权后的总体资源节省达到 52.4%。

媒体内容 · 前往原文查看
表 11:在相同硬件条件下,显式思维链与潜在推理在 1,000 个样本上的推理效率对比。“输出长度”表示每个样本生成的平均 token 数,包括推理和最终输出;“输入/输出 TPM”分别表示预填充和解码阶段每分钟处理的 token 数;“总时间”表示处理所有样本的挂钟时间。
模式 输出长度 输入 TPM 输出 TPM 总时间(秒)
显式思维链 2,840 166K 531K 1,020
潜在推理 122 498K 66.7K 295(71.1%)

5.5 进一步分析

除了上述定量评估之外,我们还提供了两项进一步分析,以提供更深入的见解。我们首先考察文本标签和 SID 作为双重检索模态的互补作用(§5.5.1),然后通过案例研究展示核心模块在实践中如何协同工作(§5.5.2)。

5.5.1 SID 模态分析

混合模态基础模型同时生成文本标签和 SID,作为互补的意图表示(§3):文本标签通过开放式的世界知识提供可泛化的类别级覆盖,而 SID 则将用户兴趣锚定在具体的协同语义上。我们从三个角度验证了这一设计:文本标签的覆盖广度与 SID 的用户特异性、它们在嵌入空间中的多样性,以及它们在端到端检索中的互补性。

覆盖广度与用户特异性。

在每次推理中,专家模型为给定用户生成文本标签,以及每个标签对应的 SID。我们将每个文本标签映射到一个物品类别集合 ,并将其共同生成的 SID 类别聚合为 。我们定义平均类别广度和跨用户重叠度来表征每种信号类型:

(18)
(19)
媒体内容 · 前往原文查看
表 12:文本标签与 SID 在类别级统计指标上的比较。
指标 文本标签 SID
类别广度 1.40 0.84
跨用户重叠度 11.36% 4.61%

其中 衡量所覆盖的不同类别的平均数量, 衡量随机抽取的用户对 之间类别集合的期望重叠度。结果报告于表 12。在类别广度方面,尽管 。即使将每个标签的 SID 聚合起来,合并后的类别集合仍然比单个文本标签的类别集合更窄。这证实了文本标签具有更广的覆盖范围,涵盖多样化的兴趣领域,而 SID 则更聚焦于特定的类别簇。在跨用户重叠度方面,与 相比 。SID 的重叠度显著较低,反映了其更强的用户特异性,因为协同语义捕捉的是用户特定的信号,而文本标签较高的重叠度则源于其对共享世界知识的依赖。

Refer to caption
图 8:由文本标签和 SID 检索到的物品嵌入的 PCA 可视化。
嵌入空间可视化。

我们进一步考察了通过文本标签与SID检索到的物品多样性。对于每个文本标签及其协同生成的SID,我们采样等量的相关物品,并从预训练检索模型中获取其嵌入向量。如图8所示,我们通过主成分分析将这些嵌入向量投影到二维空间。标签匹配的物品在多个不同区域呈现出更大的空间分散性,而SID匹配的物品则在特定邻域周围形成更紧密的聚类。这种模式在视觉上强化了文本标签基于世界知识的覆盖范围与SID基于协作的专指性之间的对比。

媒体内容 · 前往原文查看
表13:文本标签、SID及混合检索配置下的物品级命中率。
配置 HR@500 HR@1000
标签 0.1503 0.2044
SID 0.1539 0.2144
混合 0.1571 0.2168
Refer to caption
图9:案例研究。记忆中心将用户的原始行为序列压缩为结构化的偏好单元,并根据近期行为对其进行增量更新。基于整理后的记忆,RecGPT-V3仅用10个模型token进行潜在意图推理,按需重建可解释的推理依据,并生成由SID驱动的、基于记忆的羽毛球推荐。
检索互补性。

最后,我们量化了结合两种模态所带来的端到端检索收益。表13报告了在离线测试集上三种配置下的物品级命中率。在HR@500指标上,SID检索达到0.1539,而文本标签检索为0.1503,混合配置进一步提升至0.1571。在HR@1000指标上(0.2168对比0.2144对比0.2044)也呈现出一致的趋势,证实了两种模态的互补性。混合检索模型(§B)联合使用两种模态,结合了文本标签的广泛覆盖与SID的协作精准性。

5.5.2 案例研究

图 9 展示了一个针对匿名淘宝用户的 RecGPT-V3 端到端案例研究。记忆中枢首先将原始行为序列压缩为结构化的偏好单元,例如科技、羽毛球和育儿兴趣。当近期行为到来时,它会选择性地更新相关记忆:定制键盘交互刷新科技单元,与 Astrox 相关的搜索和点击更新羽毛球单元,育儿兴趣向辅食和早教方向演变,稳定的家装偏好得以保留,并创建了一个新的跑步偏好。

基于整理后的记忆,RecGPT-V3 仅使用 10 个潜在 token 进行潜在意图推理。这些潜在 token 在推理过程中取代了冗长的显式思维链,但可以根据需要解码,重建出可读的显式推理过程。在此案例中,重建的推理过程将用户识别为一名打法激进的严肃羽毛球爱好者,并推断出其对全碳素球拍、球线、维护工具及相关羽毛球装备的需求。这些推断出的意图随后被具体化为由 SID 驱动的、基于记忆的推荐。该案例展示了 RecGPT-V3 如何通过不断演进的记忆积累对用户的理解,通过潜在到显式的思维链重建保留可解释的推理能力,并根据推断出的意图生成精准推荐。

6 结论

在本文中,我们提出了 RecGPT-V3,一个基于大语言模型的推荐系统,它解决了工业级规模下基于大语言模型的推荐所面临的三个挑战:无状态行为建模、标签到物品的信息瓶颈,以及低效的显式推理。RecGPT-V3 引入了一个记忆中枢(Memory Hub),用于维护一个结构化、持续演进的用户记忆,以替代一次性全历史编码;一个混合模态基础模型(Hybrid-modal Foundation Model),能够联合对自然语言和语义 ID 进行推理,从而将意图直接锚定在物品空间中;以及潜在意图推理(Latent Intent Reasoning),将显式的思维链压缩为紧凑、可解码的潜在 token。在淘宝“猜你喜欢”信息流中部署后,RecGPT-V3 在大规模在线 A/B 测试中取得了持续提升(IPV 提升 +1.28%,CTR 提升 +1.00%,TC 提升 +1.97%,GMV 提升 +3.97%),同时将端到端服务计算量降低了 52.4%。这些性能提升表明,预测准确率与服务效率可以共同提高,并暗示大语言模型能够充当工业级推荐管线的推理大脑。

\nobibliography

*

参考文献

  • Chen 等人 [2023] J. Chen, H. Dong, X. Wang, F. Feng, M. Wang, and X. He. 推荐系统中的偏差与去偏差:综述与未来方向. ACM Transactions on Information Systems, 41(3):1–39, 2023.
  • Chen 等人 [2026] J. Chen, T. Zhang, M. Lin, D. Huang, T. Shi, H. Fu, M. Li, X. Zhang, C. Zhang, X. Lu, 等. Shopx: 面向智能体购物中意图到物品实现的基础模型. arXiv preprint arXiv:2606.31693, 2026.
  • Fu 等人 [2026] K. Fu, T. Zhang, S. Xiao, Z. Wang, X. Zhang, C. Zhang, Y. Yan, J. Zheng, Y. Li, Z. Chen, 等. FORGE: 在工业数据集中为生成式检索构建语义标识符. 第 32 届 ACM SIGKDD 知识发现与数据挖掘会议, 2026.
  • Gao 等人 [2023] C. Gao, K. Huang, J. Chen, Y. Zhang, B. Li, P. Jiang, S. Wang, Z. Zhang, and X. He. 缓解交互式推荐中离线强化学习的马太效应. 第 46 届国际 ACM SIGIR 信息检索研究与发展会议论文集, 页码 238–248, 2023.
  • Guo 等人 [2025] D. Guo, D. Yang, H. Zhang, J. Song, R. Zhang, R. Xu, Q. Zhu, S. Ma, P. Wang, X. Bi, 等. Deepseek-r1: 通过强化学习激励大语言模型的推理能力. arXiv 预印本 arXiv:2501.12948, 2025.
  • Kang 和 McAuley [2018] W.-C. Kang 和 J. McAuley. 自注意力序列推荐. 载于 2018 年 IEEE 国际数据挖掘会议 (ICDM), 第 197–206 页. IEEE, 2018.
  • Koren 等人 [2009] Y. Koren, R. Bell, 和 C. Volinsky. 推荐系统的矩阵分解技术. 计算机, 42(8):30–37, 2009.
  • Lee 等人 [2022] D. Lee, C. Kim, S. Kim, M. Cho, 和 W.-S. Han. 使用残差量化的自回归图像生成. 2022 年 IEEE/CVF 计算机视觉与模式识别会议 (CVPR), 第 11513–11522 页, 2022.
  • Li 等人 [2023] J. Li, D. Li, S. Savarese, 和 S. Hoi. Blip-2: 使用冻结图像编码器和大语言模型引导语言-图像预训练. 载于国际机器学习大会, 第 19730–19742 页. PMLR, 2023.
  • Li 等人 [2026] Y. Li, Z. Zhang, M. Liang, K. Asadi, J. Xu, J. Kim, C. Bai, J. Zhang, H. Xie, P. Agrawal, 等. GR2 技术报告. arXiv 预印本 arXiv:2606.31984, 2026.
  • Liu 等人 [2024] A. Liu, B. Feng, B. Xue, B. Wang, B. Wu, C. Lu, C. Zhao, C. Deng, C. Zhang, C. Ruan, 等. Deepseek-v3 技术报告. arXiv 预印本 arXiv:2412.19437, 2024.
  • Liu 等人 [2025] Z. Liu, S. Wang, X. Wang, R. Zhang, J. Deng, H. Bao, J. Zhang, W. Li, P. Zheng, X. Wu, 等. Onerec-think: 面向生成式推荐的文本内推理. arXiv 预印本 arXiv:2510.11639, 2025.
  • Nguyen 等人 [2014] T. T. Nguyen, P.-M. Hui, F. M. Harper, L. Terveen, 和 J. A. Konstan. 探索过滤气泡:使用推荐系统对内容多样性的影响. 载于第 23 届万维网国际会议论文集, 第 677–686 页, 2014.
  • Radford 等人 [2021] A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark, 等. 从自然语言监督中学习可迁移的视觉模型. 载于国际机器学习大会, 第 8748–8763 页. PMLR, 2021.
  • Rendle 等人 [2009] S. Rendle, C. Freudenthaler, Z. Gantner, 和 L. Schmidt-Thieme。BPR:基于隐式反馈的贝叶斯个性化排序。载于《第二十五届人工智能不确定性会议论文集》,第 452–461 页,2009 年。
  • Shao 等人 [2024] Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, X. Bi, H. Zhang, M. Zhang, Y. Li, Y. Wu, 等。DeepSeekMath:推动开源语言模型数学推理的极限。arXiv 预印本 arXiv:2402.03300,2024 年。
  • Tang 等人 [2026] J. Tang, S. Dai, T. Shi, J. Xu, X. Chen, W. Chen, J. Wu, 和 Y. Jiang。先思考再推荐:释放序列推荐的潜在推理能力。《IEEE 知识与数据工程汇刊》,2026 年。
  • Team 等人 [2026] O. Team, B. Yang, B. Ding, C. Chu, D. Zang, F. Pan, H. Li, H. Jiang, H. Bao, H. Wang, 等。OneReason 技术报告。arXiv 预印本 arXiv:2606.06260,2026 年。
  • Wang 等人 [2026] H. Wang, H. Lu, Z. Feng, J. Huang, Y. Amir, G. Hinkson, B. Most, Z. Zhao, Y. K. Cui, R. Zhang, 等。基于大语言模型的用户画像用于大规模推荐。arXiv 预印本 arXiv:2606.12198,2026 年。
  • Yang 等人 [2022] A. Yang, J. Pan, J. Lin, R. Men, Y. Zhang, J. Zhou, 和 C. Zhou。Chinese CLIP:中文对比视觉语言预训练。arXiv 预印本 arXiv:2211.01335,2022 年。
  • Yang 等人 [2025] A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Gao, C. Huang, C. Lv, 等。Qwen3 技术报告。arXiv 预印本 arXiv:2505.09388,2025 年。
  • Yi 等人 [2025a] C. Yi, D. Chen, G. Guo, J. Tang, J. Wu, J. Yu, M. Zhang, W. Chen, W. Yang, Y. Luo, 等。RecGPT-v2 技术报告。arXiv 预印本 arXiv:2512.14503,2025a。
  • Yi 等人 [2025b] C. Yi, D. Chen, G. Guo, J. Tang, J. Wu, J. Yu, M. Zhang, S. Dai, W. Chen, W. Yang, 等。RecGPT 技术报告。arXiv 预印本 arXiv:2507.22879,2025b。
  • Zhang 等人 [2026] Y. Zhang, M. Liang, J. Yang, R. Jin, W.-Y. Chen, Y. Han, H. Li, B. Zhang, L. Luo, L. Simon, 等。ReasonRec:一种用于统一推荐的推理增强型多模态智能体。载于《计算语言学协会 ACL 2026 年会发现卷》,第 7960–7980 页,2026 年。
  • 赵等人 [2023] W. X. Zhao, K. Zhou, J. Li, T. Tang, X. Wang, Y. Hou, Y. Min, B. Zhang, J. Zhang, Z. Dong, 等. 大语言模型综述. arXiv 预印本 arXiv:2303.18223, 1(2):1–124, 2023.
  • 周等人 [2025] G. Zhou, H. Bao, J. Huang, J. Deng, J. Zhang, J. She, K. Cai, L. Ren, L. Ren, Q. Luo, 等. Openonerec 技术报告. arXiv 预印本 arXiv:2512.24762, 2025.

附录

附录 A 贡献者

核心贡献者

  • 郑博文

  • 易超

  • 陈典

  • 郭高阳

  • 朱晗

  • 唐嘉凯

  • 吴剑

  • 张茂

  • 陈文

  • 卢逸凡

  • 罗玉洁

  • 蒋宇宁

  • 高竹金

贡献者

  • 郑波

  • 王迪萱

  • 方浩

  • 刘建才

  • 余静

  • 陈珂

  • 朱科伟

  • 徐明可

  • 杨文君

  • 奚迅科

  • 周子乐

作者列表按名字首字母字母顺序排列。

附录 B 意图到物品检索

混合模态基础模型(第 3 节)使多专家模块能够通过两个通道表达用户意图:自然语言标签和语义 ID。两者扮演着不同的角色:标签通过开放的世界知识传达意图(可泛化),而语义 ID 则将意图锚定在由协同信号丰富化的具体物品表示上(具体)。然而,将这些混合信号转化为准确的物品检索,需要一个专门的下游模型,该模型能够 (1) 联合消费这两个通道,以及 (2) 在点击可能性与语义相关性之间取得平衡。早期的 RecGPT 版本通过纯文本路径检索物品,将系统限制在单一通道,未能利用语义 ID 所承载的协同信号。

因此,我们引入了一个混合检索模型,该模型同时接收文本标签和语义 ID 作为输入,并学习候选物品上的偏好排序,优先考虑用户可能点击的物品,同时保持与上游意图预测的语义对齐。本节的剩余部分将介绍其混合输入架构(第 B.1 节)和联合训练目标(第 B.2 节)。

B.1 架构

检索器将文本标签和 SID 作为输入,并为每个候选项分配一个相关性分数。这两个通道扮演着不同的角色:一组文本标签代表语义意图,而一组 SID 则将该意图锚定在物品空间中。每个标签及其配对的 SID 捕捉了同一用户意图的两个方面:前者用自然语言表达“用户想要什么”,而后者则在离散的物品空间中编码“哪些物品满足该需求”。

为了融合这两个通道,我们采用了一种双嵌入架构。每个标签通过文本嵌入层映射为一个稠密向量,每个 SID 则通过 SID 嵌入层独立映射。这两个嵌入向量被拼接起来,并通过一个线性变换进行投影,以生成统一的意图表示:

(20)

其中 表示拼接操作, 是一个可学习的投影矩阵。生成的意图向量在目标注意力机制中充当查询,对候选物品的表示进行注意力计算,以得出它们的检索分数。这种设计在早期层保留了各通道特有的信息,同时通过共享的注意力计算实现了跨通道交互。

双通道设计为检索器提供了纯文本模型无法获取的协同证据。通过第 3.1 节的对比预训练,SID 嵌入空间编码了自然语言无法传达的物品级信号,例如共同购买模式、流行度动态以及物品间的亲和度。这两个通道还覆盖了物品空间的不同区域(第 5.5.1 节),它们共同使检索器能够将语言的语义广度与离散物品表示的协同精确性结合起来。

B.2 训练方案

仅凭点击信号无法为检索器提供充分的监督。由于点击倾向与物品流行度混杂在一起,纯粹以点击为驱动的目标函数往往会偏向全局热门物品,而非那些忠实于条件意图的物品,从而产生可点击但与上游预测的标签和SID不一致的检索结果。这种错位削弱了该流水线旨在保持的意图锚定。因此,我们将检索训练视为一个联合目标,该目标在候选物品上基于明确的偏好层级,协调点击效用与语义相关性。

偏好排序。

我们定义了一个关于候选物品的层级化偏好,该偏好整合了效用和相关性信号:

这种排序将效用(点击可能性)作为首要目标,并在效用相当的物品中,依靠相关性作为区分信号。

联合学习目标。

偏好排序转化为一个联合训练目标,该目标耦合了两个目标:一个控制主要点击信号的效用目标,以及一个相关性目标,后者在效用相当的物品中,通过语义相关性来解析排序。将两者联合优化,可在单一目标内使点击效用与意图锚定对齐。

具体来说,效用损失通过一个基于物品候选集的标准softmax目标函数来优化点击预测:

(21)

其中 表示被点击物品的集合, 是物品 的检索得分。

虽然效用损失将点击物品与其余物品区分开来,但它无法对具有相同点击状态的候选物品进行排序。相关性损失提供了这种缺失的区分能力,通过一个多层级对比公式来强制执行偏好排序:

(22)

其中 表示输入意图 的相关性正样本集,该集合基于逐步放宽的匹配标准构建, 是相应的负样本集。为防止相关性目标与效用信号冲突,我们根据交互深度(已点击 > 已曝光 > 未曝光)为每个候选分配优先级,并将 限制为优先级不高于正样本 的候选。

最终训练目标是效用损失与相关性损失的加权和:

(23)

其中系数 和 用于平衡两个目标(我们在生产实验中设定 和 )。这一联合目标驱使检索器优先选择既具有点击价值、又与上游意图在语义上对齐的产品,从而在端到端优化框架内将点击效用与意图锚定相结合。

附录 C 隐式推理重建

第 4.1 节的三项对齐任务依赖于一个重建提示词,该提示词引导模型解码压缩在隐式 <cot> token 中的自然语言推理。我们使用两种提示词变体,根据待重建的片段数量进行选择:对于单片段和多片段重建(),提示词要求模型解释每个 <cot> token 可能代表的句子;对于完整轨迹重建(),提示词要求模型恢复完整的思维链。每个重建样本将提示词置于系统轮次中。用户轮次则包含原始推荐上下文(专家角色、用户画像和点击历史),随后是 <think> 块,其中隐式 token 替换了被掩码的推理片段,以及模型的最终输出。基于此输入,重建模型用自然语言解释每个被掩码的 <cot> token。下面我们为每项任务展示一个具有代表性的生产案例。用户位置等可识别个人身份的细节已被隐去,并以空白条()显示。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org