ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

淘宝推荐系统升级“智能中枢”:AI精准感知意图,GMV提升超一成

时间:2026-09-04 23:27:13来源:互联网编辑:快讯

当你打开淘宝首页,面对琳琅满目的商品推荐时,或许很少思考这些推荐背后的逻辑。实际上,传统推荐系统如同一条分工明确的流水线:系统先从海量商品中筛选出数千个可能吸引你的商品(召回环节),再通过模型对这些商品进行打分排序(排序环节),最后将广告与自然内容穿插排列(重排环节)。这套运行十余年的流程效率极高,却存在一个致命缺陷——各环节各自为战,缺乏全局协调。

召回模块无法感知排序模块的优化目标,排序模块也不了解重排环节的调整策略。更关键的是,系统难以捕捉用户实时变化的购物意图:你是随意浏览、对比品牌,还是即将下单,这些动态需求如同“黑箱”。这种信息断层导致推荐系统如同一家部门割裂的餐厅——点菜员记录了“清淡口味”的要求,但厨师根本看不到备注,最终仍按标准菜谱重油重盐烹饪。

阿里巴巴提出的DREAM架构(Developing Recommender Engine with Agentic Methods)试图破解这一难题。该方案并未推翻现有流水线,而是通过添加“智能管理层”实现全局协调。其核心在于引入AI Agent技术,构建一个能感知用户实时意图、统一指挥各环节的“中枢大脑”。论文将这种设计称为“agentic meta-control”,即通过更聪明的决策层弥合部门间的信息鸿沟。

传统推荐系统的四大顽疾在论文中被明确指出:信息碎片化(上下游模块数据隔离)、目标割裂(点击率、转化率等指标各自优化)、策略僵化(过度依赖人工规则)以及实时意图感知缺失。其中,用户状态动态迁移的捕捉尤为困难。例如,用户从随意浏览到对比品牌再到决定购买的“session级意图迁移”,往往因系统反应滞后而错失推荐时机。

尽管大语言模型(LLM)在推荐Agent领域已有探索,但现有方案普遍存在意图感知与策略生成的脱节问题。DREAM的创新在于构建了“意图引擎-元引擎-奖励双循环”的三层架构,重点解决实时意图理解与全局策略协调的矛盾。其核心突破体现在对用户意图的分层拆解与动态更新。

意图引擎将用户行为转化为结构化数据,通过L0(物理层)、L1(需求层)、L2(偏好层)三层模型实现精准刻画。L0记录年龄、职业等长期稳定属性;L1捕捉当前搜索品类、使用场景等中期需求;L2则解析品牌倾向、价格敏感度、决策阶段等短期偏好。例如,某用户可能同时存在“竞品选择运动鞋”与“灵感探索棒球帽”的双重意图,系统通过分层标签实现并行管理,避免将临时兴趣误判为长期偏好。

面对淘宝平台每秒产生的海量行为数据,系统采用“流量漏斗”机制实现高效处理。该机制通过设备端与云端的协同,将原始行为数据经历信号编码、触发判断、打包上传、云端筛选四层过滤,最终仅8.7%的高价值信号触发大模型推理。这种设计既避免了云端算力过载,又防止关键意图信号丢失,如同智能安检系统在效率与安全间找到平衡点。

夜间“做梦机制”则通过离线复盘解决实时处理的局限性。系统利用用户活跃度降低的时段,调用4B参数的大模型对全天行为轨迹进行全局梳理,通过保留、纠正、补全等六种操作优化意图列表。测试数据显示,该机制使意图类型判断准确率提升9.7个百分点,细分品类判断准确率提升4.6个百分点,有效弥补了实时处理的视野缺陷。

元引擎作为决策核心,采用“分层推理”模式将策略生成拆解为三步:M1层浓缩战略方向(如优先提升点击率或促成交易),M2层规划具体策略组合(调整排序权重、设置类目偏好等),M3层将策略转化为可执行参数。这种设计将复杂推理与实时执行分离,确保决策质量与响应速度的平衡。同时,系统通过“默认兜底+个性化覆盖”机制保障安全性,任何异常策略都会自动回退至默认配置。

在强化学习训练方面,DREAM采用“生产环境路径重放”技术,通过对比默认配置与策略组的离线模拟结果进行优化。其“二元评估奖励”机制以简单稳健著称——仅根据策略组是否优于基线组发放奖励,避免复杂奖励函数带来的噪声干扰。测试显示,该机制使策略有效性提升近18个百分点,执行成功率显著提高。

线上A/B测试验证了架构的实际价值。在淘宝首页“猜你喜欢”场景中,仅控制重排环节时,商品详情页访问量提升2.06%,成交总额增长0.88%;扩展至精排环节后,访问量提升2.71%,成交总额增长1.31%,且页面曝光量保持稳定增长。值得注意的是,指标提升主要源于推荐精准度的提高,而非单纯增加曝光量,这表明系统真正理解了用户需求。

该架构的克制性设计令人印象深刻。研究团队选择在现有流水线上叠加可控策略层,而非激进重构整个系统,这种工业级思维体现了对复杂性的深刻理解。同时,“做梦机制”与二元奖励函数的设计,展现了资源利用与系统稳健性的平衡艺术——在需要沉淀的地方慢下来,在追求效率的地方快起来,用最简单的信号实现最可靠的控制。

更多热门内容
OpenAI发布GPT-6 Astra:数学推理与自动化能力跃升,AGI进程再提速
尤其是ARC-AGI-3测试,这套测试是衡量模型在陌生环境中的抽象推理和学习能力,被视为接近通用智能的核心指标,Astra在此项测试中拿到99.9%的接近满分成绩,而GPT-5.6Sol仅为7.8%,短短一代…

2026-09-04

OpenAI发布GPT-6 Astra,在多领域能力突破被指成AGI发展关键转折
据彭博社报道,OpenAI于周四正式推出新一代旗舰AI大模型GPT-6 Astra,官方称该模型在计算机操作、软件工程、科学研究及各类专业工作场景下均实现重大能力突破,是公司多年技术积累与持续高投入的集中落地…

2026-09-04

OpenAI发布GPT-6 Astra:数学推理与自动化能力跃升,AGI竞争再升级
尤其是ARC-AGI-3测试,这套测试是衡量模型在陌生环境中的抽象推理和学习能力,被视为接近通用智能的核心指标,Astra在此项测试中拿到99.9%的接近满分成绩,而GPT-5.6Sol仅为7.8%,短短一代…

2026-09-04

OpenAI新模型GPT-6 Astra发布:数学推理与计算机操作能力实现代际跃升
尤其是ARC-AGI-3测试,这套测试是衡量模型在陌生环境中的抽象推理和学习能力,被视为接近通用智能的核心指标,Astra在此项测试中拿到99.9%的接近满分成绩,而GPT-5.6Sol仅为7.8%,短短一代…

2026-09-04

GPT-6 Astra登场:智能水平跃升,多领域突破引领AGI时代新篇章
在OSWorld 2.0测试中,Astra得分72.6%,GPT-5.6Sol为65.7%;在延迟模拟环境下,Astra完成一项任务平均约需40分钟,而GPT-5.6 Sol约需75分钟,OpenAI据此…

2026-09-04