首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

600万奖池尘埃落定,有人靠DeepSeek网页版拿下冠军

2026-08-19 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|张倩 最近,你有没有刷到一篇题为《 我用 DeepSeek 网页版拿下 KDD Cup 冠军! 》的帖子? 这个帖子的作者是 Kaggle 全球排名第一的「无敌叉烧包」同学。最近,他和在国内算法竞赛中累计获得 15 次冠军的队友一起,拿下了 TAAC × KDD Cup 2026 大赛的工业赛道冠军,奖金 15 万美元。 工业赛道冠军团队「日之光面」。 这个比赛我们之前也介绍过,是 腾讯广告算法大赛(TAAC)与 KDD 联动的一场比赛 (参见: 「龙虾」爆火,token成「硬通货」后,这场AI比赛变得更重要了 ), 奖金池高达 88.5 万美元(约合 600 万元人民币) 。学术赛道冠军奖金比工业赛道还高,达到了 30 万美元。这样的赛事级别和奖池规模在国内非常少见。 大赛的报名人数也创了新高 —— 吸引了来自 52 个国家和地区的 13913 名选手,组成 5746 支队伍,覆盖全球 907 所院校,可见赛事竞争有多激烈。 上周,大赛在韩国济州岛(KDD 大会举办地)落下帷幕, 学术赛道、工业赛道两大 TOP ,以及 两项原创突破奖 ,现场一次性揭晓。 学术赛道冠军团队 lozyyeah。 正如「无敌叉烧包」同学写的那样,这届比赛有个很有意思的变化:选手们几乎都是「AI Native」的,大模型、生成式工具天然就是他们日常工作流的基础 —— 遇到不会的地方,跟 AI 学;结果提不上去,让 AI 出主意;代码写得慢,用 vibe coding…… 「无敌叉烧包」和队友组成的「日之光面」团队更有意思,直接给国产大模型来了个「压力测试」:没有调用任何 API,没有在 GPT 和 Claude 之间切换,全程只用一个 DeepSeek 网页对话框,就跑出了「冠军工作流」,全网直呼「爽文」,帖子也被大量转发。 「日之光面」团队使用 DeepSeek 网页版打比赛的大致流程。 不过,大家也提到,其实工具便利是一方面,更重要的还是「 研究思路 」,这也是选手们在比赛中拉开距离的关键。 好在,大赛收官的 workshop 上,获奖选手们把各自的方案完整讲了一遍。听下来最直观的感受是:这道价值 600 万的赛题,确实被「压榨」出了不少真东西,几乎每个获奖方案都有自己的原创突破。这些方案,甚至有可能让广告之外的 LLM 研究也从中受益,因此值得逐个细看。 不过在此之前,我们得先回到起点:这到底是一道什么样的题? 这道题的难点, 藏在「统一」两个字里 今年赛题的官方题目叫「 面向大规模推荐的序列建模与特征交互的统一 」。听着很绕,其实说到底就一件事:用一种统一的建模方法,预测一个用户看到某条广告之后,会不会真的迈出下一步,比如点击、购买、注册,或者下载。行业给这个概率起了个名字叫 CVR,但说白了,它预测的是人的行为,所以要对人有充分的理解。 这个预测怎么进行呢?主要靠 两类数据 :一类是用户行为序列,像一条不断滚动的时间轴,比如一个用户早上刷朋友圈、中午看新闻、下午在小程序点咖啡、回家路上追剧;另一类是非序列的多域特征,比如用户的「人设」、广告所属的类目,还有一些上下文信号和交叉特征。 当然,出于公平和隐私,这些数据都做了脱敏处理,不放任何原始文本、图片、URL 或可识别个人信息。 所以选手不是在「理解内容」,而是在一堆匿名 ID 和向量里,把「人」和「货」在同一个表示空间里对上号。 注意,真正的难点其实体现在「 统一 」这两个字上。 过去,这种预测任务是分开进行的:一个模型处理非序列特征(比如看用户是什么样的人),一个模型处理行为序列(比如看用户最近干了什么),最后再把两边的判断拼起来。这种「各算各的、最后再汇总」的方式,不仅会带来重复的计算和更高的系统复杂度,也很难充分捕捉序列行为与多域特征之间细粒度的交互关系。 而今年赛题要的「统一建模」,就是要找到一种新的模型结构,让不同形态、不同时间维度的信息在同一个模型里真正发生交互。 这就像发明一台「超级混动车」,让汽油和电在系统底层就融合成一种统一的能量表征,再高效输出动力。 但真要把这台「超级混动车」造出来并不容易。官方说得很直白:绝不是把所有特征「强行塞进」一个网络就算统一。它要你把非时序的多字段、上下文特征,和带严格时间戳、跨多个行为域的行为流,在同一个架构里深度融合。拍平了会丢掉字段身份和时间关系,全做精细交互又会让算力爆炸。此外,这套统一模块还得在海量、极度稀疏、基数庞大的工业特征面前保持鲁棒。 更苛刻的是鱼与熊掌必须兼得:准确率要上去,还要支持深层堆叠,并在高性能 GPU 上实现大 Batch 的高效训练与推理。而为了逼大家拼模型设计的真本事,比赛全程严禁模型融合(No Ensembling),靠集成刷榜的套路直接作废。说白了,这台车既要爬坡有力,又要省油,还得一口气跑完长途。 这台「车」造出来有什么价值呢?被请到现场发言的 Meta 推荐系统专家 Rui Li 把账算得很清楚, 一笔是技术账,一笔是经济账 。 技术账的核心问题是:Agent 能替你写代码、订机票、回邮件,但你会让 Agent 替你刷视频、替你刷朋友圈、替你和朋友聊天吗?大概率不会。因为「消费内容、打发时间、维系关系」这些事没法外包,而推荐恰恰长在这些事的入口上。所以哪怕 AI 再往前走,推荐也不会被吃掉。 更关键的是,推荐是一个没有标准答案的问题,信号噪声又极大。所以改进推荐系统更像是一场压力测试,Rui Li 自己都承认「魔鬼都在细节里」。这样一场压力测试对于选手的成长相当有利。 此外,正因为推荐在这种噪声里泡了十几年,才练出一套「从噪声行为数据里把人读出来」的本事。而这套本事,很可能正是今天 LLM 做个性化最缺的那一课 —— 大模型会解题,但还不太会读人,而推荐系统十几年就干了一件事,在嘈杂的行为里读人,这种能力的影响边界可能被低估了。 经济账则更直接。在广告这种场景里,0.1% 的提升就意味着数十亿美元,0.01% 都不是小钱 —— 按 Rui Li 的说法,这比今年发出的奖金多得多。这也是为什么相关人才值钱。 这些价值,都是大赛的吸引力所在。 冠军方案: 怎么把效果做到极致? 题读完了,该看解法了。首先来看两个冠军团队的方案,他们解决的是统一建模之后,两个最紧迫的实操问题。这让他们把效果做到了极致。 工业赛道冠军:怎么生成更好的 Query? 工业赛道冠军「日之光面」团队抓住的,是推荐系统里一个很容易被忽略的问题: Query 质量 。 我们可以把历史行为看作一个信息库,Query 就是模型递进去的检索请求。请求模糊,再长的序列也难转化为有效信号。 官方 Baseline 虽然使用 Cross-Attention 读取用户行为序列,但 Query 主要由简单 MLP 生成,用户、广告和上下文之间缺少充分交互。 于是, 团队把优化重点从「塞入更多历史」转向了「生成更好的 Query」,并由此提出 QueryFormer :先让用户、广告和其他非序列特征充分交互,形成质量更高的 Query,再用它从行为序列中寻找与当前广告最相关的信息。 具体来说,QueryFormer 先按字段边界拆分不同来源的 Dense Embedding,分别生成 Token;随后通过
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱