智能AI
morning
300万全归中国学生!冠军全靠DeepSeek、ChatGPT
摘要
新智元报道 韩国济州岛,KDD 2026现场。 当最终榜单打在大屏上时,这场从今年春天延烧至今的算法马拉松,终于有了结局。 拿下冠军的,一共有两个战队—— · 学术赛道冠军「lozyyeah」,独享200万元(30万美金) · 工业赛道冠军「日之光面」(sunshot),斩获100万元(15万美金) 整场比赛,总奖金池超88.5万美元,折合人民币约600万。 光学术赛道冠军一项就独揽30万美元,创...
KDD
lozyyeah
sunshot
值得一提的是
Cup
新智元报道
韩国济州岛
2026现场
当最终榜单打在大屏上时
这场从今年春天延烧至今的算法马拉松
2026-08-20
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 韩国济州岛,KDD 2026现场。 当最终榜单打在大屏上时,这场从今年春天延烧至今的算法马拉松,终于有了结局。 拿下冠军的,一共有两个战队—— · 学术赛道冠军「lozyyeah」,独享200万元(30万美金) · 工业赛道冠军「日之光面」(sunshot),斩获100万元(15万美金) 整场比赛,总奖金池超88.5万美元,折合人民币约600万。 光学术赛道冠军一项就独揽30万美元,创下国内企业技术竞赛最高单项奖金纪录。 图左:学术赛道冠军lozyyeah;图右:工业赛道冠军日之光面 值得一提的是,让这场巅峰对决载入史册的,并不只有奖金。 KDD Cup的中国时刻 KDD Cup,是公认的「数据挖掘领域的奥赛」。 自1997年ACM SIGKDD设赛至今,Google、Microsoft、Meta都出过题。 能在这里跻身前列,便是实力的绝对背书。 中国企业主导KDD Cup赛题并非首次,2012年腾讯自己就做过。 8月12日,济州ICC会议中心。腾讯广告算法大赛(TAAC),再次以KDD Cup官方主赛道身份揭晓最终结果。 52个国家和地区,近14000名选手,5700多支队伍,907所全球高校集结,学术界与工业界参赛者比例约7:3。 从2017年创办,TAAC今年已是第七届。 从一个国内行业赛事,一步迈上KDD Cup的舞台。腾讯全权主导整条赛道,出题,提供真实业务数据,设计赛制。 奖金金额、算力规模、参赛人数,多项纪录同时刷新。 但规模之上,真正的突破在「数据」。 腾讯拿出来的是,营销体系每天服务数十亿用户的真实脱敏数据,100多个特征字段,远超学术界任何一个公开benchmark的量级。 推荐系统的公开数据集太少、太小、太旧,这几乎是全行业的痛。 大语言模型能跑通Scaling Law靠的就是海量benchmark,推荐系统一直缺这个条件。 全球大广告商里从来没有人这么做过。KDD Cup 29年历史上,这是第一次。 把撕开的「推荐系统」,缝回去 真正决定这场比赛难度的,是赛题本身—— 面向大规模推荐的序列建模与特征交互统一化。 听着很学术,但它指向的,是工业界躺了很多年、谁都知道、谁都没彻底解决的老问题。 本届赛事第一次把这个问题原封不动地交给全球:设计一个统一的、单一同构的Recommendation Block,同时优化AUC,并探索推荐系统的Scaling Law。 学术冠军:给推荐模型装个「GPS」 抱走200万大奖的战队「lozyyeah」,队长是罗同学,博士二年级。 两位队友都是同一个实验室的师弟师妹:张同学,刚要升大三的本科生;顾同学,刚加入实验室的研一新生。 一个实验室,三个人。 lozyyeah战队三位成员 采访时,罗同学讲起自己为什么开始打比赛,答案很实在: 读研第一年赶上疫情,要定研究方向,但对很多方向都不够了解。 我当时在想,能不能通过一种目标导向、问题驱动的方式,让自己尽快进入科研状态。 打比赛似乎是一个很好的方法:它可以提供来自业界的真实课题,大家在有限时间内完成一个完整的问题解决流程。 这句话,几乎就是TAAC这类赛事存在价值的最好注脚。 他们的团队,给出的方案叫CRAFT,核心创新是feature transport(特征传输)。 大家都在做feature interaction(特征交互),即让不同特征之间发生信息交互。但罗子宸团队发现:只有交互,还不够。 问题出在层与层之间,多个block纵向堆叠,有效信息逐层衰减,传到中间就坍缩了。 这一次实验成果的灵感,来自他正在做的flow matching研究。 Flow matching会生成一个速度向量,为当前状态指出方向。 罗同学把这个思路迁移到推荐模型里,给每一层生成一个「意图向量」,引导信息沿正确方向传递。 加入意图向量之后,特征信息在整个流程结束前都保持着丰富度,直到最终输出才收敛为预测结果。 值得一提的是,罗同学坦言,此次比赛离不开一位特殊的「AI伙伴」——ChatGPT。 它不仅是随时碰撞灵感的兼职导师,更是辅助落地想法的得力助手,陪伴团队在反复打磨中一起成长。 当被主持人问及拿到奖金后的计划时,他表示,「压力太大了,比赛加科研一直在熬夜。等忙完,一定要拿着奖金出去好好休息」。 工业冠军:与其读更多,不如问得更准 战队日之光面(sunshot),一举斩获了本次KDD Cup工业赛道的冠军。 其中一位成员是目前Kaggle竞赛社区(>2000w用户)比赛积分榜的全球第一名,另一位曾拿过国内算法竞赛15次冠军,且斩获了2021年腾讯算法大赛的第一名。 他们提出的方案,叫QueryFormer。 先让用户、广告和非序列特征充分交互,形成质量更高的Query,再用这些Query从多域行为序列中,提取与当前广告最相关的信息。 如果问题问得不好,那么信息库再大、行为序列再长,也取不出真正有用的东西。 「日之光面」的判断因此非常反直觉:别急着把序列拉长,先把问题问好。 围绕这个判断,QueryFormer具体做了五步优化。按字段边界拆分非序列特征、用DCN-V2分组处理,让用户侧与广告侧Token先自注意力再交叉,再带着这个「问好的问题」去4个业务域的序列里做检索。 最关键的一刀,是用Cross-Attention彻底替换掉原本的MLP Query生成方式。 最终,QueryFormer以测试集AUC 0.83254拿下工业赛道冠军。 但真正让人愣住的,是他们的工具清单。 整个建模、代码开发、实验迭代过程,只用了DeepSeek网页版。 技术论文的主体同样由DeepSeek辅助完成,GPT只在最终提交前做了一轮语言润色,随后人工审核。 整个建模与开发过程,没有用GPT、Claude写过一行代码。 两条赛道,两个冠军,一个解的是「信息在层与层之间怎么不丢失」,一个解的是「进入序列之前怎么把问题问准」。 但殊途同归,两支队伍都没靠堆参数、堆序列取胜,而是回到结构本身找答案。 这恰恰是这道赛题最想看到的东西。 原创突破奖:本科生与外行新手 Scaling Law原创突破奖(Scaling Law Innovation Award)颁给了gg团队,两个大四本科生,王同学和郭同学。 他们是TAAC中为数不多的纯本科生队伍,第一次参加这类比赛。 到了比赛后期,大家都撞上了同一个难题:直接把模型做宽,AUC不升反降,不少选手因此判断这条路走不通。 他们没放弃,初赛加复赛,做了400-500次实验。 显卡一刻不能空着,训练跑着的时候读论文,读完复盘上一版,复盘完了想下一版思路,然后接着写代码。 最后找到了,在同时增大模型容量和条件信息的前提下再增加维度,可以实现scaling的提升。 如果要给这段经历再颁一个非技术奖项,王同学的答案很简单:「实验最多奖」。 Scaling Law原创突破奖gg团队 统一架构原创突破奖(Unified Block Innovation Award),更像新手村逆袭,颁给了T-Squared。 韩同学和朱同学一个学控制科学,一个学生物医学。夏同学搞生成式设计。 三个人的专业没有一个跟搜广推沾边,此前也没有任何相关比赛经验。 两个本科舍友加一个初中同学,「我们没有经验,也不好让
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱