数码硬件
morning
谷歌、Meta被揭露AI跑分作弊 华裔高管回应:OpenAI也一样
2026-09-08
1 阅读
约3分钟阅读
宪瑞
字号:
快科技9月8日消息,谷歌、Meta这两年在AI大模型竞争中一度落伍,跟Anthropic及OpenAI差距拉大,但最新的Gemini 3.8 Flash及Muse Spark 1.3杀回来了,在AA榜单上一度超越OA两家旗舰大模型。 Flash模型的性能也不是说完全不可能超越别人家5万亿甚至10万亿参数量的旗舰大模型,但Gemini及Spark的表现还是让人意外, 知名分析机构SemiAnalysis日前发文分析了这两家的大模型性能,认为他们存在过拟合,直白点来说就是针对榜单评测做了刷分。 了解过AI圈的网友应该很清楚,AI榜单刷分其实都不算是啥新闻了,只不过以前国产大模型被指责的多,现在矛头指向了谷歌和Meta罢了。 对于跑分作弊的指责,没看到谷歌Gemini那边的回应,但Meta这边的AI业务主管Alexandr Wang先坐不住了,他是Scale AI数据标注业务的创始人,被Meta重金收购之后成为Meta AI业务的实际当家人,Spark等大模型就是他领导下做出来的,当然不会接受被人说是刷分作弊才能拿到高分的。 他的回应也很有意思, 说SemiAnalysis指控他们刷分作弊的论点是愚蠢的,因为OpenAI也是这样, GPT-5.6 Sol大模型在难度较低的TerminalBench 2.1跑分是88.8%,但在难度更高的TerminalBench 4.0中也也只有37.3%。 他的这个反击还是很巧妙的,因为SemiAnalysis指控谷歌及Meta靠作弊刷高分的证据就是TB 2.1这样的评测中得了高分,新出的TB 4.0评测基准中跑分就不行,而Wang的反击就是OpenAI的旗舰大模型也是一样的结果,TB 4.0中跑分也同样会大幅降低。 Wang表示这是因为TB 4.0是一个难度更高的评测,而且没有饱和, TB 2.1的评测已经是饱和了。 简单来说,Wang很巧妙地反击了SemiAnalysis对刷分的质疑,强调不同难度下的基准测试分数都不一样,不光是他们这样,OpenAI也一样,这是测试项目的问题,因为之前的测试难度低了,就像是考试一样,学霸、学渣都可以从简单的考试获得高分数,不能因此就认为学渣是靠作弊实现的高分。 最后Wang还不忘给自家的大模型做广告,强调Spark 1.3当然不可能像Astra或者Fable5.1那么强大,但性价比高得多,而且他们未来的大模型会更直接地与Astra或者Fabel5.1竞争。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱