首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

重新创建《我的世界》并不是一个基准

2026-09-07 1 阅读 约3分钟阅读 kuberwastaken
分享:
字号:
GPT Astra 几天前发布,不可避免地,在一小时内我的整个提要都是相同的五件事:在一个提示中重新创建 Minecraft,在 MS Paint 中绘制自己,作为 SVG 骑自行车的鹈鹕,一个在具有可信重力的旋转盒子中弹跳的球,以及一个 SVG 游戏控制器。从纸面上看,这些看起来像是模型需要解决的更难、更直观的问题,它们这么大是有原因的。我开始称它们为演示基准,足够直观且易于理解,每个人都可以了解,但又有限,足以让下一个模型“完美”。这就是问题所在,这些测试无法告诉您模型有多好,因为对于实验室来说,在下一个版本之前针对这些测试进行优化是微不足道的。这也不是他们的错,老实说,如果他们不这样做,我会说这是愚蠢的——没有什么比鹈鹕或 3D 游戏控制器更能卖得开,时间线不停地引用。一个固定的、著名的目标和八周的跑道是一只已解决的鹈鹕,这些测试永远不会改变,任何永远不会改变的东西都可能会过拟合。每个发射周期都再次证明了这一点。你可以按计划完善的测试衡量准备而不是能力,对我来说,这与基准的定义相反,它应该是一个艰难的测试,很难完美的东西。公开评估中也存在同样的动态,在实践中感觉更愚蠢的较小模型仍然比人工分析等网站上的更好模型表现更好。这并非假设,Thinking Machines 的 Inkling Small 在人工智能分析智能指数上的得分比其旗舰产品低了一分,参数不到三分之一,并且在 Humanity 的 Last Exam、GPQA Diamond 和 SciCode 上击败了它。公开的、静态的、著名的测试集会渗透到训练数据和微调选择中。发布是第一印象,而第一印象就是营销,这就是为什么你总是会感到震惊——震惊是预定的。那么还有什么选择呢?老实说,我不确定,因为如果你仔细想想,明显的修复方法已经存在了。 LiveBench 会轮换问题,ARC-AGI 会保留一套私人问题,Humanity 的最后考试会保留一部分问题。被测试方不知道正在测试什么的测试:您无法教授尚未编写的测试。但如果坚持评估是答案,那么为什么鹈鹕仍然获胜呢?答案是因为大多数社交媒体不需要理解研究论文就能注意到自行车终于有了踏板或者是动画的。演示基准测试可以在几秒钟内清楚地说明为什么它具有更好的功能。所以不,除了一个好的演示之外没有其他选择。但是,除了演示基准之外,还有更好的替代方案来了解模型的实际效果。如果一个模型得分很好,但在你的工作中却一直失败,那么这实际上是一个值得调查的差距。演示基准可以创造出很棒的内容。我只是希望我们不再和他们一起评分。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱