首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GPT-6 阿斯特拉

摘要

【HN用户评论摘要】 Related: OpenAI begins rolling out GPT-6 Astra - https://news.ycombinator.com/item?id=49554273How about we stick to that one for talking about the rollout, and this one for talking about th...

the GPT for and about they that this would score
2026-09-04 1 阅读 约3分钟阅读 kibae
分享:
字号:
【HN用户评论摘要】 相关:OpenAI 开始推出 GPT-6 Astra - https://news.ycombinator.com/item?id=49554273 我们坚持用那个来谈论推出,用这个来谈论模型怎么样? ARC-AGI-3 记分卡具有极大的误导性,因为它明确表示“通过[响应 API] 工具,我们估计 Sol 的得分约为 30%。”但它显示 GPT-5.6 Sol 的分数为 7.8%,大概是因为如果他们将 GPT-5.6 Sol 的百分比更新为通过用于 GPT-6 Astra 的响应 API 工具收到的分数,他们必须对 Opus 5 显示的百分比做同样的事情,这同样会高得多。无论如何,结果 我想退一步:所以,这就是 GPT-6——与过去几年的 GPT-4 和 GPT-5 相媲美的自然数版本版本。 ARC-AGI-3 的分数显然令人印象深刻,达到 99.9%(我们需要等待更多关于他们如何在 GPT-6 Astra 上使用响应 API 工具的详细信息,关于推理保留和压缩),但与 AI 实验室的任何“点”更新相比,其他所有基准测试似乎都是相对适度的改进。如果这真的是 AGI(取决于某人的定义) 我不禁注意到这与弗朗索瓦·乔莱(Francois Chollet)的《论智力的衡量》有多大的呼应:https://arxiv.org/abs/1911.01547大多数前沿模型进展看起来仍然像是技能获取优化:更广泛的基准覆盖范围和性能,更多的领域被吸收到训练分布中,以及在该表面区域内日益强大的性能。这似乎更多是关于覆盖范围驱动的能力。有点类似于规模上的过度拟合。在 Chollet 的框架中,更难的问题 我对实际模型没什么可说的,但无关——为什么这么多的演示包括人们自主购买东西?即使我确实相信人工智能能把一切做好,人工智能也不可能读懂我的想法。如果我在没有人工智能的情况下正常点餐,我会想要对这个过程有更多的控制——查看选项、价格,思考我真正想要的东西。人们不知道自己真正想要什么,直到他们稍微思考一下,那么为什么人工智能公司让它看起来像 原始链接:https://openai.com/index/gpt-6-astra/
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱