首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Claude两个新模型实测流出!空间推理封神,算力直接榨干了

摘要

新智元报道 昨天刚刚曝出的Claude 两款新模型——棉花糖和甜瓜,今天已有实测出现了! 有人实测后发现,两款新模型在3D强化学习和建筑空间布局上,性能强到可怕。 另外,它们对算力的吞噬也十分疯狂。 在给出答案前,它们会消耗海量的「思考token」(Thinking Tokens)进行深度逻辑推理,甚至屡次逼近系统的使用上限! 从这款模型看,Claude正在进化为具备「慢思考」、深度空间物理推理能...

Opus 棉花糖 claude eap 思考token Claude API Anthropic One Shot
2026-08-25 1 阅读 约8分钟阅读 新智元
分享:
字号:
新智元报道 昨天刚刚曝出的Claude 两款新模型——棉花糖和甜瓜,今天已有实测出现了! 有人实测后发现,两款新模型在3D强化学习和建筑空间布局上,性能强到可怕。 另外,它们对算力的吞噬也十分疯狂。 在给出答案前,它们会消耗海量的「思考token」(Thinking Tokens)进行深度逻辑推理,甚至屡次逼近系统的使用上限! 从这款模型看,Claude正在进化为具备「慢思考」、深度空间物理推理能力的下一代 AI 巨兽。 One-Shot 拿下3D强化学习与建筑布局 有人实测后给出评价:Anthropic真的在疯狂推进3D强化学习。 建筑物的空间布局简直好得令人发指,而且这一切都是一步到位(One-Shot)生成的! 要知道,对于LLM,空间想象力一直是个死穴。 让AI理解一个 3D 房间中桌椅的物理坐标关系、重力法则,或者规划一个拥有复杂动线和承重结构的建筑群布局,简直难如登天。 但这次,Claude 的「棉花糖」和「甜瓜」似乎跨越了这道鸿沟。 它们能够直接理解并生成复杂的3D坐标和空间关系。 而且,实测中发现它们的建筑布局极其优秀,表示新模型在处理拓扑学、几何学和物理约束时性能也很强大。 并且,它们是One-Shot输出,不需要人类反复调整prompt去修正错误,模型经过深度的内部思考后,一次性就能输出完美的3D场景数据。 这背后隐藏着巨大的商业和产业价值。 想象一下,未来的游戏开发者只需要用自然语言描述:「帮我生成一个中世纪风格的要塞,包含三个防御塔和一个隐藏的地下通道」,Claude就能直接输出完美的3D模型代码或布局参数。 建筑师可以直接让AI根据地形和光照条件生成几十种符合力学结构的初步布局方案。元宇宙、工业数字孪生、自动驾驶仿真环境的构建…… 这一切,都将因为这种强大的 3D 生成能力而被彻底重塑! 棉花糖与甜瓜的双重暴击 昨天,全网都被棉花糖和西瓜刷屏了。 这次曝光的两款模型内部代号分别为 claude-marshmallow-eap (棉花糖) 和 claude-melon-eap (甜瓜) 。 这种「食物+EAP」的命名规则,延续了他们在今年7月短暂测试过的 claude-horchata-eap(欧恰塔,一种墨西哥饮料)的传统。 这两款模型到底是从哪里冒出来的? 据开发者从 API 流量记录中截获的数据显示,在8月21日的 00:45-00:57Z 期间,claude-marshmallow-ht-eap 的 ID 在 API 流量中被高频调用了 57 次! 随后,它在 Claude Code 的模型列表中以「Custom model」的身份赫然出现,并达到惊人的100万 Token 超长上下文窗口。 虽然目前这两款模型还没有第一方 API 端点,似乎仅限于红队测试人员或内部核心人员使用,但早期的零星测试反馈已经足够炸裂。 「棉花糖」 的综合能力被认为略强于「甜瓜」。 在日常对话和逻辑交互中,「棉花糖」的体验甚至比目前的 Opus 5 还要好,对话显得更加自然、宜人。 尽管它们目前的表现似乎还在 Anthropic 顶级的「Fable」级别之下,但它们到底是传说中的 Opus 5.1?Sonnet 5.1?还是全新的 Haiku 迭代? 现在还没有定论。 算力吞噬者:疯狂的「思考token」 不仅如此,多位测试者都发现了一个极其反常的现象:这两个新模型在使用时,对算力的消耗达到了极其疯狂的地步! 一位测试者在推文中惊呼:「我注意到这两个模型的一个共同点,它们使用了海量的思考token,以至于我在测试时,多次直接触发了 (最大token数)的上限!」 什么是「思考token」?为什么它如此重要? 在过去的大模型交互中,AI 往往像是一个「快言快语」的应答者,根据概率分布,逐字逐句地瞬间生成答案。 而Claude 的新一代模型,彻底改变了这一逻辑。在最终给出答案之前,模型会在后台生成大量的「隐形」Token,用来进行极其深度的自我推演、思维链构建和逻辑试错。 这种「不计成本」的计算力倾注,释放出了一个极其强烈的信号: Anthropic 正在暗中攻克 AI 深度推理的瓶颈! 这也印证了此前行业内的猜测——大模型的竞争正在从「训练阶段的算力堆叠)」向「推理阶段的算力消耗」转移。 当 Claude 开始疯狂「思考」到触碰上限时,它所输出的答案质量,将形成对传统模型的降维打击。 疑似紧急救火?Opus 5 的「复仇之战」 这两款神秘模型的突然泄露,时机也很微妙。 仅仅在不到一个月前的 2026 年 7 月 24 日,Anthropic 刚刚发布了万众瞩目的旗舰模型 Opus 5。 在此之前,6月30日发布的 Sonnet 5 曾广受好评。 然而,Opus 5却惨遭滑铁卢。 有开发者在X上无情嘲笑:「Opus 5 的负面评价实在太严重了,以至于 Anthropic 不得不立刻推出两个新模型来试图取代它……笑死我了。」 确实,Opus 5 似乎没能满足用户对「跨代际提升」的期待。对于急于上市Anthropic 来说,这无疑是一次重大打击。 因此,「棉花糖」和「甜瓜」在这个节骨眼上被曝出,引发了外界的无限遐想。 猜想一:Opus 5.1 的绝地反击。 许多人认为,这两个与 Opus 5.1 紧密关联的模型,正是 Anthropic 针对 Opus 5 缺陷进行紧急回炉重造后的「威力加强版」。 通过引入强大的「思考token」机制,强行拔高模型的逻辑天花板。 猜想二:新一代 Sonnet / Haiku 的突袭。 也有测试者认为,考虑到其惊人的速度和性价比,它们可能是 Sonnet 或 Haiku 的更新版,毕竟它们并未被冠以顶级的「Fable」称号。 但无论是哪种情况,Anthropic 显然已经坐不住了。 他们正在疯狂加快迭代速度,甚至不惜将极度消耗算力的前沿模型直接下放测试。X 开发者们已经按捺不住激动:「接下来的几周到几个月,将会变得极其有趣!」 棉花糖和甜瓜,能否一雪Opus 5的前耻,让Anthropic再赢一局? 参考资料: https://x.com/Lentils80/status/2091704307863142812?s=20 https://x.com/NFT_Chen/status/2091764673767198730?s=20 编辑:Aeneas 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱