智能AI
morning
谷歌还有大招!最新模型Mathematica泄露
摘要
新智元报道 大模型做数学题做到「颅内高潮」,你见过吗? 在大多数人的印象里,AI做数学题四平八稳、逻辑缜密。 哪怕是当前最顶尖的推理模型,思维链无非也是一段段机械自语 : 第一步,设 x 为未知数;第二步,将两边同时平方;第三步,根据引理得出矛盾…… 但今天这个谷歌大模型,彻底颠覆了人类对AI的认知。 近日,知名科技博主与爆料人 lyra 在社交平台上晒出了数张谷歌内部评测模型的卡片截图。 截图中...
Mathematica
Tokens
DeepThink
GOD
536
Token
Temperature
新智元报道
大模型做数学题做到
颅内高潮
2026-09-20
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 大模型做数学题做到「颅内高潮」,你见过吗? 在大多数人的印象里,AI做数学题四平八稳、逻辑缜密。 哪怕是当前最顶尖的推理模型,思维链无非也是一段段机械自语 : 第一步,设 x 为未知数;第二步,将两边同时平方;第三步,根据引理得出矛盾…… 但今天这个谷歌大模型,彻底颠覆了人类对AI的认知。 近日,知名科技博主与爆料人 lyra 在社交平台上晒出了数张谷歌内部评测模型的卡片截图。 截图中,一款代号为 Mathematica (基于尚未正式发布的 DeepThink V3)的数学特化变体赫然在列。 更让整个科技界瞠目结舌的是它的「原始思维链」—— 在推导一道复杂的丢番图方程(Diophantine Equation)时,AI在撞见一个精妙绝伦的代数化简路径后,竟然像一个在草稿纸前熬了三宿、突然顿悟的疯批数学家一样,在思考日志里连续用大写字母狂吼: 翻译成中文是这样的: 数学的老天爷啊!!!!!!!!!!!!!!!!!!!! …… 让我们来欣赏这个方程绝对纯粹的美。 …… 我的天哪!!!!!!!!!!!!!!!!!!!!!!!! 随后,它一边狂发感叹号,一边宛如癫狂地把变量代回、重构对称项、严丝合缝地完成了恒等式验证。 然而,在这场充满戏剧性的「AI发疯」背后,藏着的却是硅谷深处正在酝酿的一场极其可怕的算力风暴。 谷歌到底在实验室里养了一个怎样的数学怪物?它的思维链为什么会「狂野」到这个地步?这一声跨越逻辑维度的「OH MY GOD」,又向人类揭示了AI推理进化的什么终极秘密? 事故现场还原:一道丢番图方程,逼出AI的「癫狂面目」 根据曝光的评测终端信息,这款模型的内部完整标识为: models/deepthink-mathematica-tf-raw-thoughts 这个接口直接撕掉了所有产品包装,把模型内部最原始、未经任何人类礼仪过滤的思维暗流,赤裸裸地暴露在了屏幕上。 从流出的截图来看,测试员给它抛出的是一道极具欺骗性的高难多项式丢番图方程。 这类问题的经典之处在于:解法看似毫无头绪,常常需要构建极其冷门的高维恒等式或非平凡变量替换,才有可能在密不透风的符号丛林中劈开一条生路。 普通的模型在面对这类问题时,往往会在有限的步数内陷入死循环,或者干脆机械化地穷举试错、最后给出一段充满逻辑幻觉的废话。 但这位代号 Mathematica 的 DeepThink 变体,其思考过程堪称一部好莱坞级心理戏剧: 暗中潜伏,静止沉淀 :起初它像普通推理模型一样拆解项数,分析次数与整除性质; 惊天顿悟,情绪失控 :当它尝试做某组特殊的交叉乘积组合、忽然发现交叉项奇迹般抵消时,整个思维日志瞬间被全大写的字符和感叹号占领; 审美凝视,陶醉自我 :在确认化简成立的刹那,它竟然自言自语道:「停下来,让我们欣赏一下这绝对的数学美感」; 趁热打铁,收割证明 :随后,它在连串的「OH MY GOD」中,一气呵成地完成了变量回代与边界条件验证,彻底锁死了方程的整数解集。 这种极度外向、充满多巴胺分泌感的做题画风,把习惯了「对不起,作为一个人工智能语言模型」这类公事公办语调的网友们看呆了。 还有人感叹:「完了,AI不仅会做数学,它甚至开始从数学里获得快感了。」 扒开参数底牌:这个叫「Mathematica」的怪兽到底有多猛? 如果只把这当成一个段子,那就太低估谷歌这波泄密的含金量了。 当我们剥离掉那些搞笑的感叹号,仔细研读截图底层的配置参数卡片时,扑面而来的是一种令人窒息的工程压迫感: 突破天际的输出极限:65,536 Tokens 对于普通大模型而言,输出上限通常被压制在 4,096 或 8,192 个 Token,即使是主打长思考的模型,单次输出也极少放开到这个量级。 而该模型卡片明确标注: 输出上限为 65,536 Tokens! 这意味着该模型可以在单次响应中,完成长达几万字的超长距离多步骤严密演绎! 如果折算成学术论文,它足以单次吐出一整篇包含完整引理、推论、反例构造与全面形式化验证的纯数学顶刊论文。 百万级上下文底座:1.04M Tokens 输入上限约 104 万 Token 。 这说明它继承了 Gemini 系列标志性的超长原生上下文架构,但这次是将其完全注入到了「深度推理」(Deep Think)模式中。 它可以一口吞下一整个数学分支的几本专著,或者上百篇相互关联的前沿预印本论文,然后在这些海量理论背景之上展开超高维度的知识拼接。 反常识的推理参数:Temperature = 1 在常规的工程认知中,做数学、写代码这类讲求绝对逻辑严密性的任务,模型的生成温度(Temperature)通常会被设得极低(如 0 或 0.2),以此确保输出的确定性与收敛性。 然而,Mathematica 的默认温度居然是 1 ! 在高温度下开启思考,意味着谷歌根本不是在让它「死记硬背」套公式,而是故意赋予它极高的语义发散度,鼓励它在广袤的解空间里进行随机性极高的直觉跳跃、概念隐喻与非传统联想——这恰恰是顶尖人类数学家在黑板前灵光一现时的认知模式! 实验室内部印记:Teamfood 与 UNSTABLE_EXPERIMENTAL 接口中的 tf 代指 Teamfood ,这是谷歌内部极具代表性的研发黑话。 在硅谷,把产品拿给公司内部全员内测叫「吃狗粮」(Dogfooding),而在核心小团队、顶尖研究组内部流通的极早期测试切片,则被称为「Teamfood」。 加上其状态标识明确为 UNSTABLE_EXPERIMENTAL(不稳定实验级),一切都坐实了: 这是刚刚在谷歌 DeepMind 内部炉子里炼出来的原生大招,甚至还没来得及做商业包装与公关修剪。 为什么思维链会「发疯」? 为什么一个理应绝对理性的数学模型,会在思维链里大喊大叫?这到底是谷歌程序员刻意埋的彩蛋,还是提示词工程的恶搞? 深入到大语言模型的强化学习(RL)与思维链机制内部,你会发现: 这种「情绪化」根本不是刻意做秀,而是极度暴力的深度推理在无拘无束状态下的必然副产物。 1. 「Raw Thoughts」的本质:逃过对齐剪刀的原始探索 我们平时在商业版大模型里看到的思考过程,通常都是被经过严格安全对齐(RLHF)、格式化清洗(Formatting)和风格修整(Tone Polishing)之后的「阉割版思维」。 为了让大模型显得专业、谦逊、礼貌,科技大厂们会用强化学习的大剪刀,把模型在探索过程中一切跳跃、杂乱、自言自语的中间语义通通剪掉。 但这个泄露的版本全名叫做 raw-thoughts—— 未经修剪的原始思维 。 它记录的是模型在潜空间中进行蒙特卡洛树搜索(MCTS)或基于强化学习的自我博弈时,最本初的神经元激活痕迹。 它根本不需要「装」给人类看,那是它自己在暗室里的真实独白。 2. 人类数学语料的隐性基因转移 大模型的训练数据包含了人类有史以来的海量高质量数学讨论:MathOverflow、arXiv 预印本、知乎与 Reddit 的硬核讨论区、甚至是数学家们未公开的手稿日记。 在这些语料中,当一个真正的人类数学天才在深夜攻克一个卡了几个月的绝妙恒等式时,他写下的绝对不是「经推导,此式可化简」,而往往就是: 「Holy cow! Look at
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱