智能AI
morning
本地如何做RSI?我们和StartLux CTO聊了聊
摘要
编辑|Panda 上周六,陶哲轩、邓煜、彼得·舒尔茨等 25 位菲尔兹奖得主 联合发表了一份声明 《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩还表示「事态紧迫」,他们根本没有时间等待更广泛的协商就决定先行发布。 这封信并不反对 AI 进入数学,而反对的是 AI 公司把「攻克著名难题」当基准来刷。这样一来,数学共同体真正在意的理解、概念和可被后人复用的思路,正在被一个更容易量化的目标挤掉。 ...
StartLux
RSI
OpenAI
27B
Preview
Agent
MCP
专项测试中综合得分
DeepSeek
Research
2026-09-16
1 阅读
约10分钟阅读
机器之心
字号:
编辑|Panda 上周六,陶哲轩、邓煜、彼得·舒尔茨等 25 位菲尔兹奖得主 联合发表了一份声明 《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩还表示「事态紧迫」,他们根本没有时间等待更广泛的协商就决定先行发布。 这封信并不反对 AI 进入数学,而反对的是 AI 公司把「攻克著名难题」当基准来刷。这样一来,数学共同体真正在意的理解、概念和可被后人复用的思路,正在被一个更容易量化的目标挤掉。 而就在此三天前,OpenAI 刚刚宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时 88 小时,完成了纳维-斯托克斯存在性与光滑性问题中部分陈述的证明,并表示不申领克雷研究所的奖金。 社区讨论中,一大核心论点是 OpenAI 的模型到底有没有「盗窃」数学家的思路,然后依托强大算力抢先证明。也因此, 前沿数学研究可能会开始防备云端 AI 提供商 。 但要真正做到,却又很难,毕竟本地 AI 能力不够强。你可以把未发表的推导锁在自己的硬盘里,但那意味着你也放弃了那个真正能帮上忙的强大云端模型。所以过去几年,绝大多数人还是把稿子交给了云端。 而这个前提,正在出现松动的迹象。时间往前拨半个月。工信部中国信通院人工智能研究所公布的检验报告显示,中国初代程序员、盛大网络、连尚网络创始人陈大年创立并担任 CEO 的 上海原点星辉科学技术有限公司 ( 下简称 StartLux ) ,其本地模型 StartLux-V1.0-27B-Preview 在可信 AI 大模型基准测试 MCP 专项测试中综合得分 39.25 ,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731,与 1.6 万亿参数的 DeepSeek-V4-Pro 差距在 1 个百分点上下。 参数量 相 差约 60 倍 ,这个对比很容易被写成一个爽文式的标题——我们也确实看到了一些这样的报道;但作为一家专业的 AI 媒体,我们更想追问的是这 39.25 分是怎么来的:同样是 27B、同样以 Qwen3.6-27B 为基座、结构基本没动,它比基座本身高出 5.34 个百分点,增量全部发生在 后训练 环节。 据 StartLux 团队透露的数据, 这个环节里约 70% 的实验执行工作是交给 AI 完成的 ,研究员保留研究目标、评价标准和关键取舍。团队把这套方法叫 Auto Research 。 顺着这条路往下,指向的是一个更广阔的研究方向: RSI(递归自我改进) 。9 月 6 日,OpenAI 发布了一篇自我披露博客《Research acceleration: The view inside OpenAI》。里面有一个相当惹眼的数字 3.1 :截至 8 月中旬,它的研究组织每消耗 1 个人类工作日,就要配上 3.1 个 Agent 工作日的算力运行时间。该公司 7 月还曾因 Agent 突破内部研究基础设施而暂停强化学习实验两周。OpenAI 表示:「我们还不知道如何安全地一路走到对齐的、完整的 RSI。」 就这样,RSI 成为了近期产业讨论一大核心,但相关示例几乎全部来自最烧钱的那几家云端实验室,还很少有人讨论本地的、跑在你自己电脑上的模型的 RSI。 StartLux 想做的,是把这条路线的产物装进一台个人电脑。But how? StartLux-V1.0-27B-Preview 正在个人电脑上执行金融分析任务 我们把这个问题交给了 StartLux 联合创始人兼 CTO 郭权玮博士 。 StartLux 联合创始人兼 CTO 郭权玮博士 在这次专访中,他把自我改进划成了五级,并给出 StartLux 目前所处的位置;他提到「70% 实验执行」这个说法容易让人误解,若只算机械执行,今天的自动化比例已超过 95%;他还公开了一组量化实验数据,Q4、Q6、Q8 与 BF16 的差距小到出人意料,Q2 才是真正的悬崖;他也拿出了一组「能力重新分配」的实测数字,一轮针对 Agent 的后训练让 GPQA 从 83.33 涨到 90.40,同时让 GAIA 从 57.57 掉到 45.70。至于「本地 × RSI」绕不开的安全问题,他也给出了重要见解:探索的自由和修改自己的权限,必须分开。 整体而言,StartLux 与郭权玮博士想做的,是 让 AI 作为「每个人自己的模型」而进化——它会在你的机器里成长,用你的文件和你的成功/失败变强,构建只属于你的进化轨迹。 下面,我们就跟随郭权玮博士,详细了解一下 StartLux 这家创业公司是如何走出了属于自己的「 本地×RSI 」之路。 亮眼的成绩单意味着什么? 机器之心 :在工信部中国信通院人工智能研究所公布的检验报告显示,StartLux-V1.0-27B-Preview 在 MCP 专项测试中综合得分 39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731,与第一名差距也不大。这个成绩意味着什么? 郭权玮 : 我一直把一个模 型理解成 一个高维世界。 参数量决定了这个世界大致有多少容量,但真正决定它能表达什么的,不只是世界有多大,而是 里面的结构如何组织 。 训练会不断改变这种组织方式。一个能力变强,有时不是因为模型获得了更多参数,而是有限的参数被重新组织到了更有效的位置。与此同时,不同能力之间也会产生干扰和竞争,所以后训练真正困难的地方,是如何在有限容量下重新塑造能力分布,同时尽量不破坏原有能力。 我们做 Auto Research,本质上是在尝试把这种「寻找更好参数组织方式」的过程自动化。 现在的结果说明,模型规模不变,能力分布仍然可以被明显重塑;如果这种过程以后能够由 AI 自己持续完成,那就开始自然走向 Self-Improvement,甚至更远的 RSI。 机器之心 :Agent benchmark 的成绩很容易受 Harness、Prompt 和执行配置影响,行业里 reward hacking 的案例也越来越多。你们内部怎么判断一次改进是「真的变强」,而不是「学会了钻评分规则的漏洞」?回头看 MCP 测试那 5.34 个百分点,你们最看重它证明了什么? 郭权玮 :现在几乎每隔几天就会有一个新模型,尤其是后训练模型。Benchmark 当然重要,但它本质上还是一张考卷:分数变高,可能是真的学会了,也可能只是更熟悉这类题。 所以我们内部其实没那么在意 5.34 这个数字本身,更在意的是 同一套后训练方法放到不同 Benchmark、不同任务上,提升还能不能持续出现 。目前看,这套方法是成立的。 但我自己对「真的变强」的标准会更高。不是在现有评价框架里把分数继续往上推,而是 模型内部的能力组织发生更一般的变化,让这种提升能够迁移到新的任务和环境 。 我们现在也在尝试新的后训练框架,让训练不只调整参数,还能进一步探索对模型结构本身进行受控改变。目标不是让模型越来越会做题,而是让模型获得新的能力。 机器之心 :官方说 16GB 以上显存的消费级显卡就能跑,比如 RTX 4060 Ti 16G。但 27B 模型在未压缩的 BF16 精度下,仅模型文件就需要约 55.6GB 显存。如果要进 16GB 显存,必然涉及量化。信通院送测的是哪个精度的版本
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱