首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

中国人工智能竞赛黑马:StartLux

2026-09-04 1 阅读 约5分钟阅读 try-working
分享:
字号:
发生了一件大事——中国国内顶级大型模型开发商中出现了一匹黑马。一家新公司的首款模型只有27B参数,在中国信通院MCP专业测试中获得总分第二名。排在其前面的是梁文峰秘藏了近一年的杀手锏:参数数达1.6万亿的DeepSeek-V4-Pro。两者之间的差距仅为1.3个百分点。这匹黑马就是来自StartLux(原原点星汇)的StartLux-V1.0-27B-Preview。看起来有点陌生,不是吗?别担心,它的创始人兼CEO是一位老熟人:陈丹燕。被誉为互联网时代程序员的“教父”,他的成就已是有目共睹:盛大网络联合创始人、连商网络掌门人,中国最早引入“共享软件”概念的程序员之一,退休十年后,他卷土重来,这一次押注于本土模式。这与陈大伟近期罕见公开露面有关。在盛大创新院18周年聚会上,他公开宣示了“人工智能时代的八种非共识观点”,其中四点围绕本土模式。本土机型将彻底摧毁云市场,三年内赶上克劳德,占领80%的市场。基于参数的模型竞赛即将过时……StartLux就是他想法的最好体现。该公司的业务并没有跟随行业潮流,而是专注于小而美的本土模特的商业化,使其成为全球第一家真正意义上的本土模特公司。作为首款面向市场的记分卡,StartLux-V1.0-27B-Preview不依赖于云端,可以直接在消费级PC上运行。也就是说,这个体积缩小了近60倍的本地模型,拥有可以媲美万亿级云端旗舰模型的Agent能力。这有什么道理呢?小车型大成绩,27B胜1.6T 在揭晓答案之前,我们先来看看是和谁进行比较的。人们常说没有人记得第二名,除非第一名是 DeepSeek。而且,差距很小,非常值得讨论。结果来自权威机构中国信息通信研究院值得信赖的AI大模型基准测试MCP专项,围绕真实应用场景设置了六类任务:位置导航、网页搜索、浏览器自动化、财务分析、代码库管理、3D设计。将增加额外的综合评估,重点评估Agent的多工具协作、复杂任务执行以及在现实环境中的交互。简单来说,MCP-Universe 不会根据模型的响应来评估模型,而是根据模型是否能够真正完成任务来评估模型。这也是判断一个Agent品质的最根本的方面。结果显示,StartLux-V1.0-27B-Preview综合得分为39.25%,排名第二。 DeepSeek-V4-Flash-0731 拥有超过 2840 亿个参数,Step-3.7-Flash 拥有 1980 亿个参数,仅落后 DeepSeek-V4-Pro 1.3 个百分点。相同27B参数尺度下,StartLux也超越Qwen 3.6 5.34个百分点。它在个别科目上也表现出色,在位置导航、财务分析和浏览器自动化方面排名第一,其他子项目也排名靠前。抛开数据,让我们看一下两个案例研究。第一个问题是关于微软为期两年的股票投资,以 Claude Sonnet 4.6 作为竞争话题。克劳德的答案是:$47,254,89.02%。视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg StartLux 给出:$47,499.09,90.00%。看似相似,但在金融行业,微小的差异可能会导致巨大的损失。仔细检查两个模型的推理过程可以发现,由于缺少原始数据,Claude Sonnet 4.6将2025年1月8日误认为是非交易日,而是计算了前一天的收盘价。在相同情况下,StartLux会回顾原始数据并验证目标日期周围的市场趋势,以确认准确的收盘价,然后完成计算并生成可视化。最终,StartLux得出的结论被证明是正确的,并且完全可验证、可追溯。第二个任务更简单:两个模型都被要求同时在浏览器中搜索机票。我无法打开浏览器或与 Google Flights 等实时网站交互。我只能处理文本,没有实时浏览功能。要自行查找此航班,您需要执行以下操作: 1. 访问 google.com/flights 2. 输入新加坡 (SIN) → 北京 3. 选择单程,将出发日期设置为从今天起 5 天后 4. 按“直达”过滤
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱