首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

从训练数据到科研验证,沐晨科技押注AI时代的新基础设施

摘要

机器之心发布 近期 2026 外滩大会上,北大助理教授杨灵关于「长程任务学习」的分享引发行业关注 —— 当 AI 从单次问答走向长周期复杂任务,模型如何从持续交互中积累进化。 而在这份分享的合作研究标识中, Muchen AI 的名字赫然在列。 紧随其后,PhAI Labs 发布交互式科研工作空间 ScienceBuddy,AItonomy Foundation 推出科研智能体开发环境 Scien...

PhAI Labs ScienceBuddy Muchen Rubric 机器之心发布 2026 外滩大会上 北大助理教授杨灵关于 长程任务学习
2026-09-24 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 近期 2026 外滩大会上,北大助理教授杨灵关于「长程任务学习」的分享引发行业关注 —— 当 AI 从单次问答走向长周期复杂任务,模型如何从持续交互中积累进化。 而在这份分享的合作研究标识中, Muchen AI 的名字赫然在列。 紧随其后,PhAI Labs 发布交互式科研工作空间 ScienceBuddy,AItonomy Foundation 推出科研智能体开发环境 ScienceIDE,两份重磅发布的合作方名单中, 沐晨科技(Muchen AI)均以联合研发与技术支持方的身份出现。 这家 2024 年才在重庆成立的 AI 数据工程公司,既不在互联网核心圈层,也并非模型厂商,为何能频频切入前沿科研与产业项目?它的增长逻辑,又折射出 AI 数据服务行业怎样的底层转向? 大模型下半场, 数据服务的核心早已不是「堆量」 大模型进入复杂任务落地阶段,数据服务的竞争核心早已 从「样本量级」转向「过程质量」 —— 任务边界是否清晰、评价标准是否统一、执行链路是否可追溯,正在成为比数据规模更关键的底层能力。 这正是沐晨科技从成立之初就锚定的方向: 数据服务的交付物不只是样本本身,更包括让样本可用的任务定义、判断依据、质量记录与迭代机制。 其中, 结构化评价标准(Rubric) 是整个体系的核心 —— 它把笼统的「回答得好不好」「结果对不对」,拆成可量化、可对齐、可检查的细分维度,比如事实准确性、逻辑完整性、约束符合度、错误严重等级等。 但写出评分表并不是终点。标准还要经过真实样本的双盲校验,解决不同人员的判断分歧;要跟随模型能力迭代更新版本,避免旧标准失效;还要和生产流程深度绑定,确保每一批交付都符合统一尺度。 这种模式下,数据生产不再是一锤子买卖,而是贯穿模型多轮迭代的长期运营工作。沐晨将其定义为 Long-horizon AI Data Operations:面向复杂 AI 系统的长期数据工程与评测运营。 从交付样本到交付体系, 长周期工程能力的商业验证 理念的落地,最终要靠真实业务场景的打磨。 某头部代码大模型厂商在推进代码智能体工程化落地时,曾遭遇评测体系与真实开发场景脱节的核心瓶颈:传统评测多基于孤立算法题与简化 Demo,任务脱离真实工程环境,评分维度粗放,不同人员、不同模型的评测结果一致性偏差超 30%,无法有效支撑智能体真实工程能力的迭代。 沐晨没有采用「按需求生产样本」的传统交付模式,而是为客户搭建了一套从仓库筛选到结果溯源的全链路工程化评测体系: 建立真实代码仓库质检标准,筛选具备完整业务逻辑与工程结构的项目仓库;构建统一可复现的 Docker 容器执行环境;设计覆盖 Bug 修复、功能开发、工程配置等真实开发场景的任务矩阵;配套分层级 Rubric 评价标准与全链路执行留痕机制。 所有任务均在 Trae 环境中完成 5 款主流代码模型的独立运行验证,完整保留执行链路、评分依据与 git diff 产物。最终评测人员一致性提升至 90% 以上,交付的可复用评测体系,持续支撑客户代码智能体的工程能力迭代与多版本优化。 对沐晨而言,单次项目验收不是终点,更重要的是建立跨多轮任务和模型迭代的持续交付能力。 相比于传统数据公司「接项目、做交付、结项走人」的模式,这种长周期运营的门槛更高,但也构建了更深的客户粘性与业务壁垒。 成立两年间,沐晨已经将这套能力从通用大模型数据评测,延伸至多模态、智能体等多个场景。更关键的是,公司的增长并非依赖低价人力扩张,而是伴随着收入结构的持续优化:高价值的评测方案、长周期运营服务占比稳步提升,客户复购率与项目平均周期持续增长,走出了一条「质量优先」的增长路径。 走进科研场景, 把验证体系做进 AI 科研流程 如果说商业场景验证了沐晨的工程落地能力,那么参与 ScienceBuddy 的联合研发,则是这套能力向更前沿领域的延伸,也让「发现 — 拆解 — 验证 — 回流」的递归式科学任务闭环真正实现工程化落地。 科学研究对 “结果可信” 的要求远高于商业场景:一份科研分析是否可信,不能只看行文是否流畅;一段数值计算能否接受,也不能只看程序是否退出报错。方法、参考结果、单位、误差范围和实验条件,都会影响结论的有效性。 PhAI Labs 发布的 ScienceBuddy,关注科学家与 AI Agent 在真实研究中的持续交互,研究者提出问题、修正目标、评价结果,系统记录完整的工具调用与执行轨迹,为理解智能体表现提供依据。 在联合研发分工中,三大平台形成联动闭环: PhAI Labs 主导递归科学任务中台架构与整体产品交互框架设计,承担任务调度、状态管理与结果判定职能; 沐晨与 PhAI Labs 联合推进科学发现平台研发,负责科研问题采集、候选方案生成与待验证任务标准化输出; 科学验证平台的框架体系设计与工程落地则由沐晨全权负责,核心搭建多层级科学检查机制、结构化轨迹记录体系与自动化评分框架。 科学验证平台并非孤立的执行节点,它与科学发现平台通过中台形成递归联动:验证完成的结果回流至中台,经判定若不足以闭合根问题,便会驱动科学发现平台优化问题理解、迭代方案生成,任务重新进入验证链路,以此实现问题的逐层递归深化。伴随流程标准化与数据沉淀,这套闭环正从「人驱动递归」向「自动化递归」演进,人工逐步从执行转向监督与验收角色。 针对科学验证平台, 沐晨将这套能力沉淀为可规模化交付的产业服务, 独立输出了 Sci/Eng 场景 Agent 评测数据集全链路交付体系: 覆盖数学、物理、生物、工程等 10 余个专业方向,基于真实科研工作流设计多步复杂任务,运用「MCP 接口框架 + 专业工具调用」的方式要求 Agent 完成多步骤执行,采用自动化脚本评分的方式对模型解题产物进行评测,并完整交付任务元数据、参考答案、运行轨迹与环境复现说明。 最终交付的并非零散的单题样本,而是端到端可复现的标准化评测基准体系 —— 其内在的「任务定义 — 执行验证 — 结果反馈 — 能力迭代」逻辑,正是 ScienceBuddy 递归闭环能力在产业场景的直接复用,可直接用于多模型横向对比与长程任务能力的持续迭代验证。 在沐晨看来,从商业交付到科研合作,本质上是同一套底层能力的迁移:商业场景打磨出的任务拆解能力、Rubric 标准化能力、过程可追溯能力、失败分析能力,平移到科研场景中,就变成了科研任务定义、科学检查标准、执行轨迹记录、验证结果迭代的核心能力。 变化的是应用场景,不变的是「把模糊需求转化为可验证、可迭代、可沉淀的标准与流程」这一核心逻辑。 为什么是沐晨? 两年跑通双赛道的底层逻辑 一家成立仅两年的 AI 数据工程公司公司,能同时跑通商业交付与前沿科研双赛道,既不是偶然的资源加持,也不是短期的营销造势,而是清晰差异化战略下的必然结果。 沐晨科技全称为重庆沐晨人工智能科技有限公司,2024 年 2 月正式成立,核心团队拥有丰厚的数据工程与模型评测经验,合作客户均来自头部大模型厂商、AI 数据企业与科研机构。创立之初,团队便避开了「堆人数、打低价」的低端数据标注红海,锚定长周期数据工程与评测运营这一高价值方向 —— 在他们的判断里,数据服务的核心壁垒从来不是人员规模,而是可
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱