首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

清华天眸芯团队再登Nature系列期刊封面,类脑互补视觉范式重塑AI感知世界的方式

摘要

机器之心发布 多模态大模型、世界模型与具身模型正不断重塑 AI 能力的边界,但一个更基础的问题却长期被忽略:开放世界中的视觉退化。高速运动模糊、频率混叠、强光过曝、闪烁干扰… 这些现实环境中的复杂退化现象,会造成图像结构失真、信息缺失。而由于缺乏可靠真值,这类数据很难用于传统监督学习,往往成为 AI 训练中的盲区。因此,即便拥有强大的模型,AI 系统仍可能因为错误或缺失的视觉信息而做出错误判断。如...

Nature 天眸芯 2024 Sensors RGB Physical 天机芯 机器之心发布 多模态大模型 世界模型与具身模型正不断重塑
2026-08-11 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 多模态大模型、世界模型与具身模型正不断重塑 AI 能力的边界,但一个更基础的问题却长期被忽略:开放世界中的视觉退化。高速运动模糊、频率混叠、强光过曝、闪烁干扰… 这些现实环境中的复杂退化现象,会造成图像结构失真、信息缺失。而由于缺乏可靠真值,这类数据很难用于传统监督学习,往往成为 AI 训练中的盲区。因此,即便拥有强大的模型,AI 系统仍可能因为错误或缺失的视觉信息而做出错误判断。如何在有限硬件资源下获取高质量视觉信息,为机器人和具身智能提供可靠感知基础,已成为 Physical AI 发展的关键问题。 继《Nature》封面后,天眸芯相关工作又登《Nature Sensors》封面 —— “Seeing through visual primitives” 2024 年,清华大学类脑计算研究中心团队研发的 “天眸芯” 登上《Nature》封面,首次提出基于视觉原语(Visual Primitives)的类脑互补视觉感知新范式,并研制出全球首款基于原语的双通路互补视觉感知芯片 “天眸芯”,为机器视觉提供了一条区别于传统 RGB 成像的新技术方案。 时隔两年,团队在这一方向上的最新进展又登上《Nature Sensors》封面。 如果说 2024 年的工作完成了互补视觉从 0 到 1 的感知范式和芯片硬件创新,那么此次研究则实现了从 “1 到 10” 的系统级算法软件生态飞跃。研究借鉴人类视觉原语的自监督表征构建与内部模型(Internal Model)形成机制,将互补视觉扩展为一个可学习、可迁移、可 Scaling up 的完整技术体系。具体而言,研究建立了基于天眸数据构造视觉原语的方法,并提出了无需真值标注的退化数据自监督表征学习框架,使模型能够直接从真实退化数据中学习有效视觉表示,再高效迁移到不同下游视觉任务。同时,团队还开源了配套算法软件工具链 TianMouCV,为互补视觉算法研究、应用开发以及社区生态建设提供了统一的平台。 论文通讯作者为清华大学精密仪器系施路平教授与赵蓉教授;共同第一作者为原清华 “天眸芯” 算法负责人、现厦门大学智能制造学院助理教授林逸晗博士(兼晰见科技首席科学顾问)与清华大学博士生陈雨过。此外,2024 年《Nature》封面文章第一作者、现晰见科技 CTO 王韬毅博士,以及博士生孟亚鹏、陈相儒等核心成员也为本工作做出了重要贡献。 截至目前,中国大陆机构作为第一完成单位、在 AI 与芯片领域斩获《Nature》正刊封面的标志性成果仅有三项 ——“天机芯”、“天眸芯” 与 DeepSeek-R1。其中,清华大学类脑计算研究中心完成了前两项。从 “天机芯” 开创异构融合类脑计算芯片,到 “天眸芯” 提出互补视觉新范式,再到今天持续完善互补视觉的算法、软件与开源生态,团队始终坚持从第一性原理出发,探索新型智能计算与感知体系。这条持续十余年的原创技术路线,正不断推动类脑互补视觉走向 Physical AI 的真实应用,为下一代智能系统构建更可靠的感知基础。 互补视觉传感下的自监督视觉重建:高速高动态范围成像实例,以低带宽、低硬件开销达成高性能机器视觉 从 0 到 1:从感知入口应对视觉退化 2024 年《Nature》封面工作借鉴人类视觉机制,提出基于原语的互补类脑视觉感知新范式。将开放世界的视觉信息拆解为视觉原语的信息表示,并通过有机组合这些原语, 借鉴人类视觉系统的核心机制 ,形成 “认知通路” 与 “运动通路” 两条优势互补、信息完备的视觉感知通路,使得智能系统 既 能够实现高精度的识别又能对运动做出快速响应。基于这一新范式,团队进一步研制出了世界首款类脑互补视觉芯片 “天眸芯”,该芯片将光信号分解为三类互补的数据模态:认知导向通路(COP)保留完整 RGB 信息,动作导向通路(AOP)捕捉高精度 ±7bit、动态范围 130dB、高速稀疏信息,包括空间差分(SD)和时间差分(TD)。不同通路对视觉退化的响应各异:RGB 保留颜色与外观,但易受运动模糊和过曝影响;空间差分保留边缘,却缺少运动特征;时间差分对变化高度敏感,但也可能将闪烁误判为位移。多种视觉原语互为补充,使 AI 系统同时获得颜色、结构和变化证据,在不同退化之间形成有效互补。芯片最终测得极高的性能指标和极佳的实拍效果,成为视觉感知新范式探索的重要起点。 从 1 到 10:让 AI 在退化信息中知道 “该信谁” 多路感知只是起点。开放世界中,视觉退化常常叠加,各路信号受损程度也不同。真正困难的是,在无法获得视觉真值和语义真值监督的条件下,当不同视觉通路提供的证据冲突时,处理算法能否判断可信度,并形成可泛化的内部视觉模型来形成优质的视觉表示。2026 年《Nature Sensors》论文 借鉴人脑依托视觉原语实现稳健感知的内在机理,构建两阶段类脑感知学习范式,依托互补视觉线索自监督构建内部模型;基于天眸芯采集的极端场景实测数据集完成验证,成功突破传统视觉系统在开放世界极端成像退化条件下的感知瓶颈。 本文提出的类脑视觉传感 - 感知自监督学习框架:自底而上构建内部模型,自顶而下调制感知任务,基于天眸芯实现开放世界数据高效的鲁棒视觉感知 自底而上的阶段,算法不依赖现实中不存在的 “完美图像”,而是借鉴人与生俱来的视觉原语,将不同视觉先验嵌入一组中间表征,使其各自具有不同的优势,进而让不完整的证据彼此预测、校验。针对不同视觉退化,积分表征适应光照变化,运动补偿表征恢复瞬时结构,高动态范围表征补回过曝或欠曝区域。基于这些表征,本文进一步通过在时间上的对称自监督预测学习获得了一个内部模型,IGFNet。它利用跨通路注意力和记忆模块分配权重,保留可靠线索并推断缺失结构,最终在隐空间中形成通用的视觉表示,并可解码出视觉真值的估计(e-VGT):为 AI 构建尽可能完整、清晰、高动态范围且时空对齐的表征。 IGFNet 在闪烁干扰、过曝、运动模糊及混合视觉退化下生成估计视觉真值序列 更多极端场景下的实拍数据的通用视觉真值估计 从 “看清” 到 “看懂”:把感知能力送入任务 自上而下阶段把内部模型的视觉知识送入高层任务。一条路径以 e-VGT 作为 “新画布”,帮助基础模型生成语义标注;另一条迁移 IGFNet 内部形成的鲁棒特征,让下游网络继承应对视觉退化的能力。AI 获得的不只是一张清晰图像,而是可用于深度、分割和定位的感知基础。 在单目深度估计中,团队以实拍数据的 e-VGT 配合大模型标注,建立在极端环境下有良好单目深度标注的 Tianmouc-MDE 数据集,并将预训练的 IGFNet 编码器接入深度网络。即使图像受到曝光变化等视觉退化影响,深度结构仍能保持连续。 估计的视觉真值与内部模型 IGFNet 提供的视觉特征能大幅增强对开放世界极端环境下的单目深度估计能力 在视频实例分割中,团队以类似方式构建 Tianmouc-VIS 数据集并设计 YOLO-CVS。配合模拟数据习得基本的检测和分割能力,尽管 Tianmouc-VIS 的规模不大,但这类基于 e-VGT 生成的真实标注在多个模型的训练验证下都显著提升了极端环境下的检测和实例分割表现。这也提供了另一种利用天眸数据的方式。 依托本文提
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱