首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学

摘要

新智元报道 DeepSeek-V4-Flash正式版刚炸翻全球通用大模型圈,中国生命科学版Deepseek就紧随其后。 近日,津渡生科(由4个牛津大学归国学霸创办)自主研发的生命科学垂类GeneLLM多组学大模型,接连登上国际顶级学术期刊——《Nature Communications》与《Advanced Science》。 作为全球首个直接使用组学原始数据进行预训练的多组学大模型,GeneLL...

Claude 新智元报道 DeepSeek Flash正式版刚炸翻全球通用大模型圈 中国生命科学版Deepseek就紧随其后 津渡生科 由4个牛津大学归国学霸创办 自主研发的生命科学垂类GeneLLM多组学大模型 接连登上国际顶级学术期刊 Nature
2026-08-05 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 DeepSeek-V4-Flash正式版刚炸翻全球通用大模型圈,中国生命科学版Deepseek就紧随其后。 近日,津渡生科(由4个牛津大学归国学霸创办)自主研发的生命科学垂类GeneLLM多组学大模型,接连登上国际顶级学术期刊——《Nature Communications》与《Advanced Science》。 作为全球首个直接使用组学原始数据进行预训练的多组学大模型,GeneLLM是 继谷歌AlphaFold和斯坦福大学的EVO 2之后的又一重磅模型,填补了中国生命科学基础大模型的空白,堪称中国生命科学版Deepseek , 让 AI 开始理解生命的多个「语言」与整个「系统」。 左右滑动查看图片 像预测下一个token一样, 预测下一条生命信息 疾病识别只是GeneLLM的一个应用场景,津渡生科真正想做的,是打造生命科学领域的「Claude Code」。 ChatGPT、Claude、DeepSeek等大语言模型的核心,是下一个token预测。 GeneLLM思路类似,但它预测的不是文字,而是生命信息。 RNA序列中的四种碱基——腺嘌呤(A)、尿嘧啶(U)、鸟嘌呤(G)、胞嘧啶(C),成为GeneLLM理解生命语言的基本Token。 传统生物信息学分析通常依赖基因注释、序列比对和人工定义标签。这种方法虽然准确,但会提前限定模型的认知范围,也可能丢失大量隐藏在原始数据中的未知生物信号。 GeneLLM则另辟蹊径,直接从未经加工的原始测序数据中学习生命规律。 它以RNA组、蛋白质组、代谢组等多组学原始数据作为训练数据,让模型自主发现疾病相关模式。 目前,GeneLLM已完成15亿参数和3.5万亿碱基序列的模型预训练,XLarge版本实现300亿参数模型预训练,持续扩大技术壁垒。 作为全球首个基于原始测序数据预训练的多组学大模型,GeneLLM包括两大阶段: (1)无监督预训练与原型挖掘 (2)患者级疾病微调(Disease Tuning) GeneLLM首先需要解决一个问题: 如何把复杂的生命数据变成AI可以理解的语言? 在自然语言处理中,BPE算法会把句子切分成Token;而GeneLLM则将约150bp长度的RNA测序片段,通过7个碱基组成的滑动窗口(7-mer)切分为生命Token。 随后,模型利用Transformer架构,在没有基因注释和人工标签的情况下,直接预测下一个碱基。 这意味着AI不是先看人类整理好的「字典」,而是直接从生命原始信号中学习。 在训练过程中,GeneLLM处理了约数十万亿条RNA reads,在百卡集群 NVIDIA A100 GPU上训练。 至此,GeneLLM泛化等能力开始「涌现」。 作为生科领域的重大创新突破,GeneLLM这一国产生科模型可以应用于新药研发、精准医疗、合成生物、环境监测、微生物与生物农业、蛋白质与分子设计等多个领域,是全球范围内少有实现实际场景落地的大模型。 当我们审视完GeneLLM在「数据、架构、训练」等底层创新后,才能真正理解:为何它代表了中国的「生物版DeepSeek」。 硅谷以数万张H100堆砌万亿参数,DeepSeek则以算法创新提高算力效率,GeneLLM同样四两拨千斤,撬动亿万生命科学数据。 如果说AlphaFold让AI第一次看懂生命的「结构」,EVO2让AI开始理解生命的「代码」,那么GeneLLM试图进一步理解生命的「系统」。 更狠的是效率。传统方法依赖6Gb深度测序,成本高企,难以落地。GeneLLM 在1Gb极浅深度(成本缩减83%)下仍保持AUC > 0.8。 这意味真正有希望让普惠精准医疗成为现实。 一种新的科研范式开始浮现:让AI从生命数据中学习,让生命科学进入可预测、可计算、可规模化探索的新阶段。 不只是模型,还是「最后一公里」的智能基础设施 但津渡生科的布局不仅在基础模型。 以GeneLLM多组学大模型为生命认知底座,津渡生科进一步构建连接AI智能与物理世界的执行体系,通过Harness智能实验执行层与DBTL(Design-Build-Test-Learn)数据闭环,实现从生命规律理解、科学假设生成,到自动化实验验证和持续迭代优化的完整AI for Science闭环。 正如前OpenAI VP、后训练负责人Liam Fedus所说,当前LLM已经耗尽了互联网上有限的文本和代码,下一步的科学发现的重大进展必须依赖实验迭代。 也就是说,不能只靠读人类已写下的内容来发现新知识,AI 必须自己做实验。 可问题来了—— 互联网服务天生有API,网络信息天生是数字化的,但科研设备来自不同厂商,协议各不相同,既复杂又昂贵,没有人能在几个月内推倒重建。 今天大多数实验室,是专为人类设计:仪器面板、移液动作、样本状态、临场判断,绝大多数没有变成机器可理解的信号。 AI进入实验室,当前不只是模型能力的问题,还需要一套新的基础设施。 因此,AI进入实验室,当前不只是模型能力问题,还需要物理Harness:把实验室变成一个可编译、可调度、可观测、可追溯的系统。 这,才是AI4S真正的最后一公里。 BioFord Harness,让实验室开始「自己动」 为此,津渡开发了一套名为BioFord Harness的系统。 这是一套把AI和物理实验室打通的基础设施。 他们不是让机械臂模仿人手,而是把实验室变成一个可编译、可调度、可观测、可追溯的系统。 这个过程中,物理Harness至少要完成三件事: 1.把科学意图或实验DSL,编译为不同设备能够执行的指令; 2.在多设备之间完成调度、资源与安全约束管理,并处理异常; 3.让实验结果、设备日志和环境参数回流,成为下一轮模型与实验设计的输入。 科学问题→AI理解→实验方案→设备调度→执行→数据回流→模型优化→下一轮。 一套科学实验数据的飞轮,就这样启动了。 五大智能体,把科研流程「卷」成流水线 BioFord Agent具身智能科研平台,则向下连接实验室物理层,向上承载科学家认知层,中间用物理AI打通推理与执行的断层。 在认知层,BioFord Agent有五大智能体组成协同网络,打通了生命科学研究全流程,可数倍提高科研效率。 文献检索智能体 实验设计智能体 科学智能体 实验调度智能体 数据分析智能体 举个例子,文献检索智能体可以快速帮你检索和阅读海量文献,完成文献综述并辅助提出假设。 实验设计智能体让 科研团队把原本数月的实验设计周期缩短至一周。 而津渡生科推出的实验调度智能体,依托通用仪器抽象层(Universal Instrument Abstraction Layer),打破了多类异构设备之间的协议壁垒。 无论是PCR仪、酶标仪、流式细胞仪,还是自动化移液工作站,均可实现统一纳管与统一调度。系统内置动态调度算法,可自动批量排程、实时冲突规避,并全程记录实验参数,形成可追溯的审计链条。 这意味着,AI不再停留「出谋划策」的阶段,而是真正走进实验室,操纵设备、执行任务,成为一位可信赖的「科研助手」。 失败数据,也许比成功数据更珍贵 这套系统解决的更深层的价值在于:让每一次实验——无论成功还是失败——都变成系统可以消化的数据。 传统实验室里,一次失败的记录可能只是
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱