首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

不抢最贵GPU,专捡“没人要”的算力:前英伟达工程师搞出一套“拾荒者”打法

2026-08-31 1 阅读 约10分钟阅读 褚杏娟
分享:
字号:
当一群 Agent不需要休息时,每秒输出 100 个 Token 还是 10 个 Token 没那么重要,真正重要的是:同样 1 美元,到底可以买到多少“智能”。这是“算力拾荒者” Neil Movva 的想法。 Neil Movva 毕业于 Stanford University,获得电气工程学士和硕士学位。早在 2016、2017 年,他就在 Nvidia 从事深度学习架构和 GPU 性能优化,研究 Volta GPU、训练工作负载和底层算子,曾将 BatchNorm 性能做到比公开版 cuDNN 最多快约 20%。此后他进入 Apple 从事深度学习和低延迟推理,又来到 Together AI,成为其最早的内核工程师之一,参与构建大语言模型推理基础设施。 2025 年底,他与 Stanford 同学 Samir Menon 再次走到一起,开始从头重做一套为长程 Agent 设计的推理基础设施。2026 年 6 月,Sail Research 正式披露累计 8000 万美元种子轮和 A 轮融资,估值达到 4.5 亿美元:种子轮由 Sequoia Capital 领投,A 轮由 Kleiner Perkins 领投,投资者还包括 Redpoint、Theory Ventures、CRV 等,Alphabet 董事长 John Hennessy、Intel CEO Lip-Bu Tan、Together AI 首席科学家 Tri Dao 也以个人投资者身份入场。 所谓“算力拾荒者” 哲学,就是“没有坏芯片,只有坏价格。”别人抢最贵的 Nvidia GPU,Neil 则研究 AMD、TPU、Trainium 和各种新型加速器;别人要求数据中心达到极高可用率,Neil 认为后台 Agent 甚至可以接受 95%、在足够便宜时可能接受更低的可用率;别人嫌弃零散电力、间歇性的风能和太阳能,而他希望把这些没人愿意碰的芯片、电力和小型数据中心全部聚合起来。因为当任务本来就要运行几个小时,偶尔多等几分钟,可能远没有成本下降重要。 Neil 在Invest Like The Best播客中谈到了 Transformer、 KV Cache 、GPU 内核、Nvidia、AMD、Cerebras,再谈到晶圆厂、小型数据中心、太阳能与风能。他的核心判断也贯穿始终:极致压低Token成本、盘活全球闲置算力、解锁无上限的后台智能消耗。 此外,他也表示,理论上英伟达完全可以不断提价,把有限产能优先卖给资金实力最雄厚的客户。但英伟达更看重长期利益:如果少数大客户拿走过多GPU,可能逐渐积累过强的算力和议价权,反而破坏整个生态。与此同时,关系和信用也成为获得大规模算力的重要门槛。 这种策略也延伸到英伟达对下游业务的克制。Neil认为,Nvidia并不急于亲自做NeoCloud或直接向终端用户出售Token,因为这等于与CoreWeave等客户竞争。相比多赚一层利润,英伟达更希望扶持一批彼此竞争的云厂商和推理服务商:即使其中一家未来选择自研、垂直整合或转向AMD,仍有其他客户可以迅速补位。 下面对话详情,我们进行了翻译并在不改变原意基础上进行了删减,以飨读者。 Token 只是起点,速度没有想的重要 主持人:既然今天讨论的主题是 Token 成本,你觉得“每 Token 成本”是理解这件事最合适的指标吗?还是你会用别的方式来定义? Neil Movva:至少在今天,我的北极星指标非常直接:我要把每 Token 成本做到全行业最低,而且要低出一大截。 我不认为 Token 会是最终衡量“工作”或者“智能”的单位,但它确实是我们今天在用的单位。再往后,衡量标准会逐渐向“结果”靠拢,虽然这个方向现在还比较模糊。比如今天你通过智能体消费 Token,其实不会直接控制智能体到底要思考多少 Token。它可能思考一段时间,也可能调用一定数量的工具。 未来越来越可能出现这样的模式:智能体负责完成某个工作单元,为了达到结果可以尽可能多次尝试,而最终用了多少 Token,会变成由任务本身决定的因变量。 主持人:也就是说,与其由公司规定“工程师每个月最多能花多少 Token”,不如让智能体自己管理完成任务所需的 Token 预算。可问题是,为什么这里还有一个你们可以切入的机会?全世界现在都在追求更多、更好、更快、更便宜的 Token,市场已经在非常激烈地解决这个问题。你看到的独特窗口是什么?市场在哪些地方还没有做到高效? Neil Movva:我认为有两个重要的有利因素。第一个必须先讲开源的崛起。越来越多客户以及整个市场开始在意“拥有自己的智能”。他们希望对自己依赖的智能能力拥有控制权和主权。这就催生出了更成熟的定制模型市场,以及原生开源模型市场。这些模型不会被任何人从你手里拿走:权重永远在你手里,你始终有权按自己的方式部署。 过去几年,大规模托管这些开源模型已经形成了一个相当成熟的市场。问题是,无论你看哪家公司,比如 Baseten、Fireworks AI、Together AI,大家过去都主要围绕低延迟推理优化。之所以这样,一个非常重要的客户就是 Cursor。 大约 1 年前,这个选择是对的。但从大约 6 个月前开始,我们逐渐发现,智能体需要的并不只有低延迟,还需要更强的持续运行能力和更长的任务时程。 这个趋势现在已经很明显:智能体推理的未来属于长时程任务,机器会连续运行几个小时甚至几天。在这种情况下,它到底是每秒输出 100 个 Token,还是每秒 10 个 Token,并没有那么重要。后者反而会带来相应的效率和成本优势。 主持人:你为什么这么确定?从用户角度,我似乎还是希望所有东西越快越好。 Neil Movva:当你坐在那里等结果时,你当然应该得到尽可能快的回答。我的办法是:我根本不希望你等它。 我希望智能体是主动的,在后台运行。换一种说法,最好的延迟就是“没有延迟”。你早上醒来,工作已经在夜里完成了,甚至不需要主动提出请求。这才是我们想达到的状态,当然今天还没有完全做到。 更重要的是,只要人还在不断给智能体发提示、等回复,人实际上就成了限制智能体工作量的瓶颈。我们希望智能体按照更接近人类协作的时间尺度运行。你不会每隔 5 分钟跟同事沟通一次。你会给他一个高层任务,然后过一天看看进度,甚至更可能一周后再检查一次。我认为,这才是未来人与智能体协作的形态。 主持人:有哪些早期迹象让你相信这种趋势真的正在发生,也因此值得围绕它建立一家公司? Neil Movva:首先也是最重要的一点,是测试时计算扩展:给智能体更多时间,它往往能够给你更好的答案。 这个想法大概 2 年前就已经有人提出,但真正让我觉得可以押注的时间,是从去年年底 Opus 4.5 出现后。Opus 4.5 是第一个勉强适合较长时程任务的智能体模型。刚出来时它其实也很一般,但再看最近的模型,以及我们在开源侧做的工作,你会发现智能体已经可以比较合适地连续运行 1 个小时。我不会说今天已经能稳定运行几天,但 1 个小时是完全现实的。 当平均轮次和任务长度越来越长时,并不需要太多数据点,你就能顺着趋势画出那条指数曲线,看到智能体值得运行得越来越久。 主持人:如果看 3 年
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱