
4.8 倍推理吞吐背后的代际切换:Rubin NVL72 走进生产环境
9 月 30 日,AI 云服务商 CoreWeave 在其年度大会 Fully Connected(旧金山,超 4500 名开发者与企业客户参会)上宣布:NVIDIA Vera Rubin NVL72 平台已在其云上进入有限可用(limited availability)阶段,Cognition——知名 AI 编程智能体 Devin 背后的公司——成为全球首个在 Rubin 上跑生产工作负载的客户。
目前 CoreWeave 已在多个区域部署了数百块 Rubin GPU,并开始接收生产级 AI 工作负载。Cognition 从 9 月初就与 CoreWeave 团队一起完成了 Vera Rubin NVL72 集群的搭建,并在其上运行了首个由客户独立执行的 Rubin 推理基准测试。
4.8 倍与 3.8 倍,但有个重要限定条件
Cognition 工程师对比了 Rubin NVL72 与上一代 GB200 NVL72 在同一套软件栈下的表现,测得:
- SWE-2 推理任务:在保持相同交互响应速度的前提下,每块 GPU 的总 Token 吞吐量提升 4.8 倍;
- 强化学习训练任务:每块 GPU 的输出 Token 吞吐量提升 3.8 倍。
两点需要冷静看待:第一,"保持相同交互响应"的限定很关键——这意味着不是用户感受快了 4.8 倍,而是同样响应速度下,一块卡能同时服务更多请求,吞吐翻几倍;第二,这些数字来自 Cognition 自己的工作负载测量,属于厂商客户声明而非第三方独立验证。
Cognition 的工程副总裁 Silas Alberti 说得很直白:"对 Devin 这样的智能体编码场景,每个步骤都依赖上一步的推理结果,吞吐量的提升会复利般转化为真实完成的工作量。"用更实在的话说:每块卡能同时跑的 Devin 会话更多了,强化学习的实验周期更短,每次会话的成本更低。
Rubin 到底是什么?

Vera Rubin NVL72 是英伟达 Blackwell 之后的新一代机架级 AI 平台,一个机架内集成 72 块 Rubin GPU 和 36 颗 Vera CPU,配 20.7TB HBM4 显存、约 1400TB/s 的显存聚合带宽、第六代 NVLink 机架级互连(216TB/s),网络侧搭配 ConnectX-9 网卡和 BlueField-4 DPU。整个平台从设计目标上就是为"大规模 MoE 模型、强化学习、长上下文推理和智能体推理"这四类新工作负载准备的。
从时间线看,这次并非纸上谈兵:CoreWeave 早在 2026 年 6 月初就完成了 Rubin 平台的首次点亮与验证,7 月 21 日发布了第一批实测硅片数据(用 DeepSeek R1、开专家并行、NVFP4、推测解码等技术组合跑出),9 月底终于跨过从"能跑"到"能卖"的一步——有真实客户的生产负载跑起来。
值得一提的是 Cognition 的增长节奏:过去不到 9 个月,它在 CoreWeave 上的算力从小规模测试容量一路扩张到数千块 GPU 级别的训练与推理集群。这种"小步验证、快速放量"的扩产模式,正是目前 AI 实验室的典型用卡姿势。
深度分析:为什么这次发布值得关注

第一,硬件竞争进入"推理效能"主战场。训练集群拼的是绝对算力,而 Rubin 发布的两个核心数字都与推理相关——这恰恰说明行业重心正在迁移:模型规模接近天花板后,真正卡脖子的不是"能不能训练出模型",而是"能不能便宜、快速、并发地服务它"。谁的每瓦特 Token 成本低,谁就能在 AI 服务价格战中活下来。Rubin 4.8 倍的推理吞吐,卖的其实是下一张 AI 商业化的船票。
第二,云服务商成为硬件厂商的"代际放大器"。细看这次新闻的叙事结构:发新闻的是 CoreWeave(云服务商),测数据的是 Cognition(客户),英伟达只提供了平台。AI 算力的商业化链路已经非常清晰:芯片厂造平台、云服务商做工程化上架、大客户跑生产验证。CoreWeave 们真正的护城河不是 GPU 本身,而是"把新一代硬件在几个月内变成可售卖的生产服务"的能力——Rubin 从 6 月点亮到 9 月卖生产容量,只用了三个多月,这本身就是一个信号。
第三,智能体场景在倒逼硬件设计。传统大模型推理是"一次问答",而智能体是"成千上万次连续调用":长上下文、高并发、连续推理。Rubin 的规格书里直接把"智能体推理"列为核心设计目标,说明硬件路线图已经把智能体场景当成第一优先级需求。这与 Cognition 用 SWE-2(自主软件工程师)当基准负载的做法互相印证——未来硬件的性能标尺,可能不再是 MLPerf 上的通用分数,而是"能跑多少个 Devin"。
三个悬念
悬念一:真实产能何时放量。目前是"有限可用",数百块卡对几个核心客户排队还行,远谈不上满足市场。Rubin 的放量节奏将决定 2027 年推理算力价格的走向。
悬念二:对手的反击。AMD、谷歌 TPU 以及各家定制 ASIC 都在紧盯推理效率,Rubin 的价格效率优势能维持多久,是下个财季财报电话会必然被追问的问题。
悬念三:AI 编程工具的"算力军备竞赛"。Cognition 拿到 4.8 倍吞吐后,Devin 的会话并发与成本结构都会改善——AI 编程智能体的竞争,正在从"模型谁更强"变成"谁的算力更便宜、更多"。这一步,Cognition 先迈了出去。
结语
从 6 月点亮、7 月出数、到 9 月底真正为客户跑生产任务,Rubin 用三个月走完了"从实验室到生产线"的最后一段路。4.8 倍的吞吐数字或许有水分,但方向不会错:AI 竞赛的下一幕,比拼的不是谁的模型参数最大,而是谁的推理又快又便宜。Rubin 投产,就是英伟达对这场新竞赛的第一份答卷。