万博manbext网站登录app(中国)官方网站Rubin CPX 提供多种竖立-万博manbext网站登录 万博manbext体育官网注册账号

万博manbext网站登录app(中国)官方网站

企业每投资 1 亿好意思元,即可获取 50 亿好意思元的 token 收益。

作家 |  ZeR0裁剪 |  漠影

芯东西 9 月 10 日报谈,昨晚,英伟达又放 AI 瞎想大招,推出专为长险阻文推理和视频生成应用瞎想的新式专用 GPU ——NVIDIA Rubin CPX。

英伟达首创东谈主兼 CEO 黄仁勋说:"正如 RTX 绝对编削了图形和物理 AI 相似,Rubin CPX 是首款专为海量险阻文 AI 打造的 CUDA GPU,这种 AI 模子不错同期处理数百万个常识 token 的推理。"

Rubin CPX 配备128GB GDDR7 内存,NVFP4精度下 AI 算力可达30PFLOPS,颠倒相宜启动长险阻文处理(跳跃 100 万个 token)和视频生成任务。

Vera Rubin NVL144 CPX 平台可在单机架集成 144 张 Rubin CPX GPU、144 张 Rubin GPU、36 张 Vera CPU,提供8EFLOPS的 AI 性能(NVFP4 精度)和100TB的快速内存,内存带宽达到1.7PB/s。

其 AI 性能是英伟达 Vera Rubin NVL144 平台的2倍多,是基于 Blackwell Ultra 的 GB300 NVL72 系统的7.5 倍,比拟 GB300 NVL72 系统还能提供3 倍更快的把稳力机制。

Rubin CPX GPU 瞻望将于2026 年底上市。

9 月 17 日,智猩猩发起主理的 2025 全国 AI 芯片峰会将在上海举办。大会设有主论坛,大模子 AI 芯片、AI 芯片架构两大专题论坛,以及存算一体、超节点与智算集群两大时代洽商会,近 40 位嘉宾将共享和贪图。IEEE Fellow 王中风教悔将开场,华为昇腾等国产 AI 芯片力量结合,华为云、阿里云领衔超节点与智算集群势力。扫码报名 ~

01.全新专用 GPU:128GB 内存,30PFLOPS 算力

Rubin CPX 基于 NVIDIA Rubin 架构构建,摄取经济高效的单芯片瞎想,配备128GB GDDR7 内存,摄取NVFP4精度,并经由优化,算力可达30PFLOPS,省略为 AI 推理任务,尤其是长险阻文处理(跳跃 100 万个 token)和视频生成,提供了远超现存系统的性能和 token 收益。

与英伟达 GB300 NVL72 系统比拟,这款专用 GPU 还提供了3 倍更快的把稳力机制,从而擢升了 AI 模子处理更长险阻文序列的材干,况且速率不会裁减。

比拟之下,本年 3 月发布的 Rubin GPU,在 FP4 精度下峰值推理材干为 50PFLOPS。而英伟达在本年 6 月才公布改进型 4 位浮点神色 NVFP4,这种神色的谋略是在超低精度下奋力保捏模子性能。

其分析标明,当使用稽查后量化(PTQ)将 DeepSeek-R1-0528 从原始 FP8 神色量化为 NVFP4 神色时,其在关键话语建模任务上的准确率下跌幅度不跳跃 1%。在 AIME 2024 中,NVFP4 的准确率致使提高了 2%。

Rubin CPX 摄取的 GDDR7,价钱比 Rubin GPU 配备的 288GB HBM4 高带宽内存更低廉。

02.单机架 AI 性能达 30EFLOPS,提供 100TB 快速内存、1.7PB/s 内存带宽

Rubin CPX 与全新NVIDIA Vera Rubin NVL144 CPX 平台中的英伟达 Vera CPU 和 Rubin GPU 协同职责,进行生成阶段处理,酿成一个无缺的高性能剖析式处事科罚决议。

Vera Rubin NVL144 CPX 平台可在单机架集成 144 张 Rubin CPX GPU、144 张 Rubin GPU、36 张 Vera CPU,提供8EFLOPS的 AI 性能(NVFP4 精度)和100TB的快速内存,内存带宽达到1.7PB/s。

其 AI 性能是英伟达 Vera Rubin NVL144 平台的2倍多,是基于 Blackwell Ultra 的 GB300 NVL72 机架式系统的7.5 倍。

英伟达还在周二共享了 GB300 NVL72 系统的基准测试扫尾,其 DeepSeek-R1 推感性能擢升到上一代的 1.4 倍。该系统还创下 MLPerf Inference v5.1 套件中添加的悉数新数据中心基准测试的记载,包括 Llama 3.1 405B Interactive、Llama 3.1 8B、Whisper 的记载。

英伟达瞎想为但愿叠加使用现存 Vera Rubin 144 系统的客户配备专用的 Rubin CPX 瞎想托盘(tray)。

Rubin CPX 提供多种竖立,包括 Vera Rubin NVL144 CPX,可与 NVIDIA Quantum ‑ X800 InfiniBand 横向膨胀瞎想架构或搭载英伟达 Spectrum-XGS 以太网时代和 ConnectX-9 SuperNIC 的 Spectrum-X 以太网汇集平台结合使用。

英伟达瞻望将推出一款双机架居品,将 Vera Rubin NVL144 和 Vera Rubin NVL144 机架结合在沿途,将快速内存容量擢升至150TB。

03.为剖析式推理优化而生,与英伟达旗舰 GPU 搭配用  

这款全新的专用 GPU,跟英伟达之前发布的旗舰 GPU 有什么分歧?

据英伟达数据中心居品总监 Shar Narasimhan 共享,Rubin CPX 将动作英伟达的专用 GPU,用于险阻文和预填充瞎想,从而权臣擢升海量险阻文 AI 应用的性能。原版 Rubin GPU 则追究生成息争码瞎想。

推原理两个阶段构成:险阻文阶段和生成阶段。这两个阶段对基础法子的条目迥然相异。

险阻文阶段受瞎想材干截止,需要高浑沌量处理来索取和分析无数输入数据,最毕生成第一个 token 输出扫尾。

生成阶段受内存带宽截止,依赖于快速内存传输和高速互连(如 NVLink)来保管逐 token 输出性能。

剖析式推理使这些阶段省略零丁处理,从而兑现对瞎想和内存资源的有针对性的优化。这种架构回荡可提高浑沌量,裁减蔓延,并擢升举座资源愚弄率。

但剖析会带来新的复杂性,需要在低蔓延键值缓存传输、空话语模子感知路由和高效内存料理之间进行精准合营。

英伟达打造 Rubin CPX GPU,即是为了在瞎想密集型长险阻文阶段兑现专科的加快,并将该专用 GPU 无缝集成到剖析式基础架构中。

英伟达通过将 GPU 功能与险阻文和生成职责负载相结合来优化推理。

Rubin CPX GPU 专为高效处理长序列而优化,旨在增强长险阻文性能,补充现存基础架构,擢升浑沌量和反应速率,同期提供可膨胀的后果,并最大化大限度生成式 AI 职责负载的投资答复率(ROI)。

为了处理视频,AI 模子可能需要处理 1 小时骨子中多达 100 万个 token,这挑战了传统 GPU 瞎想的极限。Rubin CPX 将视频解码器和编码器以及长险阻文推理处理集成在单芯片中,为视频搜索和高质地生成视频等应用提供了前所未有的功能。

Rubin CPX 将省略启动 NVIDIA Nemotron 系列最新的多模态模子,为企业级 AI agent 提供起先进的推理材干。关于分娩级 AI,Nemotron 模子不错通过 NVIDIA AI Enterprise 软件平台请托。

04.结语:30~50 倍投资答复率,每投资 1 亿好意思元可带来 50 亿好意思元收益  

Vera Rubin NVL144 CPX 摄取英伟达 Quantum-X800 InfiniBand 或 Spectrum-X 以太网,搭配 ConnectX-9 SuperNIC 并由 Dynamo 平台合营,旨在为下一波百万 token 险阻文 AI 推理职责负载提供相沿,裁减推理成本。

在限度化运营下,该平台可兑现 30~50 倍的投资答复率,相配于每1 亿好意思元的老本开销即可带来高达50 亿好意思元的 token 收益。英伟达称这"为推理经济学开垦了新的标杆"。

Rubin CPX 将使 AI 编程助手节约单的代码生成器具回荡为省略兼并和优化大型软件技俩的复杂系统。

着名的好意思国 AI 编程平台 Cursor、AI 视频生成创企 Runway、AI 编程创企 Magic 等正在探索用 Rubin CPX GPU 加快他们的代码生成、复杂视频生成等应用。