TechSpace 鐵客空間

每日科技新聞新知、硬體開箱評測、賣場優惠!

算力完全制霸!NVIDIA Blackwell 橫掃 MLPerf 6.0 戰場,全新 GB300 效能再飆 60%

NVIDIA Blackwell 在 MLPerf 6.0 測試中大獲全勝!最新 GB300 系統性能比 GB200 還要高出 60%,展現無人能敵的 AI 算力。
nvidia blackwell sweeps mlperf 6 0 benchmark

NVIDIA Blackwell 新測試直球對決!DeepSeek 與 GPT-OSS 成為算力新考驗

在當前全球 AI 浪潮的軍備競賽中,NVIDIA 的技術壓制力看來依然讓對手望塵莫及。權威開源基準測試組織 MLCommons 剛發布了最新的 MLPerf Training v6.0 評測結果,這次的成績單簡直是 NVIDIA Blackwell 架構的個人秀。在所有嚴格測試中,Blackwell 不僅包辦了每項基準測試的榜首,更在多項全新指標中展現出令競爭對手直接「隱形」的誇張差距。

這次的 MLPerf 6.0 評測特別順應市場潮流,新增兩項針對混合專家模型(MoE)的測試項目,其中包括擁有高達 671B(6710 億)參數量的開源巨獸 DeepSeek V3,以及針對入門級部署、擁有 20B 參數的 GPT-OSS 20B。這些新測試原本是為了檢視各家硬體在大型 AI 部署上的實際戰力,沒想到卻成了 NVIDIA 宣示主權的舞台,在這些最尖端的技術指標中,其他晶片晶圓廠甚至連數據都無法繳出,直接選擇不提交成績。

NVIDIA 並沒有停下自我超越的腳步,透過底層軟體的持續優化,現有的 Blackwell 架構已經比剛上市時還要快上許多,而全新登場的 GB300 NVL72 系統,受惠於更強大的 NVFP4 量化技術,在相同的機架配置下,AI 計算密度大幅提升,其實際執行速度竟然比前代的 GB200 系統還要足足快上 60%。

nvidia blackwell sweeps mlperf 6 0 benchmark 1

談到大規模叢集的擴充性,NVIDIA 的表現同樣令人信服。雲端巨頭微軟 Azure 成功在雲端環境中,調動高達 8192 顆 GB200 NVL72 GPU,共同訓練參數高達 405B 的 Llama 3.1 模型,結果僅僅擴展到 7.07 分鐘就達到基準品質目標,寫下該項目最快的訓練紀錄。另一家 AI 算力新星 CoreWeave 也不甘示弱,同樣在 8192 顆 GB300 NVL72 GPU 的加持下,搭配 Spectrum-X 乙太網路技術,只花了短短 2.02 分鐘就完成 DeepSeek-V3 671B 的訓練,效率驚人。

如果我們把目光移向 AMD 旗下的 MI300 系列、甚至是最新發表的 MI355X 進行橫向對比,就能發現這條算力鴻溝有多麼巨大。以 Llama 3.1 8B 模型的測試為例,NVIDIA 靠著大規模配置只需要 4.46 分鐘就能收工,而最接近的競爭對手則需要耗費 58.63 分鐘才能完成,兩者之間的時差拉開到 13.1 倍。即便是輕量級的 Llama 2 70B LoRA 微調測試中,NVIDIA 不管是 4 卡、8 卡還是 16 卡的架構,每一階的處理時間都穩定超越對方的同級配置。而在影像生成模型 FLUX.1 的戰場上,NVIDIA 僅僅動用 32 顆 GB300 GPU 的運算速度,就超越了對手動用 512 顆 MI300X 的總體表現。在硬體與軟體優化雙管齊下所產生的絕對優勢,也預示次世代 Vera Rubin 平台將會繼續把全球 AI 算力的天花板往上推向另一個高峰。

快速 Q&A 整理

什麼是 MLPerf 6.0 測試?NVIDIA 在其中的表現如何?

MLPerf 是一個由 MLCommons 主導、同行評審的全球權威 AI 硬體效能基準測試。在最新 6.0 版本中,NVIDIA 的 Blackwell 架構橫掃所有 7 項基準測試,奪下全部的效能冠軍,是市場上唯一完整提交所有測試數據的平台。

NVIDIA 全新的 GB300 系統比 GB200 快多少?原因是什麼?

在相同的 NVL72 機架配置下,全新 GB300 系統的實際運算速度比 GB200 還要快上 60%。這主要歸功於 GB300 架構中導入了全新的 NVFP4 資料格式,大幅提升了 AI 的計算密度。

在大規模訓練中,NVIDIA Blackwell 實際繳出了什麼樣的成績?

在 8192 顆 GPU 的超大型叢集規模下,微軟 Azure 僅花 7.07 分鐘就完成了 Llama 3.1 405B 的訓練;而 CoreWeave 利用 GB300 搭配 Spectrum-X 網路,更只花 2.02 分鐘就訓完擁有 6710 億參數的 DeepSeek-V3 100% 任務。

NVIDIA 與競爭對手 AMD MI300 系統的實際差距有多大?

在 Llama 3.1 8B 測試中,NVIDIA 的配置僅需 4.46 分鐘,而競爭對手最快的方案則需要 58.63 分鐘,兩者差距高達 13.1 倍。在 FLUX.1 影像模型測試中,32 顆 GB300 的速度甚至超越了對手 512 顆 MI300X 的總和。

這次測試有加入哪些新的 AI 模型指標?對手有何反應?

MLPerf 6.0 新增了兩款熱門的開源混合專家模型(MoE)測試,分別是 DeepSeek V3(671B)與 GPT-OSS 20B。面對這兩項考驗高難度算力的全新指標,NVIDIA 的競爭對手並未提交任何實測數據。

延伸閱讀

歡迎加入我們的 Facebook 粉絲團,隨時掌握最新消息!
喜歡看圖說故事的話,也可以追蹤 Instagram 專頁!
我們也有 Threads 可以隨時 follow!

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *