← 技術文章
虛擬化與機房 2026-08-15 · 約 8 分鐘

GPU 要怎麼分給虛擬機?直通、vGPU 還是 MIG

同一張卡要餵給多少個工作負載,答案不只是「切開」。這篇比較直通、vGPU、MIG 三條路的真實代價——包含很多人到採購後期才發現的授權費,以及我們自己在 GPU 直通上踩過、而且不會出現在官方文件裡的坑。

GPU虛擬化Proxmox VENVIDIA vGPUMIGGPU 直通AI 基礎設施

買了 GPU 之後,第一個技術問題通常不是「跑得多快」,而是「這張卡要怎麼給虛擬機用」。

答案有三條路,而且它們的差別不只是技術——其中一條要另外付授權費,而那筆錢很多人是到採購後期才發現的

三條路的本質差別

一句話分辨:直通是「整張給你」,vGPU 是「軟體排隊」,MIG 是「硬體切開」。

直通:最快,但不能分

直通在 KVM 與 VMware ESXi 上可達裸機效能的 96–100%。代價很直接:一張卡只能給一台虛擬機,沒有共享空間。

這條路適合的情境很明確:單一工作負載要吃滿整張卡。像是地端大語言模型推論、影像模型訓練、單一使用者的高階繪圖工作站。

vGPU:能分,但要付授權費

vGPU 讓多台虛擬機共用一張卡。每個 vGPU 拿到固定份額的顯示記憶體,並可存取全部的 SM 與媒體引擎;多個 vGPU 同時跑的時候,驅動層依排程政策做上下文切換——依卡上設定的 vGPU 數量,每秒切換 480 或 960 次

這裡有一件事要先講清楚:

vGPU 在硬體成本之外,還要付 NVIDIA 的軟體授權費。

授權以並行使用者(CCU)計價,可年租或永久授權,也可以按每 GPU 每年計價。以訂閱制的公開定價來說,vApps、vPC、RTX vWS 三個版本分別是每 CCU 每年 10、50、250 美元

換算一下:50 個並行使用者的 RTX vWS,一年就是 12,500 美元——而且這是在顯示卡錢之外

這不代表 vGPU 不值得用。如果你要做的是 VDI(幾十個人共用繪圖資源),這條路本來就是為此設計的。但如果你的用途是「幾個 AI 服務要分一張卡」,先把這筆授權費算進總成本再決定

另外一個好消息:自 vGPU 軟體第 18 版起,Proxmox VE 已是 NVIDIA 官方支援的平台,時間切片與 MIG 後端的 vGPU 都能設定。這在幾年前還不是這樣。

MIG:隔離最好,複雜度也最高

MIG 在硬體層把 GPU 切成獨立分區,隔離性是三者中最強的——一個分區的工作負載不會影響另一個。

新一代硬體還能疊加:自 RTX PRO 6000 Blackwell Server Edition 起,可以在 MIG 分割出的執行個體上再建立時間切片 vGPU,換取更高密度的小型 vGPU 與更好的分區隔離。

但代價是維運複雜度最高。管理者必須同時對齊這些東西:

伺服器認證、GPU 型號、韌體、vGPU Manager、來賓端驅動、授權服務、MIG 模式、 GPU Instance 設定檔、vGPU 設定檔、Hypervisor、來賓作業系統、遷移行為。

這串清單裡任何一項版本對不上,你就會遇到一個很難查的問題。

我們的實際經驗:直通

先把範圍講清楚:我們的生產環境走 GPU 直通,多張不同世代的 NVIDIA 卡分別直通給不同虛擬機,承載地端大語言模型推論、語音辨識與影像處理。vGPU 與 MIG 我們沒有生產部署,所以上面兩段談的是公開資料與規格,這一段才是實測。

直通看起來是三條路裡最單純的,但有兩個坑不會寫在官方文件裡。

坑一:機器類型與韌體,缺一不可

要讓直通成功,虛擬機的機器類型必須是 q35、韌體必須用 OVMF(UEFI)

用預設的 i440fx 會失敗——而且錯誤訊息不會告訴你原因。你會看到卡沒出現、或是驅動裝不起來,然後花很久時間往驅動的方向查,其實問題在虛擬機的機器設定。

坑二:驅動自動更新會讓卡「消失」

這個更陰險。

Ubuntu 的 unattended-upgrades 會自動升級 NVIDIA 驅動,但不會重新載入核心模組。結果是:虛擬機裡 nvidia-smi 突然回報 0 張卡,GPU 服務全掛——而你什麼都沒動

最難的地方在於,你根本不會想到去查「昨天半夜自動更新了什麼」。從現象看,那就是一張好好的卡突然不見了。

我們的處置是兩件事:把驅動版本鎖住,以及在監控裡加上 GPU 健康檢查——讓「卡不見了」這件事會主動通知,而不是等服務報錯才發現。

這其實跟儲存那邊的教訓是同一件事:

最危險的故障不是壞掉,是安靜地不工作。

怎麼選:四個問題

1. 一個工作負載會不會吃滿整張卡? 會 → 直通。不要為了「聽起來比較有彈性」去切它,切了只會讓效能和維運都變差。 不會 → 往下問。

2. 你的使用者是「幾十個人共用繪圖」還是「幾個服務分算力」? 幾十個人(VDI 場景)→ vGPU 是為此設計的,授權費在這個規模下通常划算。 幾個服務 → 先算授權費。有時候「多買一張中階卡直通」比「一張高階卡切 vGPU 加授權」還便宜,而且簡單很多。

3. 你需要硬體等級的隔離嗎? 需要(多租戶、合規要求分離)→ MIG。 不需要 → 別碰,那串版本對齊清單不值得。

4. 出事時誰來查? 這題跟前三題一樣重要。直通壞掉查兩層(虛擬機設定、驅動);MIG 後端 vGPU 壞掉要查十幾層。如果半夜只有一個人待命,複雜度就是風險。

最後

2024 年談這題時,重點還在「vGPU 能做什麼」。2026 的重點已經變成「這三條路的總成本與維運負擔,你扛得起哪一條」。

技術上三條都可行,差別在你的團隊、你的預算、還有你能接受多複雜的故障排除。

如果你正在規劃 GPU 要怎麼配置,或是已經在跑但遇到「卡突然不見」這類問題,我們可以直接談實際的組態與監控做法。

關於這篇文章:本文改寫自 2024 年 8 月發表的〈NVIDIA VIRTUAL GPU 介紹〉。原文是產品功能介紹,2026 年讀者真正的問題已經變成「三條路怎麼選」,因此改以決策角度重寫,並補上我們自己在直通上的實測經驗。外部數據的出處與查證日期列於文末。

本文改寫自本站 2024-08-05 發表於 /introduction-nvidia-vgpu/ 的舊文,原文已停止維護。

需要有人幫你把這件事做完?

昶睿科技提供地端 AI 與基礎設施的規劃、建置與維運。資料不出機房、可稽核、廠牌中立。

預約 30 分鐘諮詢
昶睿 AI 客服×
由地端私有 LLM 即時回覆 · 資料不出機房 · 隱私權政策