企業評估 GPU 裸機租賃時,最常卡在 H100、H200、B200、B300 的選型。同一款 GPU 又可能以單卡、8 卡 HGX 或虛擬機交付。比較時應同時檢查模型能否放入記憶體、完成工作需要多少張 GPU,以及每次訓練或每百萬 Token 的總成本。
先給結論:
- H100:適合模型驗證、微調,以及軟體成熟度優先的工作負載。
- H200:適合受 80GB GPU 記憶體限制的大型模型與長 Context 推論。
- B200:適合已完成 Blackwell 軟體驗證,且需要高吞吐訓練或推論的團隊。
- B300:適合單卡需要超過 180GB 記憶體,以及 AI Reasoning、Test-time Compute 工作負載。
GPU 裸機租賃是什麼?
GPU 裸機租賃讓企業獨占實體伺服器資源,適合重視固定效能、資料隔離與環境控制權的工作負載。企業可自行管理 GPU、CPU、系統記憶體與本地儲存,不必與一般多租戶虛擬機共享同一套運算資源。
裸機通常適合以下需求:
- 需要固定且可預期的 GPU 效能
- 需要 Root 權限,自行安裝 CUDA、Driver、Docker 或 Kubernetes
- 需要使用 NVLink、NVSwitch 或 InfiniBand
- 執行長時間訓練或固定流量的推論服務
- 對資料隔離、軟體版本與維運權限有明確要求
H100、H200、B200、B300 規格與交付形式比較
對企業而言,H100、H200、B200 與 B300 的差異會影響模型能否放入單張 GPU、完成工作的速度,以及需要租用多少張 GPU。比較時再進一步查看記憶體、架構世代、交付單位與適用工作負載。
| 機型/架構 | GPU 記憶體規格 | 常見交付單位 | 主要適用情境 |
|---|---|---|---|
| NVIDIA H100 SXM(Hopper) | 80GB HBM3、約 3.35TB/s | 1 GPU、8 GPU HGX | 模型開發、微調、成熟訓練與推論 |
| NVIDIA H200 SXM(Hopper) | 141GB HBM3e、4.8TB/s | 1 GPU、8 GPU HGX | 大型模型、長 Context、記憶體受限工作負載 |
| NVIDIA B200 SXM(Blackwell) | 180GB HBM3e、最高 8TB/s | 8 GPU HGX;租賃平台可能提供較小使用單位 | 大型訓練、高吞吐推論、多模態模型 |
| NVIDIA B300 SXM(Blackwell Ultra) | 288GB HBM3e、最高 8TB/s | 8 GPU HGX B300 | AI Reasoning、超大型模型、Test-time Compute |
H100、H200、B200、B300、GB200、RTX PRO 6000 選型重點
- H100:軟體與部署經驗成熟,適合模型驗證、微調、RAG、影像生成與一般企業推論。單卡 80GB 記憶體不足時,需進一步評估 H200 或模型切分。
- H200:沿用 Hopper 軟體環境,單卡提供 141GB HBM3e,適合長 Context、較大的 Batch Size 或 KV Cache。實際可容納的模型仍受精度、量化與推論框架影響。
- B200:適合已完成 Blackwell 軟體驗證的大型訓練、高吞吐推論與多模態模型。是否能降低每 Token 成本,應以相同工作負載的 Benchmark 判斷。
- B300:單卡提供 288GB HBM3e,適合記憶體需求超過 B200、AI Reasoning 與 Test-time Compute 工作負載。評估時需確認軟體相容性、交付狀態及配套基礎設施。
- GB200 NVL72:整合 36 顆 Grace CPU 與 72 顆 Blackwell GPU,適合超大型模型訓練、推論及需要大量 GPU 高速互連的工作負載。這是液冷機櫃級系統,評估時應一併確認整櫃交付、供電、冷卻、網路與部署條件。
- RTX PRO 6000:提供 96GB GDDR7 ECC 記憶體,適合企業 AI 推論、微調、科學運算、3D 渲染與虛擬工作站。評估時應依工作負載比較記憶體容量與頻寬、多 GPU 互連,以及 vGPU 或 MIG 等資源切分需求。
KONST 對亞洲企業的算力規劃優勢
國際大型算力平台通常擁有大規模 GPU 叢集、成熟的雲端工具與跨區域資源,適合已有明確技術架構、能自行管理雲端環境的團隊。台灣企業評估這類服務時,還需要同步確認資料所在地、跨境連線、中文技術溝通、合約窗口及後續維運方式。
KONST(康斯特科技)提供 GPU 裸機租賃,以台灣團隊作為服務窗口,適合需要專屬運算資源、自訂環境與長期穩定算力的企業。服務涵蓋裸機配置、部署地點、租期與 SLA 選擇,並可依需求延伸至專屬 GPU 叢集、主機代管或 AIDC 建置。
這種彈性適合仍在驗證 AI 專案、預期算力規模會持續成長,或需要兼顧亞洲部署與地端基礎設施的企業。企業不必一開始就固定在單一交付模式,也能減少更換供應與交付窗口所需的溝通與整合成本。
GPU 租賃價格的評估基準
GPU 租賃成本會受到計費模式、最低承租單位、基礎設施費用、資源保障與有效產出率影響。企業可先用以下項目作為衡量基準,KONST 也可依工作負載,協助整理不同方案的完整成本與交付條件。
| 比較項目 | 應確認內容 |
|---|---|
| 計費模式 | Spot、On-demand、月租、Long-term contract 或 Reserved Capacity |
| 最低承租單位 | 單張 GPU、完整伺服器、8 GPU Node 或完整機櫃 |
| 中斷條件 | Spot 是否可能被收回;長任務能否續跑 |
| 包含項目 | CPU、RAM、本地 NVMe、共享儲存、網速、IP、技術支援 |
| 可用性 | 廠房 Tier 等級、可使用率保證、賠付條件是否合理 |
| 合約 | 最短租期、押金、付款條件、提前解約與擴充承諾 |
同一顆 H100 在不同平台的價格可能相差數倍,價差來自 GPU、最低承租單位、網路、支援、資源保障與計費模式。企業比較 GPU 租賃方案時,應使用相同模型與條件測試,再換算單位工作成本:
每百萬 Token 成本=包含 GPU、儲存、網路與必要服務的總費用 ÷ 實際完成的 Token 數 × 1,000,000
若是訓練任務,則比較完成指定 Epoch、資料量或目標 Loss 所需的總費用。
GPU 裸機選型的四個步驟
GPU 裸機選型應依序確認記憶體需求、工作負載類型、實際 Benchmark 與單位工作成本。
第一步:確認需要多少 GPU
先估算模型權重與 Batch Size。若單卡記憶體不足,再評估量化、模型切分或增加 GPU。
第二步:確認是訓練、微調或推論
訓練通常更重視 GPU 間通訊與儲存吞吐量;推論則需要同時觀察 Tokens/s、首字延遲(Time to First Token,TTFT)與併發量。
第三步:用實際模型執行 Benchmark
測試至少應記錄:
- GPU 型號、數量及儲存與網路配置
- 模型版本、量化精度與峰值 GPU 記憶體
- Input/Output Token 長度、Batch Size 與併發量
- Tokens/s、TTFT 或完成時間
- GPU 平均利用率
沒有相同測試條件,不宜直接比較不同供應商公布的效能數字。
第四步:比較單位工作成本
除了 GPU/hour,還要計入閒置時間、儲存、資料傳輸、環境部署、維運工時、長租折扣及中斷風險。最後比較每次訓練、每項任務或每百萬 Token 的成本。
KONST 如何協助 GPU 裸機選型與交付
KONST 的裸金屬平台提供全球供應商的裸機 GPU 伺服器配置瀏覽、篩選與比較,讓企業依機型與部署需求選擇專屬算力。
KONST 提供 Bronze、Silver 與 Gold 三種 SLA 等級,對應不同的可用性、硬體更換、技術支援與交付條件。KONST 的服務流程從需求訪談開始,再提出部署時程、規格與預估費用,並涵蓋建置、測試及上線後支援。
進入詢價後,KONST 會從工作負載回推合適的 GPU 與部署條件,進一步核對實際所在地、最低承租單位、網路、SLA 與交付條件。
聯絡我們,填寫您的資訊與需求,康斯特團隊將在 3 個工作日內聯繫您。
相關產品與服務:GPU 裸機租賃。
FAQ
H100 和 H200 應該怎麼選?
H100 適合模型驗證、微調與軟體成熟度優先的工作負載;模型受 80GB 記憶體限制、需要較長 Context 或較大的 KV Cache 時,可優先評估 141GB HBM3e 的 H200。最終仍應以相同模型與推論條件實測。
B200 一定比 H200 更划算嗎?
不一定。B200 適合能運用 Blackwell 架構與低精度能力的高吞吐訓練或推論;若軟體尚未完成相容性驗證,或工作負載無法發揮其效能,H200 的單位工作成本可能更合適。
GPU 裸機和 GPU Cloud 有什麼差別?
GPU 裸機讓企業獨占實體伺服器資源,適合需要 Root 權限、固定效能與自訂叢集環境的團隊;GPU Cloud 通常提供較彈性的開通與計費方式。詢價時仍需確認資源是否獨占、最低承租單位及維運責任。
- GPU
- Bare Metal
- H100
- H200
- Blackwell
KONST Editorial Team
AIDC Engineering



