隨著生成式 AI 應用進入落地階段,企業採購 GPU 伺服器的評估重點,已逐步由單機效能轉向整體資源的配置效率與管理一致性。硬體到位之後,如何在多個團隊與專案之間合理分配算力、維持可接受的資源使用率,並建立一致的權限與稽核機制,往往成為導入期的主要瓶頸。
數位無限(INFINITIX) 的 AI-Stack 與 Supermicro 五款 GPU 伺服器搭配,涵蓋 3U MicroCloud 至 8U HGX 之完整產品級距,支援 NVIDIA 全系列與 AMD Instinct 系列等加速器。
合作背景

Supermicro 為全球高效能、高效率伺服器技術之領導廠商,提供涵蓋資料中心、雲端運算、企業 IT 與 AI 工作負載之端到端解決方案。就 AI-Stack 之導入需求而言,Supermicro 產品線具備兩項關鍵特質:
產品級距完整: 自單張加速卡之 3U MicroCloud 節點,至配置 8 顆 SXM GPU 之 8U HGX 機台,均由同一供應商提供。企業得以先行以小規模機型進行概念驗證,確認流程與效益後再逐步擴充,無須因規模變更而更換供應商或重建管理平台。
加速器選擇彈性: 同一機箱系列同時支援 NVIDIA PCIe 全系列與 AMD Instinct 加速器,與 AI-Stack 之異構算力納管能力相互對應。企業於採購階段無須因未來加速器選型之不確定性而受限於單一供應體系。
Supermicro x AI-Stack 平台總覽

SYS-821GE-TNHR|8U GPU 伺服器
- GPU 組態:板載 8 顆 SXM GPU
- 支援加速器:NVIDIA HGX H100 8-GPU(80GB)、NVIDIA HGX H200 8-GPU(141GB)
- 適用場景:大型模型訓練與微調、多節點叢集納管
本機型為產品線中之高階組態,主要用於大型語言模型之訓練與微調作業。AI-Stack 於此類平台之主要功能為跨節點任務排程,藉由排程佇列與優先序管理,降低任務交替期間 GPU 資源之閒置比例。

AS-5126GS-TNRT|5U GPU 伺服器
- GPU 組態:最多 8 張雙寬 PCIe 加速卡
- 支援加速器:NVIDIA H100 NVL、H200 NVL(141GB)、L40S、RTX PRO 6000 Blackwell Server Edition;AMD Instinct MI350P
- 適用場景:訓練與推論混合部署、異構加速器並存環境
本機型適用於訓練與推論混合之工作負載。其加速器支援範圍同時涵蓋 NVIDIA 與 AMD 產品,可於同一機櫃內並存,並由 AI-Stack 之單一控制平面統一納管,管理單位無須並行維護兩套管理工具。

AS-5126GS-TNRT2|5U GPU 伺服器
- GPU 組態:最多 10 張雙寬 PCIe 加速卡
- 支援加速器:同 AS-5126GS-TNRT(NVIDIA PCIe 全系列、AMD Instinct MI350P)
- 適用場景:高密度推論、多租戶資源共用
本機型為產品線中加速卡密度最高之組態,適用於高密度推論部署。於單機加速卡數量較多之情境下,透過 GPU 切割與配額管理所取得之資源使用率效益亦相對顯著。

SYS-422GA-NRT|4U GPU 伺服器
- GPU 組態:可配置 2 張四寬、2 張三寬、8 張雙寬或 10 張單寬加速卡
- 支援加速器:NVIDIA H200 NVL(141GB)、RTX PRO 4500 Blackwell Server Edition、RTX PRO 6000 Blackwell Max-Q Workstation Edition、RTX PRO 6000 Blackwell Server Edition
- 適用場景:研發與視覺化資源池、卡寬需求不一致之環境
本機型於 GPU 配置上具備較高彈性,適用於各團隊加速卡規格需求不一致之研發環境。無論實際混插組合為何,AI-Stack 對使用者端均呈現為單一資源池。

AS-3015MR-H5TNR|3U MicroCloud
- GPU 組態:每節點最多 1 張雙寬加速卡
- 支援加速器:NVIDIA Ada L4、NVIDIA L40S、NVIDIA RTX PRO 4500 Blackwell、AMD Radeon PRO R9700S
- 適用場景:邊緣推論、教學實驗室、部門級叢集
本機型採多節點架構,適用於邊緣推論與部門級小型叢集。該類部署之管理挑戰主要在於節點分散、缺乏統一管理介面;AI-Stack 可將多個節點納管為單一資源池,並提供一致之監控與配額機制。
解決方案架構
AI-Stack 位於加速器與使用者之間,架構上分為三層:
- 開發與生態層面向終端使用者,整合 Jupyter、VS Code、PyTorch、TensorFlow、vLLM、模型微調、實驗追蹤與推論服務端點等工具,使用者可自助申請所需環境。
- 控制層為 AI-Stack 之核心功能區,提供 GPU 切割、多租戶與角色權限管理(RBAC)、配額與專案管理、任務排程、監控與告警等機制,並可整合企業既有之 Kubernetes 或 OpenShift 環境;儲存架構支援 NFS 與 MinIO。
- 實體叢集層由 Supermicro 提供,包含前述五款伺服器機型、NVIDIA 全系列加速器,以及 AMD Instinct 系列。

方案效益
- GPU 資源使用率之提升: AI-Stack 可將單張 GPU 切割為多個獨立配額,提供多位使用者使用,切割後之資源相互隔離、互不干擾。同一台 Supermicro 機箱因此得以服務數倍之使用人數,並降低任務交替期間之資源閒置。
- 異構加速器之統一納管: NVIDIA HGX SXM 基板、H200 NVL、L40S、RTX PRO Blackwell 系列與 AMD Instinct 均由同一控制平面管理。企業變更加速器供應商時無須更換管理平台,可降低採購決策之技術鎖定風險。
- 環境建置時間之縮短: 使用者可自助申請容器化開發環境,包含整合開發工具、訓練框架與資料集掛載,無須逐案提交需求單等待人工設定,有助於縮短硬體上架至產出之前置期。
- 跨機型一致之管理平台: 單台 MicroCloud 節點與多節點 HGX 叢集共用同一管理介面、排程政策與配額機制。企業擴充機隊時無須重建管理平台,前期導入之流程與規範得以延續。
適用場景
- 企業 AI 平台: 製造、金融與醫療產業之多部門共用同伺服器,跨部門分配資源並可依專案歸屬運算成本。
- 學術與研究運算 大專院校及研究機構依實驗室或課程單位分配資源配額,使教學用途與研究用途得以共用同一批硬體資源。
- 主權與區域 AI 雲: 適用於資料不得離境之地端算力池部署,硬體與軟體均可取得在地技術支援。
進一步諮詢
若您正評估企業 AI 基礎設施之建置或擴充,歡迎提供預計運行之模型規模、既有或計畫採購之加速器組態,我們將協助對應合適之 Supermicro 平台與 AI-Stack 配置方案。