隨著生成式 AI 應用進入落地階段,企業採購 GPU 伺服器的評估重點,已逐步由單機效能轉向整體資源的配置效率與管理一致性。硬體到位之後,如何在多個團隊與專案之間合理分配算力、維持可接受的資源使用率,並建立一致的權限與稽核機制,往往成為導入期的主要瓶頸。

數位無限(INFINITIX) 的 AI-Stack 與 Supermicro 五款 GPU 伺服器搭配,涵蓋 3U MicroCloud 至 8U HGX 之完整產品級距,支援 NVIDIA 全系列與 AMD Instinct 系列等加速器。

合作背景

Supermicro 為全球高效能、高效率伺服器技術之領導廠商,提供涵蓋資料中心、雲端運算、企業 IT 與 AI 工作負載之端到端解決方案。就 AI-Stack 之導入需求而言,Supermicro 產品線具備兩項關鍵特質:

產品級距完整: 自單張加速卡之 3U MicroCloud 節點,至配置 8 顆 SXM GPU 之 8U HGX 機台,均由同一供應商提供。企業得以先行以小規模機型進行概念驗證,確認流程與效益後再逐步擴充,無須因規模變更而更換供應商或重建管理平台。

加速器選擇彈性: 同一機箱系列同時支援 NVIDIA PCIe 全系列與 AMD Instinct 加速器,與 AI-Stack 之異構算力納管能力相互對應。企業於採購階段無須因未來加速器選型之不確定性而受限於單一供應體系。

Supermicro x AI-Stack 平台總覽


解決方案架構

AI-Stack 位於加速器與使用者之間,架構上分為三層:

  • 開發與生態層面向終端使用者,整合 Jupyter、VS Code、PyTorch、TensorFlow、vLLM、模型微調、實驗追蹤與推論服務端點等工具,使用者可自助申請所需環境。
  • 控制層為 AI-Stack 之核心功能區,提供 GPU 切割、多租戶與角色權限管理(RBAC)、配額與專案管理、任務排程、監控與告警等機制,並可整合企業既有之 Kubernetes 或 OpenShift 環境;儲存架構支援 NFS 與 MinIO。
  • 實體叢集層由 Supermicro 提供,包含前述五款伺服器機型、NVIDIA 全系列加速器,以及 AMD Instinct 系列。

方案效益

  • GPU 資源使用率之提升:  AI-Stack 可將單張 GPU 切割為多個獨立配額,提供多位使用者使用,切割後之資源相互隔離、互不干擾。同一台 Supermicro 機箱因此得以服務數倍之使用人數,並降低任務交替期間之資源閒置。
  • 異構加速器之統一納管:  NVIDIA HGX SXM 基板、H200 NVL、L40S、RTX PRO Blackwell 系列與 AMD Instinct 均由同一控制平面管理。企業變更加速器供應商時無須更換管理平台,可降低採購決策之技術鎖定風險。
  • 環境建置時間之縮短:  使用者可自助申請容器化開發環境,包含整合開發工具、訓練框架與資料集掛載,無須逐案提交需求單等待人工設定,有助於縮短硬體上架至產出之前置期。
  • 跨機型一致之管理平台:  單台 MicroCloud 節點與多節點 HGX 叢集共用同一管理介面、排程政策與配額機制。企業擴充機隊時無須重建管理平台,前期導入之流程與規範得以延續。

適用場景

  • 企業 AI 平台:  製造、金融與醫療產業之多部門共用同伺服器,跨部門分配資源並可依專案歸屬運算成本。
  • 學術與研究運算  大專院校及研究機構依實驗室或課程單位分配資源配額,使教學用途與研究用途得以共用同一批硬體資源。
  • 主權與區域 AI 雲:  適用於資料不得離境之地端算力池部署,硬體與軟體均可取得在地技術支援。

進一步諮詢

若您正評估企業 AI 基礎設施之建置或擴充,歡迎提供預計運行之模型規模、既有或計畫採購之加速器組態,我們將協助對應合適之 Supermicro 平台與 AI-Stack 配置方案。