생성형 AI 애플리케이션이 실제 도입 단계에 접어들면서 기업의 GPU 서버 구매 평가 기준은 단일 서버의 성능에서 전체 리소스의 배치 효율성과 관리 일관성으로 점차 전환되고 있습니다. 하드웨어 도입 후 여러 팀과 프로젝트에 컴퓨팅 리소스를 합리적으로 할당하고, 적정 수준의 리소스 사용률을 유지하며, 일관된 권한 및 감사 체계를 구축하는 일이 도입 단계의 주요 병목으로 작용하는 경우가 많습니다.
INFINITIX 의 AI-Stack은 Supermicro의 GPU 서버 5종과 연동되며, 3U MicroCloud부터 8U HGX까지 전체 제품군을 아우르고 NVIDIA 전 제품군과 AMD Instinct 시리즈 등의 가속기를 지원합니다.
협력 배경

Supermicro는 고성능·고효율 서버 기술을 선도하는 글로벌 기업으로, 데이터센터, 클라우드 컴퓨팅, 엔터프라이즈 IT 및 AI 워크로드를 아우르는 엔드투엔드 솔루션을 제공합니다. AI-Stack 도입 요구사항의 관점에서 Supermicro 제품군은 다음 두 가지 핵심 특성을 갖추고 있습니다.
제품군의 완전성: 단일 가속기 카드를 탑재한 3U MicroCloud 노드부터 8개의 SXM GPU를 구성한 8U HGX 시스템까지 모두 동일한 공급업체가 제공합니다. 기업은 먼저 소규모 시스템으로 개념 검증을 진행하고, 프로세스와 효과를 확인한 후 단계적으로 확장할 수 있습니다. 규모 변경으로 인해 공급업체를 교체하거나 관리 플랫폼을 다시 구축할 필요가 없습니다.
유연한 가속기 선택: 동일한 섀시 제품군에서 NVIDIA PCIe 전 제품군과 AMD Instinct 가속기를 모두 지원하며, 이는 AI-Stack의 이기종 컴퓨팅 리소스 관리 역량과 대응됩니다. 기업은 구매 단계에서 향후 가속기 선택의 불확실성으로 인해 단일 공급 체계에 제한될 필요가 없습니다.
Supermicro x AI-Stack 플랫폼 개요

SYS-821GE-TNHR|8U GPU
- GPU 구성: 온보드 SXM GPU 8개
- 지원 가속기: NVIDIA HGX H100 8-GPU(80GB), NVIDIA HGX H200 8-GPU(141GB)
- 적용 시나리오: 대규모 모델 학습 및 미세 조정, 멀티 노드 클러스터 관리
이 모델은 제품군의 고급 구성으로, 주로 대규모 언어 모델의 학습 및 미세 조정 작업에 사용됩니다. 이러한 플랫폼에서 AI-Stack의 주요 기능은 노드 간 작업 스케줄링이며, 스케줄링 대기열과 우선순위 관리를 통해 작업 전환 기간의 GPU 리소스 유휴 비율을 낮춥니다.

AS-5126GS-TNRT|5U GPU
- GPU 구성: 최대 8개의 듀얼 슬롯 PCIe 가속기
- 지원 가속기: NVIDIA H100 NVL, H200 NVL(141GB), L40S, RTX PRO 6000 Blackwell Server Edition, AMD Instinct MI350P
- 적용 시나리오: 학습 및 추론 혼합 배포, 이기종 가속기 공존 환경
이 모델은 학습과 추론이 혼합된 워크로드에 적합합니다. NVIDIA와 AMD 제품을 모두 지원하므로 동일한 랙 내에 함께 구성할 수 있으며, AI-Stack의 단일 제어 평면을 통해 통합 관리할 수 있습니다. 이에 따라 관리 부서는 두 가지 관리 도구를 병행하여 유지할 필요가 없습니다.

AS-5126GS-TNRT2|5U GPU
- GPU 구성: 최대 10개의 듀얼 슬롯 PCIe 가속기
- 지원 가속기: AS-5126GS-TNRT와 동일(NVIDIA PCIe 전 제품군, AMD Instinct MI350P)
- 적용 시나리오: 고밀도 추론, 멀티테넌트 리소스 공유
이 모델은 제품군 중 가속기 카드 밀도가 가장 높은 구성으로, 고밀도 추론 배포에 적합합니다. 단일 서버에 탑재되는 가속기 카드 수가 많은 환경에서는 GPU 분할과 할당량 관리를 통한 리소스 사용률 개선 효과도 상대적으로 큽니다.

SYS-422GA-NRT|4U GPU
- GPU 구성: 쿼드 슬롯 2개, 트리플 슬롯 2개, 듀얼 슬롯 8개 또는 싱글 슬롯 가속기 10개 구성 가능
- 지원 가속기: NVIDIA H200 NVL(141GB), RTX PRO 4500 Blackwell Server Edition, RTX PRO 6000 Blackwell Max-Q Workstation Edition, RTX PRO 6000 Blackwell Server Edition
- 적용 시나리오: 연구개발 및 시각화 리소스 풀, 카드 슬롯 폭 요구사항이 서로 다른 환경
이 모델은 GPU 구성 유연성이 높아 팀별로 요구하는 가속기 카드 사양이 서로 다른 연구개발 환경에 적합합니다. 실제 혼합 장착 구성이 어떠하든 AI-Stack은 사용자에게 이를 하나의 리소스 풀로 제공합니다.

AS-3015MR-H5TNR|3U MicroCloud
- GPU 구성: 노드당 최대 1개의 듀얼 슬롯 가속기
- 지원 가속기: NVIDIA Ada L4, NVIDIA L40S, NVIDIA RTX PRO 4500 Blackwell, AMD Radeon PRO R9700S
- 적용 시나리오: 엣지 추론, 교육 실습실, 부서 단위 클러스터
이 모델은 멀티 노드 아키텍처를 채택하여 엣지 추론과 부서 단위의 소규모 클러스터에 적합합니다. 이러한 유형의 배포에서 주요 관리 과제는 노드가 분산되어 있고 통합 관리 인터페이스가 부족하다는 점입니다. AI-Stack은 여러 노드를 하나의 리소스 풀로 관리하고 일관된 모니터링 및 할당량 체계를 제공할 수 있습니다.
솔루션 아키텍처
AI-Stack은 가속기와 사용자 사이에 위치하며, 아키텍처는 세 개 계층으로 구성됩니다.
- 개발 및 생태계 계층은 최종 사용자를 대상으로 하며 Jupyter, VS Code, PyTorch, TensorFlow, vLLM, 모델 미세 조정, 실험 추적 및 추론 서비스 엔드포인트 등의 도구를 통합합니다. 사용자는 필요한 환경을 직접 신청할 수 있습니다.
- 제어 계층은 AI-Stack의 핵심 기능 영역으로, GPU 분할, 멀티테넌트 및 역할 기반 권한 관리(RBAC), 할당량 및 프로젝트 관리, 작업 스케줄링, 모니터링 및 알림 등의 기능을 제공합니다. 또한 기업의 기존 Kubernetes 또는 OpenShift 환경과 통합할 수 있으며, 스토리지 아키텍처는 NFS와 MinIO를 지원합니다.
- 물리적 클러스터 계층은 Supermicro가 제공하며, 앞서 설명한 5종의 서버 모델과 NVIDIA 전 제품군 가속기, AMD Instinct 시리즈로 구성됩니다.

솔루션 효과
- GPU 리소스 사용률 향상: AI-Stack은 단일 GPU를 여러 개의 독립된 할당량으로 분할하여 여러 사용자가 사용할 수 있도록 합니다. 분할된 리소스는 서로 격리되어 간섭하지 않습니다. 이에 따라 동일한 Supermicro 섀시에서 수배에 달하는 사용자를 지원할 수 있으며, 작업 전환 기간의 리소스 유휴 상태도 줄일 수 있습니다.
- 이기종 가속기 통합 관리: NVIDIA HGX SXM 베이스보드, H200 NVL, L40S, RTX PRO Blackwell 시리즈 및 AMD Instinct를 하나의 제어 평면에서 관리합니다. 기업이 가속기 공급업체를 변경하더라도 관리 플랫폼을 교체할 필요가 없어 구매 결정에 따른 기술 종속 위험을 줄일 수 있습니다.
- 환경 구축 시간 단축: 사용자는 통합 개발 도구, 학습 프레임워크 및 데이터세트 마운트를 포함한 컨테이너 기반 개발 환경을 직접 신청할 수 있습니다. 건별로 요청서를 제출하고 수동 설정을 기다릴 필요가 없어 하드웨어 설치부터 결과 도출까지의 준비 기간을 단축하는 데 도움이 됩니다.
- 시스템 모델 전반에 걸친 일관된 관리 플랫폼: 단일 MicroCloud 노드와 멀티 노드 HGX 클러스터가 동일한 관리 인터페이스, 스케줄링 정책 및 할당량 체계를 공유합니다. 기업은 장비를 확충할 때 관리 플랫폼을 다시 구축할 필요가 없으며, 초기 도입 단계에서 수립한 프로세스와 규정을 그대로 유지할 수 있습니다.
적용 시나리오
- 기업 AI 플랫폼: 제조, 금융 및 의료 산업의 여러 부서가 동일한 서버를 공유하고, 부서 간 리소스를 할당하며 프로젝트별로 컴퓨팅 비용을 귀속할 수 있습니다.
- 학술 및 연구 컴퓨팅: 대학과 연구기관이 연구실 또는 강의 단위로 리소스 할당량을 배분하여 교육용과 연구용으로 동일한 하드웨어 리소스를 공유할 수 있습니다.
- 소버린 및 지역 AI 클라우드: 데이터를 국외로 반출할 수 없는 온프레미스 컴퓨팅 리소스 풀 구축에 적합하며, 하드웨어와 소프트웨어 모두 현지 기술 지원을 받을 수 있습니다.
추가 문의
기업 AI 인프라의 구축 또는 확장을 검토하고 있다면 운영 예정인 모델 규모와 현재 보유 중이거나 구매할 예정인 가속기 구성을 알려주시기 바랍니다. 적합한 Supermicro 플랫폼과 AI-Stack 구성 방안을 안내해 드리겠습니다.