블로그 - Infinitix 인피니틱스 소프트웨어 주식회사

블로그

AI Stack 최신 글

Blog & News

초경 드릴 비트, 스터드 밀링 커터 및 금속 가공 장비 제조업체 -- Union Tool은 전자 회로 기판에 부품을 고정하고 배선을 위한 미세 구멍을 뚫는 데 사용되는 ‘PCB 드릴 비트’ 분야의 글로벌 선도 기업입니다. 전 세계 반도체 선도 기업들이 생산하는 고집적도 CPU, GPU 등의 부품이 정상 작동하기 전에, Union Tool이 제조한 드릴로 뚫은 이러한 '공'은 필수적인 핵심 요소입니다.
디지털 발전부는 인피니틱스와 협력하여 대만 AI 컴퓨팅 자원 공유 플랫폼 구축에 성공했습니다. ‘AI-Stack’ 플랫폼을 통해 스타트업은 유연하고 효율적인 GPU 컴퓨팅 자원을 활용하여 AI 애플리케이션의 상용화를 가속화할 수 있습니다. 이 플랫폼은 다양한 브랜드의 GPU 통합을 지원하며 다수의 오픈소스 도구를 갖추고 있어 대만 디지털 산업의 업그레이드를 위한 견고한 기반을 마련했습니다.

성공 사례

AI-Stack 도입을 통해 KETI는 여러 연구자와 프로젝트가 공동으로 활용할 수 있는 AI 인프라 환경을 구축하고, 제조 AIDC의 자원 관리와 운영체계를 개선했다.
대만 국립후웨이과기대는 AI-Stack으로 학과별로 흩어진 GPU를 통합했습니다. 환경 구축은 수 주에서 수 분으로, 운영 비용은 50% 이상 절감했습니다.

일본 국립대학법인 전기통신대학교(UEC)에 위치한 “ELSA Physical AI Lab”은 생성형 AI와 로봇 기술(Physical AI)의 통합을 연구하는 기관입니다. 이 연구소의 핵심 연구는 사족 보행 로봇과 로봇의 손/팔에 대한 인지 모델 개발에 집중되어 있습니다. 따라서 고성능 시스템을 활용한 시뮬레이션과 실험 환경의 빈번한 전환은 필수적인 핵심 요소입니다. Photo: Daisuke Ishizaka 배경 및 과제: 온프레미스 배포의 예산, 기술, 환경적 장벽 온프레미스 AI 연구개발을 추진하는 과정에서, ELSA 연구소 역시 기업들이 공통적으로 겪는 세 가지 주요 과제에 직면했습니다: Photo: Daisuke Ishizaka 해결 방안 및 실증: AI-Stack과 AMD의 협력을 통한 고효율 연구개발 환경 구축 ELSA 연구소는 AMD Radeon™ AI PRO R9700(32GB GDDR6 VRAM 탑재)을 장착한 ELSA VELUGA G5-ND…

솔루션

INFINITIX 의 AI-Stack은 Supermicro의 GPU 서버 5종과 연동되며, 3U MicroCloud부터 8U HGX까지 전체 제품군을 아우르고 NVIDIA 전 제품군과 AMD Instinct 시리즈 등의 가속기를 지원합니다.

대만 지방정부의 AI 도입은 빨라지고 있지만, 컴퓨팅 자원 관리는 따라가지 못하고 있다 대만 국가발전위원회는 ‘Sovereign AI 및 컴퓨팅 인프라 구축’과 ‘스마트 정부 데이터 거버넌스’를 정부 AI 발전의 핵심 프레임워크로 제시하고 있으며, ‘AI 신(新) 10대 건설’을 통해 지방정부의 AI 인프라 투자도 빠르게 확대하고 있습니다. 그러나 많은 지방정부가 GPU를 도입하는 방식은 여전히 ‘부서별 개별 구매, 개별 관리’ 구조에 머물러 있습니다. AI 활용 규모가 작을 때는 이러한 방식으로도 운영이 가능하지만, 점차 더 많은 부서와 기관이 AI 서비스를 도입하면서 다음과 같은 구조적인 비효율이 나타나기 시작합니다. AI-Stack: 분산된 GPU를 하나의 공용 컴퓨팅 자원 풀로 통합 INFINITIX의 AI-Stack은 온프레미스 환경을 위해 설계된 이기종 컴퓨팅 자원 스케줄링…

기업의 AI 도입 속도는 거버넌스 체계가 구축되는 속도보다 훨씬 빠릅니다. AI가 IT 관리의 새로운 핵심으로 부상하며, FinOps와 AI 거버넌스도 빠르게 결합. AI-Stack은 기업이 가장 중요하게 고려하는 비용, 효율성, 거버넌스를 하나의 플랫폼으로 통합합니다. AI를 단순히 실행하는 수준을 넘어 장기적으로 안정적이고 통제 가능한 방식으로 확장할 수 있도록 지원합니다.

주요 이야기

Claude Fable 5.1과 Mythos 5.1은 같은 기반 모델에 서로 다른 안전 계층을 적용합니다. 기업 비용, fallback, 30일 보관, EFS와 도입 시험 방법을 정리합니다.
OpenAI가 Astra를 Critical 사이버 역량 모델로 평가했습니다. 고성능 AI Agent 도입 전 기업이 준비해야 할 최소 권한, 격리, 모니터링, 승인 등 7가지 거버넌스 게이트를 설명합니다.
Gemini 3.7 Flash의 1M Context, 세 단계 Thinking, 반값 API를 기업 관점에서 분석합니다. 코딩·Agent·PDF 성능, 2027년 가격 인상, 4주 PoC 방법까지 확인하세요.

기술 지원

보안 요구사항이 높은 공유 AI 인프라 환경에서 Network Policy를 활용해 Ingress 및 Egress 트래픽을 제어하고, 워크로드 간 네트워크 통신을 제한하여 안전한 AI 환경을 구축하는 방법을 소개합니다.

탄력적 분산 훈련(Elastic Distributed Training)은 AI 모델 훈련에서 효율성과 유연성을 높이기 위해 사용되는 기술입니다. 간단히 말해, 모델 훈련이 단일 머신이나 고정된 수의 컨테이너에 국한되지 않고 수요에 따라 가용한 컴퓨팅 자원을 동적으로 조정하고 활용할 수 있게 합니다. 인피니틱스는 탄력적 분산 훈련을 AI-Stack에 원활하게 통합하여 Horovod, DeepSpeed, Megatron-LM, Slurm 등 주요 프레임워크를 지원함으로써 기업의 자원 스케줄링 병목 현상을 효과적으로 해소하고 대규모 AI 모델 훈련을 가속합니다. 본 글에서는 AI-Stack에서 Horovod를 활용해 탄력적 분산 훈련을 수행하는 방법을 단계별로 시연해 드리겠습니다! Horovod와 DeepSpeed의 운영 단계가 유사하므로, 본 글에서는 Horovod를 예시로 사용합니다. 주의할 점은 사용 전 【공용 이미지 목록】에 DeepSpeed 및 Horovod 프레임워크 실행에 적합한 이미지가…

Kubeflow는 Kubernetes를 기반으로 구축된 오픈소스 플랫폼으로, 데이터 준비, 모델 훈련, 하이퍼파라미터 튜닝, 모델 배포 및 모니터링 등 각 단계를 포괄하는 표준화되고 통합된 도구 세트를 제공함으로써 AI 모델의 실제 적용 과정을 크게 간소화합니다. 현재 많은 데이터 과학자와 머신러닝 엔지니어가 자주 사용하는 플랫폼으로 자리 잡았습니다. 그러나 많은 개발자가 Kubeflow 사용 시 GPU 리소스 분할이 불가능한 문제를 겪습니다. 플랫폼 특성상 단일 컨테이너가 전체 GPU 리소스를 점유하기 때문에, 프로젝트에 필요한 리소스가 적을 경우 일부 GPU 컴퓨팅 자원이 유휴 상태로 방치되어 효율적으로 활용되지 못합니다. 본 글에서는 인피니틱스의 ixGPU 모듈을 활용해 Kubeflow에서 GPU 분할을 구현하는 방법을 단계별로 안내합니다. Kubeflow 플랫폼에서 ixGPU 모듈을 활용한 GPU 탄력적 분할…

AI-Stack 적용 사례에 대해 더 알아보고 싶다면