데이터센터의 산출 단위는 랙에서 Token으로 변화하고 있지만, 대부분의 자체 구축 프로젝트 예산은 하드웨어와 시설 구축까지만 포함합니다. 실제로 컴퓨팅 자원을 매출로 전환하는 운영 계층은 대부분의 구축 계획에서 빠져 있습니다.

AI 데이터센터의 산출 단위: 랙에서 Token으로

지난 20년간 데이터센터의 가치는 랙 수, 가용성, PUE를 기준으로 평가되어 왔습니다. 그러나 AI 워크로드는 이러한 기준을 바꾸고 있습니다. NVIDIA CEO 젠슨 황은 GTC 2026에서 현대의 데이터센터를 하나의 공장으로 설명하며, 그 산출 단위를 Token으로 정의했습니다. 또한 제품 로드맵을 Token 처리량, Token 경제성, 와트당 성능과 연계했습니다(Data Center Frontier, 2026).

세 가지 변화가 동시에 일어나고 있습니다.

  • 추론이 학습을 앞서고 있습니다. Deloitte는 2026년 추론이 전 세계 AI 컴퓨팅 수요의 약 3분의 2를 차지할 것으로 전망했습니다. 이는 2025년의 약 절반, 2023년의 3분의 1 수준에서 크게 증가한 수치입니다(Deloitte, 2026). 학습이 프로젝트 단위의 매출이라면, 추론은 사용량에 따라 지속적으로 발생하는 반복 매출입니다.
  • 과금 단위가 GPU 시간에서 Token으로 이동하고 있습니다. NVIDIA는 진정한 경제적 전환점은 사업자가 인프라 위에 Token 사용량을 측정할 수 있는 모델과 애플리케이션을 구축하고, 인프라 사용 시간이 아닌 AI 산출물을 판매하기 시작하는 시점이라고 설명합니다(NVIDIA Technical Blog, 2026). 중국 통신사업자들도 이미 사용량 기반의 AI Token 구독 요금제를 출시하고 있습니다(Omdia, 2026).
  • 전력이 산출량의 상한을 결정합니다. 산출량을 Token으로 측정하고 전체 용량이 전력에 의해 제한된다면, 단위 전력당 얼마나 많은 Token을 생성할 수 있는지가 매출의 상한을 결정합니다. 이것이 2026년 들어 가동률이 단순한 엔지니어링 문제가 아니라 재무적 문제로 전환된 이유입니다. 유휴 가속기는 전력을 계속 소비하지만 과금 가능한 산출물은 만들어내지 못합니다.

구축 완료가 곧 서비스 개시를 의미하지는 않는다: GPU 설치부터 과금까지의 격차

자체 구축 사업자가 가장 쉽게 오판하는 부분 중 하나는 하드웨어와 시설 검수가 완료되면 곧바로 고객 서비스를 시작할 수 있다고 생각하는 것입니다. GPU 설치부터 첫 번째 청구서를 발행하기까지는 이기종 컴퓨팅 자원 스케줄링, 멀티테넌시, API 접근, 사용량 계측, 과금 및 정산 대사 등의 기능이 추가로 필요합니다.

이러한 격차는 이미 업계 데이터에서도 확인되고 있습니다.

  • Cast AI가 약 23,000개의 기업 Kubernetes 클러스터에서 수집한 실제 텔레메트리 데이터를 분석한 결과, 기업의 평균 GPU 가동률은 약 5%에 불과했으며, 프로비저닝된 용량은 실제 사용량의 약 20배에 달했습니다(Cast AI, 2026).
  • VentureBeat Research가 573명의 기술 책임자를 대상으로 실시한 조사에서는 GPU 인프라를 자체 운영하는 기업의 86%가 가동률이 50% 미만이라고 응답했습니다(VentureBeat Research, 2026).
  • 업계 분석에 따르면 소비 계층(Consumption Layer)의 부재로 인해 사업자가 통상 6~12개월의 시간과 매출 기회를 잃을 수 있습니다(Supercomputing Frontiers, 2026).

이러한 수치가 보여주는 문제는 하드웨어 부족이 아니라 운영 역량이 인프라 구축 속도를 따라가지 못하고 있다는 점입니다.

자체 구축의 네 가지 격차: 가동률, 멀티테넌시, 사용량 계측·과금, 서비스 개시 시점

AI 데이터센터는 크게 세 계층으로 구분할 수 있습니다. 전력·기계 설비 및 하드웨어, 컴퓨팅 자원 관리, 그리고 운영 및 수익화입니다. 자체 구축 사업자는 첫 번째 계층에서는 충분한 역량을 갖추고 있지만, 두 번째 계층은 제한적으로 대응하는 경우가 많으며 세 번째 계층은 아예 구축 계획에 포함되지 않는 경우도 많습니다. 백서에서 정리한 네 가지 격차는 모두 후자의 두 계층에서 발생합니다.

격차영향
컴퓨팅 자원 가동률 부족투자 계획에서 가정한 가동률을 달성하지 못해 투자 회수 기간이 길어지고, 유휴 장비에서도 지속적으로 비용이 발생합니다.
멀티테넌시 및 거버넌스 부족한 번에 하나의 대형 고객만 서비스할 수 있어 고객 집중 위험이 높아지고, 과금 방식도 다시 랙 단위 과금에 의존하게 됩니다.
사용량 계측 및 과금 체계 부재매출에 가장 직접적인 영향을 미치는 격차입니다. 정액제 월 요금으로 전환하거나 수작업으로 사용량을 추산해야 하며, 감사 가능한 근거를 확보하기 어렵습니다.
고객 온보딩 및 서비스 개시 지연하드웨어 감가상각은 검수일부터 시작되지만, 매출은 운영 계층이 준비된 이후에야 발생합니다.

네 번째 항목이 갖는 재무적 의미는 특히 과소평가되기 쉽습니다. 설비 투자액이 3억 원이고 5년에 걸쳐 감가상각한다고 가정하면 월 감가상각비는 약 500만 원입니다. 운영 계층의 서비스 개시가 예상보다 6개월 늦어진다면 직접적인 손실만 3,000만 원에 달하며, 여기에는 시장 기회비용이 포함되지 않습니다.

(본 수치는 단순 계산 예시이며, 실제 평가 시에는 각 기업의 투자 및 운영 데이터를 적용해야 합니다.)

AI 클라우드 운영 계층, 자체 구축할 것인가 도입할 것인가?

전력·기계 설비, 냉각, 네트워크는 일반적으로 전문 사업자의 솔루션을 도입합니다. 운영 계층 역시 이들과 동일한 세 가지 특성을 가지고 있습니다.

첫째, 지속적인 유지보수가 필요합니다. 모델 세대, 고객 요구사항, 관련 규제가 계속 변화하기 때문입니다.

둘째, 하드웨어 세대와 긴밀하게 연계됩니다. 동일한 기능을 자체적으로 다시 구축한다고 해서 그 자체로 추가적인 사업 가치가 발생하는 것은 아닙니다.

셋째, 규모가 커질수록 복잡도가 급격하게 증가합니다. 3개의 테넌트를 서비스하는 시스템과 300개의 테넌트를 서비스하는 시스템은 전혀 다른 수준의 설계를 요구합니다.

INFINITIX의 두 제품은 각각 이 두 계층에 대응합니다.

  • AI-Stack은 컴퓨팅 자원 관리 플랫폼으로, Software-Defined GPU와 스케줄링 기술을 통해 가동률을 높이고 이기종 컴퓨팅 자원을 하나의 환경에서 통합 관리합니다. 즉, 컴퓨팅 자원 관리 계층의 가동률 문제에 대응합니다.
  • ixCSP는 AI 클라우드 운영 플랫폼으로, AI-Stack 상위에서 AI Gateway와 Token 과금 시스템을 통합하고 멀티테넌시, 사용량 계측, 과금 및 서비스 카탈로그를 제공합니다. 이를 통해 GaaS, MaaS, TaaS의 세 가지 비즈니스 모델을 지원하며, 운영 계층의 수익화 문제에 대응합니다.

두 제품은 프로젝트 진행 단계에 따라 순차적으로 도입할 수 있으며, 새로운 데이터센터를 구축할 필요도 없습니다. 먼저 유휴 상태이거나 가동률이 낮은 GPU를 통합 관리해 운영 모델을 검증한 후, 컴퓨팅 용량 확대에 맞춰 단계적으로 규모를 확장할 수 있습니다.

백서 다운로드: AI 데이터센터의 핵심 격차와 해결 방안

『From Infrastructure to Token Factory: AI 데이터센터 자체 구축 사업자의 핵심 격차와 해결 방안』 전문에서는 네 가지 핵심 격차에 대한 상세 분석, 운영을 위한 3계층 참조 아키텍처, 데이터센터 생애주기에 따른 단계별 도입 계획 및 실제 사례를 확인할 수 있습니다.

양식을 작성하고 백서 전문을 다운로드하세요!