AI 서버의 가동률: 공급을 매출로 바꾸는 네 가지 조건

AI 서버의 가동률: 공급을 매출로 바꾸는 네 가지 조건 AI 서버의 가동률은 GPU가 켜져 있는 시간과 같지 않습니다. 장비가 데이터센터에 설치됐고 모니터링 화면에 사용률이 높게 표시되더라도,…

AI 서버의 가동률: 공급을 매출로 바꾸는 네 가지 조건

AI 서버의 가동률은 GPU가 켜져 있는 시간과 같지 않습니다. 장비가 데이터센터에 설치됐고 모니터링 화면에 사용률이 높게 표시되더라도, 고객이 원하는 작업을 제시간에 끝내지 못하거나 낮은 단가의 내부 작업만 처리한다면 투자 회수는 더뎌집니다. 반대로 평균 사용률이 다소 낮아도 지연시간 약속을 지키면서 높은 가격의 추론 수요를 안정적으로 처리하면 수익성은 나을 수 있습니다.

그런데 AI 인프라 경쟁은 여전히 확보한 GPU 수량과 CapEx 규모로 설명되는 경우가 많습니다. 수요가 공급보다 많았던 초기에는 이 기준이 유효했습니다. 장비만 확보하면 대기하던 고객을 받을 수 있었기 때문입니다. 공급이 누적될수록 판단 기준은 보유량에서 운영으로 옮겨갑니다. 같은 장비를 어떤 작업에 배정하고, 비는 시간을 어떻게 채우며, 서비스 품질을 해치지 않고 얼마나 많은 유효 연산을 판매하는지가 중요해집니다.

AI 인프라의 자본수익률은 확보한 GPU의 수보다 학습·추론·내부 사용 사이에서 유휴 시간을 줄이는 운영 능력에 좌우됩니다. 여기서 말하는 가동률은 단일 계기판 숫자가 아닙니다. 전력이 들어온 장비의 비율, 고객에게 배정된 시간, 실제 연산이 진행된 시간, 그리고 그 연산이 매출로 인식된 시간을 차례로 구분해야 합니다. 이 네 단계가 서로 가까워질 때 비로소 컴퓨팅 공급이 매출이 됩니다.

AI 서버의 가동률과 네 개의 분모

GPU 수량은 가장 먼저 보이는 공급 지표입니다. 그러나 주문한 장비, 설치한 장비, 사용할 수 있는 장비, 고객이 구매한 장비 시간은 서로 다른 숫자입니다. 서버가 랙에 들어와도 전력·냉각·네트워크와 소프트웨어 검증이 끝나지 않으면 작업을 받을 수 없습니다. 이 단계의 차이는 앞선 글에서 살펴본 감가상각 시점과도 연결됩니다. 자산은 이미 비용을 만들기 시작했지만 매출화된 사용시간은 아직 부족할 수 있습니다.

운영자가 보는 사용률도 하나가 아닙니다. 그래픽 엔진이 움직인 시간, 연산 유닛이 실제로 일한 비율, 메모리 대역폭, GPU 간 통신량은 서로 다른 병목을 나타냅니다. NVIDIA의 DCGM 지표 설명은 SM activity가 높다는 사실조차 효율적인 사용의 필요조건일 뿐 충분조건은 아니라고 밝힙니다. 메모리를 기다리는 작업도 일부 활성 지표에는 잡힐 수 있기 때문입니다. 계기판의 80%와 경제적으로 유효한 80%는 같은 뜻이 아닙니다.

따라서 가동률에는 적어도 네 개의 분모가 필요합니다. 첫째는 설치된 GPU 가운데 실제로 켤 수 있는 비율입니다. 둘째는 가동 가능한 시간 가운데 작업에 배정된 비율로 볼 수 있습니다. 셋째는 배정 시간 가운데 연산과 데이터 이동이 효율적으로 진행된 정도를 뜻합니다. 넷째는 유효 연산 가운데 외부 매출이나 측정 가능한 내부 편익으로 회수된 비율입니다.

이 구분은 단순한 용어 정리가 아닙니다. 첫 번째 비율이 낮다면 병목은 전력과 설치에 있습니다. 두 번째가 낮다면 수요 예측이나 고객 온보딩, 스케줄링이 문제일 가능성이 큽니다. 세 번째가 낮으면 네트워크·메모리·소프트웨어 최적화를 의심해야 합니다. 마지막 비율이 낮다면 장비는 바쁘게 돌지만 경제적 가치가 낮은 작업이 용량을 차지하고 있다는 뜻입니다.

가동률을 한 숫자로 묶으면 서로 다른 처방을 같은 문제에 적용하게 됩니다. 전력 연결이 늦은 데이터센터에 스케줄러를 개선해도 판매 용량은 늘지 않습니다. 반대로 전력과 장비가 준비된 클러스터에서 CapEx를 더 늘려도 작업 조각화와 낮은 고객 수요는 해결하기 어렵습니다. 투자자 입장에서는 사용률의 수준보다 어느 단계에서 시간이 사라지는지를 찾는 게 우선입니다.

작업 믹스의 경제성

가동 가능한 GPU를 확보한 뒤에도 학습, 추론, 내부 사용은 용량을 소비하는 방식이 다릅니다. 대규모 학습에는 수백 또는 수천 개의 GPU를 연속된 시간 동안 함께 배정해야 합니다. 시작 전에 장비를 모아야 하고 작업 중 일부 노드가 멈추면 전체 진행 속도가 흔들립니다. 예약 계획을 세우기는 쉽지만, 작업 사이의 빈 구간과 실패 복구 비용이 큽니다.

추론은 반대의 문제를 만듭니다. 요청은 짧고 계속 들어오지만 시간대와 제품별로 변동성이 큽니다. 고객에게는 평균 응답시간보다 느린 요청의 꼬리, 즉 p95나 p99 지연시간이 중요한 기준입니다. 운영자는 갑작스러운 피크를 감당하기 위해 일부 용량을 비워 둡니다. 이 여유 용량은 서비스 품질에는 필요하지만 평균 가동률만 보면 비효율로 보입니다.

요청을 묶어 처리하면 추론 효율은 올라갑니다. NVIDIA Triton의 동적 배칭 문서는 여러 요청을 하나의 배치로 만들면 처리량을 높일 수 있지만, 더 큰 배치를 기다리는 시간과 지연시간 예산 사이의 조정이 필요하다고 설명합니다. 처리량을 극대화하려고 요청을 오래 모으면 고객이 체감하는 응답속도가 나빠집니다. 추론 가동률은 기술적으로 가능한 최대치가 아니라 서비스 수준을 지키는 범위에서 얻을 수 있는 최대치입니다.

내부 사용은 회계상 해석을 더 어렵게 만듭니다. 플랫폼 기업은 같은 클러스터를 외부 클라우드 고객, 자체 모델 학습, 검색·광고·추천 기능에 배분할 수 있습니다. 외부 고객에 배정하면 매출이 바로 보이지만 내부 모델 개선은 제품 경쟁력과 미래 비용 절감으로 천천히 나타납니다. 낮은 외부 매출이 곧 유휴 상태를 뜻하지 않고, 높은 물리 사용률이 곧 높은 자본수익률을 뜻하지도 않습니다.

세 작업의 조합은 기회비용을 만듭니다. 학습 작업을 우선하면 대규모 자원을 오래 묶어야 하므로 짧은 추론 요청을 받을 여지가 줄어듭니다. 추론을 우선하면 피크 대응용 여유가 필요해 학습에 쓸 수 있는 연속 용량이 감소합니다. 내부 수요를 밀어내면 단기 매출은 늘 수 있지만 자체 서비스의 출시와 품질 개선이 늦어질 수 있습니다. 최적의 작업 믹스는 가장 높은 평균 사용률이 아니라, 포기한 수요까지 포함한 한계이익이 가장 큰 조합입니다.

이 관점에서 장기 계약의 의미도 달라집니다. 예약 계약은 수요 가시성을 높이고 빈 시간을 줄여주지만, 특정 시간대와 특정 장비를 고객에게 보장해야 한다면 다른 작업에 재배치할 선택권이 줄어듭니다. 계약 규모가 크다는 사실만으로 높은 가동률을 확정할 수 없습니다. 최소 사용 의무, 시작 시점, 장비 종류, 지역, 취소 조항과 실제 사용 전환 속도가 함께 움직여야 합니다.

스케줄링과 자원 조각화

AI 클러스터의 유휴 시간은 수요 부족보다 자원 조각화에서 발생하는 경우가 많습니다. 총 100개의 GPU 중 20개가 비어 있어도 한곳에 모여 있지 않으면 16개를 동시에 요구하는 학습 작업을 시작하지 못할 수 있습니다. 사용 가능한 자원이 여러 서버와 지역에 흩어져 있거나, 메모리 용량과 GPU 세대가 다르면 합계는 충분해도 작업 조건을 만족하지 못합니다.

Kubernetes의 GPU 스케줄링 문서가 장치 플러그인, 노드 레이블과 선택 조건을 따로 요구하는 것도 같은 이유입니다. 스케줄러는 단순히 빈 GPU를 찾는 것이 아니라 작업과 호환되는 장비를 같은 위치와 시간에 묶어야 합니다. CPU, 메모리, 로컬 스토리지와 네트워크까지 요구 조건에 들어오면 가능한 조합은 더 줄어듭니다.

조각화는 규모가 커질수록 저절로 사라지지 않습니다. 다양한 팀이 서로 다른 GPU 수, 실행시간과 우선순위를 요청하면 작은 작업이 먼저 들어가 큰 작업에 필요한 연속 자원을 끊어 놓을 수 있습니다. 2023년 USENIX ATC에 발표된 GPU 공유 워크로드 연구는 생산 클러스터에서 보고된 GPU 활용률이 25%에서 50% 미만에 머무는 사례를 정리하고, 자원 조각화를 줄이는 스케줄링으로 추가 GPU를 활용할 수 있음을 보였습니다. 장비 부족과 배치 실패는 동시에 존재할 수 있습니다.

운영자는 대기시간과 가동률 사이에서도 선택해야 합니다. 빈 자리가 생길 때마다 작은 작업을 채우면 단기 사용률은 올라가지만, 곧 들어올 대규모 학습 작업은 필요한 GPU를 모으지 못해 오래 기다릴 수 있습니다. 반대로 큰 작업을 위해 용량을 비워 두면 현재 계기판의 사용률은 낮아집니다. 높은 가동률이 항상 높은 처리량이나 고객 만족을 뜻하지 않는 이유입니다.

장애와 재시작은 또 다른 공백을 만듭니다. 대규모 학습은 많은 노드가 동시에 작동하므로 개별 장비의 작은 오류도 작업 전체의 중단 확률을 높입니다. 체크포인트를 저장하고 작업을 재개하는 동안 GPU는 전력을 소비하지만 새로운 결과를 만들지 못할 수 있습니다. 하드웨어 신뢰성, 네트워크 안정성과 복구 자동화는 유지보수 항목이 아니라 판매 가능한 GPU 시간을 결정하는 생산성 변수입니다.

조각화를 줄이는 방법에도 비용이 붙습니다. 선점형 스케줄링은 낮은 우선순위 작업을 중단해 중요한 계약을 받을 수 있지만, 중단된 작업의 재시작 비용과 조직 간 갈등을 만듭니다. GPU 분할은 작은 추론 작업을 촘촘히 채우는 데 유리하나 모든 모델이 같은 방식으로 성능을 내지는 않습니다. 여러 지역을 하나의 풀처럼 운용하면 선택지는 늘지만 데이터 이동, 규제와 지연시간 제약이 생깁니다. 운영 역량은 이 상충관계를 숨기는 기술이 아니라 경제성이 높은 순서로 선택하는 능력입니다.

추론 서비스의 여유 용량

학습 중심의 관점에서는 빈 GPU를 곧 낭비로 보기 쉽습니다. 그러나 상용 추론 서비스는 일정한 여유가 없으면 약속한 응답시간을 지키기 어렵습니다. 요청이 평균치대로 들어오지 않고 순간적으로 몰리기 때문입니다. 추론 운영자는 변동성을 흡수할 완충 용량을 보유해야 합니다.

이 완충 용량의 적정 수준은 고객과 제품마다 다릅니다. 실시간 검색이나 금융 거래 보조처럼 지연에 민감한 서비스는 더 많은 여유가 필요합니다. 야간 배치 작업이나 응답시간이 덜 중요한 내부 분석은 남는 용량으로 옮길 수 있습니다. 서로 다른 서비스 수준의 작업을 하나의 클러스터에 배치할 수 있다면 피크 대응 용량이 완전한 유휴로 남는 시간을 줄일 수 있습니다.

가격 체계는 이 운영 선택을 매출로 바꾸는 장치입니다. 예약 상품은 고객에게 용량을 보장하는 대신 사업자에게 수요의 시간표를 줍니다. 온디맨드 상품은 높은 유연성을 제공하지만 수요 변동을 사업자가 떠안습니다. 스팟 상품은 남는 시간을 낮은 가격에 판매해 고정비를 일부 회수합니다. 세 상품의 비중은 가동률뿐 아니라 실현 단가와 계약 안정성을 함께 결정합니다.

AWS의 EC2 Capacity Blocks는 고객이 미래의 특정 기간과 클러스터 크기로 가속 컴퓨팅을 예약하도록 설계돼 있습니다. 이 상품 구조는 GPU 공급 부족만 보여주는 것이 아닙니다. 사업자가 작업 시작일과 종료일을 사전에 확보해 자원 배치를 계획하고, 고객은 필요한 기간의 용량을 보장받는 방식입니다. 가동률을 높이려면 수요의 총량보다 시간과 형태를 계약으로 정렬해야 한다는 뜻입니다.

그렇다고 예약 비중이 높을수록 무조건 유리한 것은 아닙니다. 낮은 가격으로 장기 용량을 묶으면 향후 현물 가격이 오를 때 기회손실이 생깁니다. 반대로 짧은 계약에 의존하면 가격은 높게 받을 수 있어도 수요 공백이 커집니다. 좋은 운영은 예약률을 극대화하는 것이 아니라, 계약 만기와 워크로드 변동성을 분산해 실현 단가와 사용시간의 곱을 안정시키는 데 가깝습니다.

가동률과 자본수익률

가동률이 재무 성과로 넘어가는 경로는 단순한 분수로 정리할 수 있습니다. 매출은 판매 가능한 연산시간, 실제 판매 비율, 시간당 실현 가격의 곱에서 시작합니다. 여기에서 감가상각, 전력·냉각비, 네트워크 비용, 운영 인력과 소프트웨어 비용을 빼면 인프라의 영업이익이 남습니다. 높은 사용률이 수익성을 높이려면 추가 작업의 가격이 전력과 운영의 증분비용을 넘고, 기존 고정비를 충분히 분담해야 합니다.

이 식은 물리 사용률과 경제 사용률을 분리합니다. 낮은 가격의 작업으로 빈 시간을 모두 채우면 물리 사용률은 높아지지만 전력비와 장비 마모를 감안한 이익은 거의 남지 않을 수 있습니다. 반대로 높은 가격의 지연 민감형 수요만 받으면 실현 단가는 높지만 여유 용량이 늘어 고정비 회수가 느려집니다. 사업자가 최적화해야 할 변수는 GPU 사용률 하나가 아니라 `유효 시간 × 실현 단가 × 계약 지속성`입니다.

감가상각은 이 관계를 더 엄격하게 만듭니다. 짧은 내용연수의 서버는 가동 여부와 관계없이 사용 가능한 시점부터 비용이 발생합니다. 전력과 운영 인력도 일정 부분 고정비에 가깝습니다. 신규 장비가 들어온 초기 몇 분기에 고객 온보딩이 늦으면 비용은 먼저 커지고 매출은 뒤따릅니다. 앞선 글에서 확인한 AI CapEx의 시간차는 여기서 가동률이라는 운영 변수로 바뀝니다.

규모가 큰 플랫폼에는 이 시간차를 완화할 선택지가 더 많습니다. 외부 클라우드 수요가 약하면 자체 검색·광고·추천 또는 모델 개발에 용량을 돌리거나 지역 간 수요를 조정할 수 있습니다. 다만 내부 사용의 경제적 편익은 외부 가격처럼 바로 관찰되지 않습니다. 자체 제품의 매출 증가, 추론 원가 하락과 출시 속도가 함께 개선되지 않는다면 내부 전환은 낮은 외부 가동률을 가리는 설명에 그칠 수 있습니다.

반대로 전문 GPU 클라우드는 수요의 경제적 가치가 더 선명할 수 있지만 고객 집중과 계약 만기 위험을 크게 떠안습니다. 한두 고객의 학습 프로젝트가 끝나면 큰 용량이 동시에 비고, 다른 고객의 소프트웨어 환경으로 전환하는 데 시간이 걸릴 수 있습니다. 같은 가동률에서도 고객 분산, 계약기간과 워크로드 이전 비용에 따라 현금흐름의 안정성은 달라집니다.

따라서 자본수익률을 높이는 운영 능력은 세 가지 결과로 확인돼야 합니다. 신규 용량이 계획한 기간 안에 매출로 전환되고 감가상각과 전력비보다 매출총이익이 빠르게 늘어야 하며, 가격을 크게 낮추지 않고도 유휴 시간이 줄어드는지 봐야 합니다. 셋 중 하나라도 빠지면 높은 가동률로 회계상 부담을 충분히 흡수하기 어렵습니다.

실적에서 확인할 간접지표

기업은 데이터센터 전체의 경제 가동률을 거의 공개하지 않습니다. 공개된 GPU 사용률 하나만으로도 판단하기 어렵습니다. 대신 투자 집행부터 현금 회수까지 이어지는 지표를 시간순으로 대조하면 운영 상태를 간접적으로 읽을 수 있습니다.

| 단계 | 확인할 지표 | 개선 신호 | 경계 신호 |
|—|—|—|—|
| 공급 준비 | CapEx, 리스 취득, 가동 가능한 용량 | 준공·통전 일정이 계획대로 진행 | 사용 전 자산과 약정만 빠르게 증가 |
| 작업 배정 | 예약 계약, 수주잔고, 고객 온보딩 | 계약이 실제 사용량으로 전환 | 계약은 늘지만 개시 시점이 계속 지연 |
| 연산 효율 | 처리량, 대기시간, 네트워크·메모리 지표 | 같은 장비로 완료 작업이 증가 | 사용률은 높은데 작업 완료시간이 악화 |
| 경제 회수 | 클라우드 매출, 매출총이익, 감가상각, 전력비 | 매출총이익이 고정비보다 빠르게 증가 | 가격 인하와 비용 증가가 동시에 발생 |

순서는 중요합니다. CapEx가 늘어난 직후에는 자유현금흐름이 약해질 수 있고, 자산이 가동되면 감가상각이 증가합니다. 그다음 예약 계약과 고객 사용량이 붙어야 비용 흡수가 시작됩니다. 현재 매출 성장률만 보면 이미 집행됐지만 아직 가동되지 않은 자산을 놓치고, 현재 CapEx만 보면 기존 용량의 운영 효율을 놓칩니다.

간접지표 사이의 불일치가 오히려 유용합니다. 예약 계약은 늘지만 매출 전환이 느리다면 설치나 고객 온보딩이 막혔을 수 있습니다. 매출은 늘지만 매출총이익이 악화되면 낮은 가격의 수요로 용량을 채우거나 전력·감가상각 비용이 더 빠르게 증가했을 가능성이 있습니다. 애널리스트 관점에서는 CapEx 증가율이 낮아졌는데 클라우드 성장이 유지되는 구간을 기존 용량의 가동률과 자본효율이 개선되는 신호로 볼 수 있습니다.

경영진 설명에서도 구분이 필요합니다. `수요가 공급을 초과한다`는 문장은 고객 대기열을 뜻할 수 있지만, 모든 지역과 장비 세대에서 같은 부족이 있다는 의미는 아닙니다. `용량을 늘리고 있다`는 표현도 주문, 준공, 통전, 고객 배정 중 어느 단계인지에 따라 가치가 다릅니다. 숫자와 함께 사용된 동사의 시점을 읽어야 합니다.

결론적으로 AI 서버의 공급은 보유한 GPU 수가 아니라 판매 가능한 가동시간으로 측정해야 합니다. 그 시간은 전력과 네트워크가 열어주고, 스케줄러가 작업에 배분하며, 계약과 제품 수요가 매출로 바꿉니다. 장비 수량은 출발점일 뿐입니다. 자본수익률은 네 단계 사이의 공백을 얼마나 짧게 만드는가에서 결정됩니다.

이 판단이 빗나갈 수 있는 경우

가동률을 중심에 둔 판단은 공급이 누적되고 고정비가 큰 환경에서 유효합니다. 최신 가속기의 성능과 전력효율이 급격히 개선돼 낮은 사용률에서도 이전 세대보다 훨씬 낮은 단위원가를 낸다면 장비 선택이 운영 효율보다 큰 영향을 줄 수 있습니다. 이 경우 신규 세대 확보 자체가 자본수익률을 끌어올립니다.

수요가 매우 강하고 장기 계약이 준공 전부터 확정된 상황도 다릅니다. 전력과 네트워크가 준비되는 즉시 고객 작업이 시작되고 가격까지 고정돼 있다면 초기 가동률 위험은 작아집니다. 다만 계약 규모가 아니라 실제 개시 조건과 최소 사용 의무가 확인돼야 이 반론이 성립합니다.

내부 사용의 편익을 외부에서 충분히 측정하기 어렵다는 한계도 남습니다. 플랫폼 기업이 자체 모델과 제품에 GPU를 배정해 광고 전환율, 검색 품질 또는 개발 생산성을 높였다면 클라우드 매출만으로 경제 가동률을 낮게 평가할 수 있습니다. 따라서 외부 매출이 아닌 제품 단위의 원가 개선과 현금창출력까지 함께 봐야 합니다.

그럼에도 장비 수량만으로 AI 인프라의 공급과 수익성을 판단하는 방식은 점점 설명력을 잃습니다. 감가상각 부담은 같은 설비를 얼마나 오래, 얼마나 촘촘히 쓰는가에 달려 있고, 그 결과는 작업 믹스·스케줄링·계약 구조에서 갈립니다. 가동률을 높이는 방법은 하드웨어 선택에도 영향을 주므로 다음 글에서 자체 가속기의 경제성을 다룹니다.