AI 추론의 역설: CSP 매출은 늘어도 이익은 남지 않을 수 있다

AI 추론의 역설: CSP 매출은 늘어도 이익은 남지 않을 수 있다 AI 추론이 늘어도 CSP 이익은 왜 갈릴까 AI 추론 수요가 늘면 클라우드 사업자의 매출은 늘어날…

AI 추론의 역설: CSP 매출은 늘어도 이익은 남지 않을 수 있다

AI 추론이 늘어도 CSP 이익은 왜 갈릴까

AI 추론 수요가 늘면 클라우드 사업자의 매출은 늘어날 수 있습니다. 그러나 실적 발표에서 매출이 늘었다는 문장 바로 옆에는 대개 더 큰 CapEx, 감가상각, 전력비가 함께 놓여 있습니다. 고객 요청을 빨리 처리하려면 GPU와 전력을 먼저 확보해야 하기 때문입니다. 그 장비가 충분히 오래 유상 요청을 처리하기 전까지, AI의 성장 스토리는 이익이 아니라 비용의 이야기일 수 있습니다.

그래서 AI 추론 매출은 ‘수요 신호’일 뿐이고, 클라우드의 고마진 성장은 네 가지가 함께 좋아질 때에만 확인됩니다. GPU가 비지 않아야 하고, 토큰당 원가가 낮아져야 하며, 그 매출이 감가상각과 전력비를 따라잡아야 하고, 절감된 원가가 할인으로 모두 사라지지 않아야 합니다. 이 순서를 따라가면 “AI 수요가 강하다”는 말과 “이 사업이 돈을 잘 번다”는 말을 분리할 수 있습니다.

글을 다 읽은 뒤에는 매출 성장 숫자 하나를 보더라도, 그 숫자가 어느 비용 조건을 이미 통과했는지부터 질문할 수 있어야 합니다.

클라우드 사업자에게 추론 수요 증가가 안정적인 수익 증가로 이어지려면 네 가지 조건이 필요합니다. 고객 요청이 꾸준해서 이미 확보한 GPU가 비지 않아야 하고, 같은 요청을 처리하는 비용이 낮아져야 하며, 그 절감분을 가격 인하로 전부 내주지 않아야 합니다. 이 조건이 맞으면 새 GPU와 데이터센터에 들어간 돈이 더 많은 매출에 나뉘어 실리고 마진도 좋아질 수 있습니다. 반대로 피크 시간만 위해 GPU를 먼저 많이 확보했는데 나머지 시간에 장비가 비고 경쟁 때문에 가격까지 내리면, 매출은 커져도 이익률은 낮아질 수 있습니다.

가동률과 고정비 회수

첫 번째 질문은 단순합니다. 확보한 GPU가 얼마나 오래 고객의 유상 요청을 처리하는가입니다. 서버를 주문했거나 데이터센터를 짓는다고 해서 곧바로 매출이 생기지는 않습니다. 전력 인입, 냉각, 네트워크, 모델 배포, 고객 연결까지 끝나야 서비스가 됩니다. 그 뒤에도 고객 요청이 충분해야 장비 비용이 회수됩니다.

여기서 흔히 생기는 오해는 GPU 사용률과 수익성을 같은 것으로 보는 일입니다. 장비가 작동하고 있어도 무료 체험, 내부 연구, 테스트 요청을 처리하고 있다면 외부 매출은 늘지 않을 수 있습니다. 반대로 고객이 전용 용량을 장기 계약으로 확보했다면, 사용량이 조금 낮아도 공급자에게는 안정적인 수익이 생길 수 있습니다. 그래서 봐야 할 것은 단순한 ‘GPU가 켜져 있는 시간’이 아니라 청구 가능한 요청과 계약으로 채워진 시간입니다.

Microsoft의 전용 처리용량 설명에 따르면, provisioned throughput은 고객을 위해 일정량의 처리용량을 따로 확보하는 방식입니다. 고객은 지연시간을 예측할 수 있지만, 공급자 입장에서는 그 용량을 준비하는 비용이 생깁니다. 이 구조에서는 평균 수요가 아니라 가장 붐비는 시간대에 맞춰 장비를 잡아둘 수 있습니다. 피크가 짧고 비피크가 길면 매출은 늘어도 장비 회전은 기대보다 낮아질 수 있습니다.

이 지표가 좋아지는 신호는 세 가지입니다. 새 용량의 서비스 개시가 빨라지고, 예약 용량이 실제 사용으로 이어지며, 고객이 계약을 갱신하거나 더 큰 용량을 잡는 경우입니다. 반대로 대형 CapEx 발표만 있고 가동 시점·예약·사용량에 대한 설명이 없다면, 수요가 아니라 공급 계획만 확인된 상태라고 봐야 합니다.

가령 한 기업이 고객지원 AI를 위해 전용 GPU를 확보했다고 가정해 보겠습니다. 평일 낮에는 문의가 몰려 응답 지연이 생기지 않지만, 밤과 주말에는 용량 대부분이 비어 있을 수 있습니다. 이 기업이 월간 토큰 수만 공개하면 수요는 커 보입니다. 그러나 비는 시간이 길고 고객이 장기 용량을 약정하지 않았다면, 공급자는 피크를 위한 GPU 비용을 매달 부담합니다. 이 경우 매출 증가는 맞아도 자산 회전의 개선은 제한적입니다. 반대로 여러 고객의 요청 시간을 섞어 같은 GPU를 하루 종일 채우거나, 고객이 최소 사용량을 약정하면 같은 투자로 훨씬 높은 이익을 만들 수 있습니다.

추론 원가의 결정 요인

두 번째 질문은 토큰 하나를 처리하는 비용이 실제로 내려가고 있는가입니다. 여기서도 평균 토큰 가격만 보면 안 됩니다. 긴 답변을 만들어 내는 요청은 짧은 입력을 읽는 요청보다 더 많은 처리 부담을 줄 수 있고, 요청이 동시에 몰리면 더 많은 용량을 준비해야 합니다. 같은 월간 토큰 수라도 요청의 모양에 따라 원가는 달라집니다.

Microsoft의 PTU 산정 방법은 필요한 처리용량을 계산할 때 분당 요청 수, 입력·출력 토큰 수, 캐시율을 함께 넣습니다. 이 자료가 주는 실무적 의미는 분명합니다. “토큰이 늘었다”가 아니라 “어떤 요청이 언제, 얼마나 몰리고 있는가”를 알아야 필요한 GPU 수와 비용을 판단할 수 있다는 뜻입니다.

캐시는 비용을 낮추는 대표적인 수단입니다. 고객마다 반복되는 시스템 지시나 공통 문서를 매번 계산하지 않으면, 같은 서비스를 더 적은 처리용량으로 제공할 수 있습니다. Microsoft의 prompt caching 문서는 공통 입력의 재처리를 줄여 지연시간과 비용을 낮출 수 있다고 설명합니다. 캐시율이 높아지고, 작은 모델이 처리할 수 있는 업무 비중이 늘고, 요청을 시간대별로 고르게 분산할 수 있다면 토큰당 원가는 낮아질 가능성이 있습니다.

다만 원가 절감은 결과가 아니라 출발점입니다. 캐시율이 올랐다는 말만으로 마진이 개선됐다고 볼 수는 없습니다. 절감한 비용으로 가격을 내렸는지, 같은 가격을 유지했는지, 더 많은 고객을 받기 위해 다시 GPU를 늘렸는지에 따라 손익은 달라집니다. 다음 단계가 필요한 이유입니다.

핵심은 비용을 낮추는 기술과 비용을 회수하는 사업 모델을 구분하는 데 있습니다. 전략적으로 캐시는 훌륭한 수단이지만, 고객 확보를 위해 절감분보다 큰 할인과 크레딧을 제공한다면 단기 마진은 좋아지지 않을 수 있습니다. 반대로 가격을 조금 낮춰도 고객 사용량이 크게 늘어 유휴 GPU를 채운다면, 낮은 단가는 더 높은 총이익으로 이어집니다. 비용, 마진, 가격결정력은 한 번에 같은 방향으로 움직이지 않는다는 점을 먼저 받아들여야 합니다.

CapEx와 감가상각의 시간차

세 번째 질문은 새로 늘어난 비용을 매출이 얼마나 빨리 흡수하는가입니다. GPU와 네트워크 장비는 설치한 뒤 감가상각을 만들고, 고밀도 데이터센터는 전력·냉각·변전 설비 비용을 동반합니다. 고객 요청은 증가할 수 있지만, 비용은 장비를 먼저 확보하는 순간부터 늘어납니다. 이 시간차가 클라우드 추론 사업의 가장 큰 함정입니다.

Alphabet은 2025년 3분기 실적발표에서 기술 인프라 투자 증가가 감가상각과 에너지 등 데이터센터 운영비 압력으로 이어진다고 설명했습니다. 이 발언은 AI 수요가 약하다는 뜻이 아닙니다. 오히려 수요가 강해도 손익에는 ‘먼저 들어오는 비용’이 있다는 뜻입니다. 그래서 매출 성장률 하나보다 신규 자산이 가동된 시점, 서비스 개시 이후 사용량의 상승 속도, 매출총이익률의 방향을 같이 확인해야 합니다.

전력은 특히 따로 봐야 합니다. 데이터센터에 서버를 들여놓았어도 전력 인입과 냉각이 준비되지 않으면 고객에게 판매할 수 있는 처리용량은 생기지 않습니다. IEA의 Energy and AI 보고서는 AI 확산이 데이터센터 전력 수요와 공급 제약을 함께 키우는 문제를 다룹니다. 즉, 전력은 ‘매출이 늘면 같이 늘어나는 비용’이 아니라 매출 전환 자체를 늦출 수 있는 병목입니다.

이 단계에서 확인할 지표는 서비스 개시 시점, 가동 가능한 용량, 전력 확보, 사용량 램프, 매출총이익률입니다. 이 숫자들이 함께 개선되면 투자한 설비가 돈을 벌기 시작했다고 해석할 근거가 생깁니다. 반대로 CapEx와 감가상각만 먼저 커지고 가동·사용량·마진이 뒤따르지 않으면, 수요 기대는 있어도 현금흐름 전환은 아직 일어나지 않았다고 판단하는 편이 맞습니다.

가격 전가와 계약 구조

마지막 질문은 원가가 낮아졌을 때 그 이익을 공급자가 갖는가, 고객에게 내주는가입니다. 클라우드 사업자가 더 효율적인 모델과 GPU를 사용해 비용을 줄여도 결과는 세 갈래입니다. 가격을 유지하면 마진이 좋아집니다. 가격을 내리면 고객 사용량이나 점유율이 늘 수 있습니다. 할인·크레딧·전용 용량을 묶으면 장기 계약을 얻을 수 있습니다. 세 경우 모두 매출은 늘 수 있지만, 이익의 질은 다릅니다.

계약이 이 차이를 보여 줍니다. 고객이 특정 모델, 보안 환경, 데이터 연결, 운영 도구에 깊게 묶여 있으면 다른 공급자로 옮기기 어렵습니다. 그 결과 공급자는 비용 절감분을 가격에 모두 반영하지 않고도 계약을 유지할 가능성이 커집니다. 반대로 고객이 여러 모델과 클라우드를 쉽게 바꿔 쓸 수 있으면, 효율 개선은 곧 할인 경쟁으로 이어질 가능성이 큽니다.

그래서 실적을 읽을 때는 “효율이 좋아졌다”는 표현보다 계약 단가, 할인과 크레딧, 예약 용량의 갱신, 고객당 사용량의 변화에 주목해야 합니다. 가격이 낮아져도 사용량이 크게 늘고 예약이 길어지면 좋은 비용 절감일 수 있습니다. 가격을 유지했는데 갱신이 약해지면 단기 마진은 좋아 보여도 장기 경쟁력은 약할 수 있습니다. 원가 절감이 마진으로 남는지 확인하려면 가격과 사용량을 항상 함께 봐야 합니다.

실적 점검 항목

이 글의 네 가지 조건은 따로 떨어진 체크리스트가 아닙니다. 순서가 있습니다.

  1. 가동 가능한 GPU: 새 용량이 실제 고객 요청으로 채워지고 있는가?
  2. 토큰당 처리비용: 캐시·모델 선택·요청 구성으로 같은 일을 더 싸게 처리하는가?
  3. 고정비 흡수: 사용량 증가가 감가상각과 전력비 증가보다 빠른가?
  4. 가격 전가: 절감된 비용이 할인으로 사라지지 않고 계약과 마진에 남는가?

네 질문에 모두 ‘예’라고 답할 수 있을 때, AI 추론 매출 증가는 고마진 성장이라는 결론으로 이어집니다. 첫 번째와 두 번째만 좋아도 효율적인 운영일 수는 있습니다. 하지만 세 번째가 나쁘면 비용 회수가 늦고, 네 번째가 나쁘면 효율의 이익은 고객에게 넘어갑니다. 매출 성장률은 이 네 질문을 모두 통과한 뒤에야 의미가 분명해집니다.

가장 큰 장점은 한 숫자가 아닌 흐름을 보게 한다는 점입니다. 가동률이 올라가고 캐시율이 개선됐지만 할인도 커졌다면, 운영은 좋아졌어도 가격결정력은 확인되지 않았습니다. 전력 확보가 늦어졌지만 예약 계약이 길어졌다면, 매출 전환은 늦어져도 수요의 질은 좋아졌다고 읽을 수 있습니다. 한 숫자만 보고 결론 내리지 않고, 어느 단계에서 돈이 새거나 쌓이는지를 찾는 것이 이 글의 목적입니다.

실적 발표를 읽을 때의 적용도 어렵지 않습니다. 먼저 AI 매출이나 백로그가 늘었는지 확인합니다. 다음으로 그 수요를 받기 위한 신규 용량이 이미 가동됐는지, 아니면 전력과 설치를 기다리는지 봅니다. 이어서 감가상각과 전력비가 매출총이익률에 어떤 영향을 주는지 확인하고, 마지막으로 가격 인하·할인·계약 갱신의 방향을 읽습니다. 이 네 줄을 매 분기 같은 순서로 비교하면, 낙관적인 수요 설명과 실제 현금흐름 전환을 구별할 수 있습니다.

투자 판단의 한계

사업자마다 공개하는 숫자의 범위가 다르기 때문에, 외부 투자자가 네 지표를 완벽하게 계산하기는 어렵습니다. 특히 실제 할인율, 내부 추론과 외부 매출의 비중, 고객별 GPU 활용도는 공개 정보의 한계입니다. 숫자가 보이지 않는다고 곧바로 부정적으로 볼 필요는 없지만, 보이지 않는 변수가 많을수록 ‘AI 매출 성장 = 마진 개선’이라는 결론의 확신도는 낮춰야 합니다.

또한 내부 AI 사용은 외부 API 매출과 다른 방식으로 가치를 만들 수 있습니다. 검색 품질, 광고 효율, 개발자 생산성이 좋아지면 인프라 비용의 일부가 다른 사업에서 회수될 수 있습니다. 이 가능성은 중요합니다. 다만 내부 제품의 효용과 클라우드 서비스의 가격결정력을 한 숫자로 섞어서는 안 됩니다. 어느 경로로 비용을 회수하는지 분리해서 볼 때, AI 추론의 성장과 클라우드 마진의 관계가 가장 명확해집니다.