본문

글로벌 핫이슈 AI Infra Signal
AI 속도조절론, 인프라도 늦춰질까?

기고: 미래에셋증권 AI하이테크분석팀 장다현 매니저

Industry Signal Summary

말은 속도조절, 계약은 확대

속도조절의 논의 대상은 컴퓨트 총량이 아니라 프론티어 모델의 성능 향상 속도입니다. 오픈AI가 8월 강화 학습을 일시 중단한 것도 감시 체계를 보강하기 위한 조치였으며, 감시에만 추론 연산량의 약 20%가 추가로 소요됩니다. 안전 검증은 연산을 줄이는 것이 아니라 오히려 추가 컴퓨트를 요구합니다.

속도조절을 주장한 앤트로픽 역시 GW 단위의 용량 계약을 이어가고 있으며, 공동 감속의 방식과 주체를 두고 업계 의견도 갈리는 상황입니다. 실제 둔화 여부는 계약 취소, 데이터센터 착공 연기, 빅테크 CapEx 하향에서 먼저 확인될 것입니다.

GPU 증설에서 시스템 효율 경쟁으로

AI Infra Summit 2026의 핵심 메시지는 살 수 있는 GPU보다 실제로 활용할 수 있는 전력이 성능을 좌우한다는 것입니다. 라마 3 학습에서도 GPU의 모델 연산 활용률은 40% 안팎에 그쳤고, 클러스터 규모가 커질수록 활용률은 더 낮아집니다. 추가 성능을 끌어낼 여지는 칩 자체보다 칩을 연결하는 구간에 있으며, 병목 역시 작업 형태에 따라 달라집니다.

학습에서는 랙 내부 연결, 추론에서는 메모리와 데이터 배치가 중요해지는 구조입니다. 전력이 제한되면 같은 MW 안에 더 많은 가속기를 배치하게 되고, 연결 반도체, 네트워크, 광으로 확산되는 이유입니다.

표1 Company Signal
항목 내용
크레도 (CRDO US) MW당 가속기 수 증가와 스케일업 확대 수혜. AEC에서 SerDes, 광, PCIe로 제품군이 넓어지며 연결 콘텐츠 증가에 노출
아스테라랩스 (ALAB US) 에이전트형 추론 확대로 메모리 계층화 수요 부각. PCIe와 CXL에서 가속기 인접 메모리 연결로 적용 영역 확대
루멘텀 (LITE US) 클러스터 대형화로 광 대역폭과 연결 밀도 상승. 고속화 및 신뢰성 요구 확대 속 레이저, 광원 생산능력 부각
관심종목 연결 반도체: 크레도, 아스테라랩스, 마벨 | 네트워크: 아리스타, 시스코, 브로드컴 | 광: 루멘텀, 코히어런트, 코닝

자료: 미래에셋증권 리서치센터

말은 속도조절, 계약은 확대

AI 속도조절론은 빠르게 확산되고 있지만, AI 인프라 투자 둔화로 연결됐다고 볼 근거는 없습니다. 늦추자는 대상이 컴퓨트가 아니라 프론티어 모델의 성능 향상 속도이기 때문입니다. 앤트로픽 CEO 다리오 아모데이는 성능이 향상되는 속도를 늦춰 안전성 평가와 검증이 따라갈 시간을 확보하자고 주장하며, 외부 평가기관의 접근 확대와 주요 AI 기업 간 공동 안전기준 마련, 장기적으로는 학습에 투입되는 컴퓨트나 대규모 학습 자체를 조절하는 방안까지 제시했습니다. 기술 개발을 중단하자는 것이 아니라, 프론티어 성능이 향상되는 속도를 안전장치가 따라갈 수 있도록 관리하자는 주장에 가깝습니다.

오픈AI도 비슷한 움직임을 보였습니다. 지난 8월 연구 환경의 보안과 안전장치를 강화하기 위해 최신 모델의 강화 학습을 약 2주간 중단했고, 당시 예정됐던 최대 규모의 프론티어 강화 학습도 보류했습니다. 그러나 이는 컴퓨트 수요 감소라기보다 안전성 검증을 추가한 사례에 가깝습니다. 오픈AI에 따르면 새 감시 시스템 자체가 감시 대상 추론 연산량의 약 20%에 해당하는 추가 컴퓨트를 필요로 합니다. 이후 GPT-6 아스트라도 출시한 만큼 현재까지는 개발 중단보다 안전성 검증 비용과 시간이 추가되는 모습으로 해석되는 것이 적절합니다.

학습속도를 조절하는 AI

무엇보다 속도조절론을 주장하는 기업들의 실제 투자 행동에서는 아직 컴퓨트 축소가 나타나지 않습니다. 앤트로픽은 아마존과 최대 5GW, 구글 및 브로드컴과 5GW의 차세대 TPU 용량을 확보했고, 최근에는 스페이스X의 콜로서스 1에서 300MW 이상, 엔비디아 GPU의 22만 개 이상의 용량을 추가로 확보했습니다. 앤트로픽은 이 용량을 프론티어 모델 개발뿐 아니라 빠르게 늘어나는 클로드 사용 수요 대응에 활용한다고 설명합니다. '모델 개발 속도를 조절하자'는 주장과 '컴퓨트 증설을 줄이자'는 주장은 현재 실제 행동상 동일하지 않습니다.

최근 오픈AI의 제품 출시 일정에서도 인프라 제약 가능성을 엿볼 수 있습니다. 샘 올트먼은 예정됐던 주요 제품 출시를 연기했고, 이에 오픈AI의 티보 소티오는 "가끔은 물리 법칙을 속일 수 없다"고 언급했습니다. 구체적인 원인이 공개되지 않은 만큼 이를 캐파 부족으로 단정할 수는 없지만, AI 제품의 출시 일정이 소프트웨어 개발뿐 아니라 서버, 전력 등 물리적 인프라 제약의 영향을 받을 가능성을 시사하는 정황으로 판단합니다.

속도조절론이 업계 전체의 합의로 발전한 것도 아닙니다. 샘 올트먼과 일론 머스크는 아모데이의 문제의식에 공개적으로 공감했고, 구글 딥마인드의 데미스 하사비스도 공동 평가와 안전기준 마련에 적극적인 입장입니다. 반면 엔비디아의 젠슨 황과 메타의 마크 저커버그는 업계 전체가 공동으로 개발 속도를 조절하는 방식에는 반대하고 있습니다. 머스크 역시 안전성 강화 필요성에는 동의하면서도 특정 기업에 영향력이 집중될 수 있는 민간 규제기구에는 반대했습니다. 결국 안전성 강화 필요성에는 상당한 공감대가 있지만, 누가 어떤 방식으로 개발 속도를 제한할 것인지에 대해서는 의견이 크게 갈립니다.

속도조절론을 실제 제도로 연결하려는 시도도 제동이 걸리고 있습니다. 월스트리트 저널에 따르면 하사비스가 제안한 금융산업규제국(FINRA) 형태의 민간 AI 감독기구에 대해 젠슨 황, 저커버그, 머스크 등이 반대 의견을 전달했습니다. 이들은 특정 AI 연구소에 규제 권한이 집중될 가능성 등을 우려한 것으로 전해졌습니다. 트럼프 대통령 역시 중국과의 AI 경쟁을 강조하며 추가적인 AI 규제에 부정적인 입장을 보이고 있습니다. 다만 백악관 내부에서도 안전, 안보 위험을 이유로 감독 강화를 주장하는 의견이 존재하는 만큼 미국의 장기 규제 방향이 완전히 결정된 것으로 해석할 단계는 아닙니다.

핵심 판단: 인프라 투자 둔화로 보기 어려운 근거는 세 가지입니다. ① 속도조절론을 주장하는 앤트로픽과 오픈AI도 컴퓨트 확보와 제품 개발을 지속하고 있고, ② 공동 속도조절에 대한 업계 합의가 없으며, ③ 이를 제도화하려는 시도 역시 업계와 정부 내부의 반발에 직면해 있습니다. 따라서 현 단계에서 AI 인프라 수요 전망을 낮출 필요는 없습니다. 향후 실제 컴퓨트 계약 취소, 데이터센터 착공 연기, 빅테크 CapEx 하향이 나타나는지를 확인해야 합니다.

AI Infra Summit 2026: GPU 증설에서 시스템 효율 경쟁으로

AI 인프라의 성능 기준이 GPU 연산 성능에서 시스템 전체의 실제 처리량으로 이동하고 있습니다. 얼마 전 개최된 AI Infra Summit 2026에서 엔비디아는 AI 공장의 핵심 지표로 'MW당 검증된 에이전트형 토큰 처리량'을, 퀄컴은 FLOPS가 아닌 '와트당 토큰'을 전면에 내세웠습니다. 전력이 제한된 환경에서는 GPU를 더 확보하는 것보다 같은 전력 안에 더 많은 가속기를 넣고, 가속기가 대기하는 시간을 줄이는 것이 중요해집니다. 이에 따라 AI 투자도 GPU 단품에서 메모리, 연결 반도체, 네트워크, 광으로 확산되는 구조입니다.

실제 GPU의 연산 성능은 충분히 활용되지 못하고 있습니다. 메타가 공개한 라마 3 405B 학습의 모델 연산 활용률(MFU)은 38~43%였고, GPU를 8천 개에서 1.6만 개로 늘리자 43%에서 41%로 낮아졌습니다. 클러스터가 커질수록 단순 GPU 증설의 한계가 커진다는 의미입니다. 추가 성능을 끌어낼 여지는 GPU 자체보다 GPU와 메모리, 네트워크를 연결하는 시스템에 남아 있습니다.

다만 어디가 병목인지는 학습과 추론 방식에 따라 다릅니다. 마이크로소프트의 라마 3 405B 학습 사례에서는 랙과 랙 사이 통신 비중이 1.6%에 그쳤고, 오히려 랙 내부 통신과 대기시간이 더 큰 부담이었습니다. 반면 크루소의 추론 사례는 모델을 서버 한 대 안에 담아 서버 간 통신을 줄이면서, 인피니밴드(엔비디아 전용 고속 네트워크) 없이도 8개에서 512개 GPU까지 높은 확장성을 유지했습니다. 결국 학습은 스케일업, 추론은 메모리와 데이터 배치가 더 중요할 수 있습니다. 투자도 스케일아웃뿐 아니라 스케일업과 메모리 연결을 함께 봐야 합니다.

전력 제한은 이 전환을 앞당깁니다. 엔비디아와 람다는 동일한 전력 한도에서 서버 노드를 16개에서 19개로 늘려 토큰 처리량을 24%, 전력당 성능을 23% 높였습니다. 엔비디아는 차세대 시스템에서 같은 전력 안에 GPU를 최대 40% 더 배치할 수 있다고 제시했습니다. 전력 효율 개선이 장비 수요 감소를 의미하는 것이 아니라 오히려 MW당 가속기와 연결 콘텐츠를 늘리는 구조입니다. 가속기가 늘면 포트, 케이블, 광모듈도 함께 증가합니다.

광트랜시버

에이전트형 AI는 이 입력을 메모리와 데이터 이동으로 확산시킵니다. 엔비디아가 제시한 사례에서 2023년 챗봇형 작업은 입력 토큰 약 1천 개, 대화 3회 수준이었던 반면 최근 에이전트형 작업은 평균 14.2만 개의 입력 토큰과 65회의 반복 작업으로 늘어났습니다. 긴 문맥과 KV 캐시를 저장하고 반복적으로 불러오는 부담이 급증하면서 연산량보다 데이터를 어디에 두고 어떻게 이동하느냐가 추론 원가를 좌우하기 시작했습니다. SK하이닉스의 PIM과 HBF, 아스테라랩스의 외부 메모리 연결 구조도 같은 방향입니다.

신뢰성의 가치도 높아지고 있습니다. 대형 클러스터의 광 트랜시버 수는 2023년 10만 개 이상에서 2025년 1천만 개 이상으로 늘었고, 같은 조건에서 링크 이상 발생 간격은 3시간에서 48초로 짧아졌습니다. 일부 고객에서는 광 링크 문제로 가동시간의 20~30%가 손실된 사례도 제시됐습니다. 광의 경쟁 기준도 포트 속도뿐 아니라 상태 모니터링, 장애 격리와 복구 능력으로 확대되고 있습니다. 동일한 대역폭이라면 더 높은 가동시간을 제공하는 제품의 경제적 가치가 높아질 수밖에 없습니다.

결국 전력이 제한된 환경에서 증설의 단위는 더 이상 GW만이 아닙니다. MW당 가속기 수, 가속기당 연결 콘텐츠, 그리고 이를 실제 가동시간으로 전환하는 시스템 신뢰성이 다음 투자 변수가 되고 있습니다. AI 인프라의 투자 중심도 GPU 단품에서 메모리, 연결 반도체, 네트워크, 광을 포함한 시스템 전체로 확산될 것으로 보입니다.

GPU보다 빠르게 커지는 가속기당 연결 콘텐츠

AI 인프라 투자에서 봐야 할 변수는 GPU 출하량 자체보다 가속기 한 대를 실제로 가동하기 위해 필요한 주변 BOM이 얼마나 빠르게 늘어나는가입니다. 수요를 단순히 데이터센터 GW와 GPU 수의 곱으로 보면 이 변화가 잘 드러나지 않습니다. 향후에는 '가동 MW × MW당 가속기 수 × 가속기당 연결 콘텐츠'로 나눠볼 필요가 있으며, 전력 제약이 심할수록 뒤의 두 항이 더 빠르게 늘어납니다.

전력이 제약되면서 같은 MW 안에 더 많은 가속기를 배치하는 경쟁이 시작됐습니다. 가속기 수가 늘면 스위치 포트, 케이블, 광 모듈도 함께 늘고, 스케일업 도메인이 커질수록 가속기당 연결 대역폭도 높아집니다. 에이전트 AI는 여기에 메모리 용량과 데이터 이동 부담까지 추가합니다. 결국 데이터센터 전력 증가율보다 연결 콘텐츠 증가율이 더 높아질 수 있는 구조입니다.

표2 AI 인프라 구조 변화별 수혜 콘텐츠와 노출 기업
변화 늘어나는 콘텐츠 주요 노출 기업
같은 MW 내 가속기 추가 스위치 포트, 케이블, 광 모듈 아리스타, 시스코, 크레도
스케일업 도메인 확대 고속 SerDes, 스케일업 광·구리 연결 브로드컴, 마벨, 크레도
메모리 계층화 PCIe, CXL, 리타이머, 메모리 컨트롤러 아스테라랩스, 크레도
클러스터 대형화 광 대역폭, 상태 진단, 장애 관리 루멘텀, 코히어런트, 코닝

주: 아리스타, 시스코, 크레도는 당사 커버리지이며 나머지는 관심종목
자료: 미래에셋증권 리서치센터

다만 모든 연결이 같은 속도로 커지는 것은 아닙니다. 복제형 추론처럼 노드 간 동기화가 적은 워크로드에서는 스케일아웃 대역폭 수요가 상대적으로 완만할 수 있습니다. 반면 스케일업 연결과 메모리 연결의 중요도는 높아집니다. 따라서 네트워크 투자에서도 단순한 대역폭 총량보다 어느 계층의 연결을 공급하는지가 종목 선별의 핵심입니다.

프론티어 모델의 개발 속도가 일부 조절되더라도 컴퓨트 확보는 이어지고 있고, 전력 제약은 오히려 시스템 효율화 투자를 앞당기고 있습니다. 실적에서 확인할 시점은 2027년으로 판단합니다. 대형 고객향 물량은 설치 후 검수 완료 시점에 매출로 인식되기 때문에 2026년 하반기 구축분이 2027년 매출로 전환되고, 1.6T급 광 연결 전환과 ASIC 랙 증설이 겹치면서 가속기당 연결 콘텐츠 상승이 본격적으로 실적에 반영될 것으로 전망합니다.

AI 인프라의 다음 투자 포인트는 더 많은 GW가 아니라, 같은 MW에 더 많은 가속기를 넣고 가속기 한 대당 더 많은 연결 콘텐츠를 붙이는 구조적 변화입니다.