네트워크의 모든 구성 요소가 인공지능(AI)에 의해 개선되고 있습니다. 대규모 언어 모델(Large Language Model) 학습 작업, 분산 추론 엔진 실행, 여러 컴퓨터 클러스터 간 대량 데이터 동기화 등은 데이터 센터를 연결하는 상호 연결망(interconnect)에 전례 없는 부담을 주고 있습니다. AI 워크로드에는 이제 100G가 부족하며, 400G는 목표치가 아니라 새로운 기준치로 빠르게 자리 잡고 있습니다. 이에 800G DCI가 등장했습니다—AI 데이터 센터 상호 연결을 위한 새로운 표준입니다.
800G DCI에 대한 수요 증가
800G로의 경주 DCI 여러 요인이 복합적으로 작용하면서 발생하고 있습니다. 첫째, AI 모델의 규모가 급격히 확대되었습니다. 파라미터 수는 수백만에서 수십억, 수조 단위로 증가했습니다. 이러한 대규모 모델을 여러 데이터센터 내 다양한 포드에 분산 배치하려면 데이터센터 간 막대한 대역폭이 필요합니다. 둘째, 분산 학습 방식이 도입되면서 데이터센터 포드를 단일 건물 내에 배치하는 대신, 전체 메트로 지역에 걸쳐 동일한 컴퓨팅 클러스터로 구성하게 되었습니다. 셋째, 사기 탐지 및 자율 시스템과 같은 실시간 애플리케이션은 엄청난 처리량과 동시에 일관되고 예측 가능한 낮은 지연 시간을 요구합니다. 마지막으로, 사설 AI 인프라로의 전환 추세에 따라 상호 연결 링크에 가해지는 총 부하가 계속해서 증가하고 있습니다. 기존의 100G 및 200G DCI 기술은 기존 워크로드에는 적합하지만, AI 워크로드에서는 병목 현상이 발생합니다. 800G DCI는 성장 여유를 제공함으로써 대역폭 수요를 충족시킵니다.
AI 데이터센터 내 대역폭 압박
AI 학습 트래픽의 특성상 일반 애플리케이션과 비교해 인터커넥트 링크에 비정형적으로 높은 부하를 가합니다. 학습 과정에서 각 배치 종료 시점에 모든 참여 컴퓨팅 노드 간에 모델 그래디언트를 동기화해야 합니다. 이 '올-리듀스(all-reduce)' 트래픽은 동기화된 트래픽 버스트로 구성되어, 고용량 링크조차 포화시킬 수 있습니다. 또한 주기적으로 분산 스토리지에 체크포인트를 저장함으로써 추가적인 부하가 발생할 수 있습니다. 데이터 준비 파이프라인은 스토리지 계층과 컴퓨팅 포드 사이에서 지속적으로 데이터를 이동시키는 흐름일 수도 있습니다. 이 세 가지 이벤트가 동시에 발생할 경우, 링크의 총 부하가 배가됩니다. 800G DCI는 큐잉 없이 단일 파장으로 전체 올-리듀스 버스트를 인터커넥트를 통해 전송함으로써 이러한 부하를 해결합니다. 인터커넥트 내 백프레셔를 줄이면 AI 학습 작업을 선형적으로 확장할 수 있습니다.
저지연은 AI 서비스에 매우 중요합니다
대역폭만으로는 AI 상호 연결 문제를 해결하기에 부족하며, 낮은 지연 시간도 매우 중요합니다. 전반적으로 데이터 센터 , 통신 지연 시간은 전체 훈련 처리량에 영향을 미치는데, 이는 컴퓨팅 클러스터 내의 컴퓨팅 노드가 동료 노드를 기다려야 하기 때문입니다. 이로 인해 귀중한 GPU 리소스가 비효율적으로 사용됩니다. 높은 지연 시간은 자율 주행 시스템, 사기 탐지, 실시간 추론과 같은 AI 서비스에서 사용자 경험을 저하시킬 수 있습니다. 800G DCI는 더 빠른 심볼 레이트(패킷 지연 시간 감소)와 보다 고급화된 전방 오류 정정(FEC) 기술을 통해 지연 시간을 줄입니다. 또한 광학 경로는 라우터를 우회하여 패킷 전송 경로상의 추가 지연을 방지합니다. 800G DCI를 통해 AI 컴퓨팅 클러스터를 직접 연결할 경우, 데이터센터 간 지연 시간을 밀리초 단위에서 마이크로초 단위로 줄일 수 있어, 캠퍼스 전체에 걸쳐 분산된 단일 컴퓨팅 클러스터처럼 분산 훈련을 실제로 구현할 수 있습니다.
800G DCI 업그레이드의 주요 이점
800g DCI 낮은 속도에 비해 여러 측면에서 우위를 점합니다. 800G의 스펙트럼 효율은 400G의 두 배로, 운영자는 동일한 광섬유 인프라에서 처리량을 두 배로 늘릴 수 있습니다. 또한 800G는 전송된 비트당 에너지 소비가 두 개의 400G 링크를 구동할 때보다 낮기 때문에 전력 소비도 감소합니다. 단일 인터페이스를 통해 스위치 및 라우터의 포트 밀도가 크게 증가하여 컴퓨팅 연결을 위한 여유 용량을 확보할 수 있습니다. 파장 관리 단순화를 통해 운영 효율성도 향상됩니다. 새로운 800G 속도는 네트워크의 미래 대응력을 강화해 주며, 현재 수요를 쉽게 충족시킬 수 있을 뿐 아니라 AI 트래픽이 매년 예상되는 50%씩 증가함에 따라 인터커넥트 업그레이드 시점이 훨씬 더 늦춰집니다. 대규모 데이터 전송을 요구하는 테넌트를 관리하는 클라우드 및 데이터센터 운영자에게 800G DCI는 명확한 비즈니스적 이점을 제공합니다.
신속한 확장을 위한 유연한 배포
AI 시스템의 배포 속도가 빨라짐에 따라 인터커넥트 계층이 병목 현상을 일으킬 수 있습니다. 800G DCI는 유연한 배포 옵션을 제공합니다. 메트로 네트워크 내에서 더 긴 전송 거리를 확보하려면 광선로 시스템을 활용해 전송 거리를 연장하면서 데이터 전송률을 극대화할 수 있습니다. 표준 스위치 인터페이스에 장착 가능한 800G 플러그형 광학 모듈은 가장 빠른 배포를 가능하게 하며, 단순히 삽입하고 연결한 후 프로비저닝하기만 하면 됩니다. 새로운 데이터센터 캠퍼스를 구축하는 기업은 관리 및 성능 모니터링에 대한 제어력을 높일 수 있는 전용 800G DCI 플랫폼을 활용할 수 있습니다. 이러한 솔루션을 보완하는 차이나텔레콤의 DCI-BOX 장치는 엣지 데이터센터 및 신속한 서비스 롤아웃에 특화된 초소형, 사전 통합, 경제적인 DCI 솔루션을 제공합니다. 채널당 최대 800G를 지원하는 DCI-BOX는 공간과 전력 소비를 최소화하면서 플러그앤플레이 방식의 배포를 실현합니다. 원격 POP(Points of Presence)에서 독립형 장치로 사용되든, 보다 규모가 큰 메시 네트워크의 일부로 사용되든 상관없이 DCI-BOX는 AI 기반 수요 증가에 맞춰 용량을 확장할 수 있도록 보장하며, 배포 시간을 며칠에서 단 몇 시간으로 단축합니다. 운영 환경에 관계없이 800G DCI는 며칠이 아닌 몇 시간 안에 배포할 수 있어, AI 인프라의 성장 및 규모 확장 속도에 부응합니다.

ISP 및 데이터센터를 위한 아이디얼 800G 옵션
다양한 조직은 800G DCI에 대해 각기 다른 요구 사항을 가지고 있습니다. 컴퓨팅 역량 확장을 중점으로 하는 AI 학습 데이터센터의 경우, 높은 처리량과 낮은 지연 시간이 필요하므로 클러스터 간 포인트 투 포인트 800G DCI가 이상적입니다. 여러 AI 고객에게 상호 연결 서비스를 제공하는 ISP는 트래픽 급증 시 한 고객의 트래픽이 다른 고객에게 영향을 주지 않도록 엄격한 파장 격리가 필요합니다. 여러 송신기로 구성 가능한 800G DCI 플랫폼을 통해 ISP는 파장을 개별적으로 할당하고 요금을 부과할 수 있습니다. 모든 고객은 또한 비트 오류로 인해 계산 작업이 마지막 체크포인트부터 다시 시작되지 않도록 신뢰성을 확보해야 합니다.
성장에 대비한 즉시 사용 가능한 800G 솔루션
시노텔레콤의 800G DCI 솔루션 aI 데이터 센터 간 연결 요구 사항에 맞게 최적화되어 있습니다. 장거리 네트워크 또는 다중 홉 환경의 경우, 증폭기, 분산 보상 및 채널 모니터링 기능이 통합된 DCI 플랫폼을 제공합니다. 당사 시스템은 무중단 용량 조정 기능과 상세한 진단 도구, 그리고 통합 관리 인터페이스를 제공합니다. 당사는 240건 이상의 특허와 150건 이상의 소프트웨어 저작권을 보유하고 있으며, 프랑스, 브라질, 호주, 인도네시아 등 30개 이상의 국가에서 네트워크와 협력하고 있습니다. 당사의 제품 포트폴리오에는 스위치 포트에서 광섬유 링크까지 포괄적인 솔루션을 지원하는 200G, 400G, 800G 플러그형 광학 모듈 전 제품군도 포함되어 있습니다.