
AI 서비스를 사용하면 화면에서는 질문을 입력하고 답을 받는 과정만 보입니다.
하지만 그 뒤에서는 실제 서버와 반도체가 계산하고 있습니다. 특히 규모가 큰 AI 모델을 학습하거나 많은 연산을 처리할 때는 하나의 GPU가 아니라 여러 GPU를 함께 사용하는 경우가 있습니다. NVIDIA도 대규모 AI 학습과 추론을 위해 GPU와 GPU 사이를 고속으로 연결하는 전용 연결 구조를 제공하고 있습니다.
그래서 최근에는 AI 데이터센터(AI Data Center)라는 표현도 자주 등장합니다.
그런데 여기서 한 가지 궁금한 점이 생깁니다.
기존 데이터센터에 GPU를 많이 설치하면 그냥 AI 데이터센터가 되는 것 아닐까요?
AI 데이터센터를 GPU의 개수나 비율만으로 구분할 수는 없습니다.
대규모 AI 연산에서는 여러 GPU가 하나의 작업을 나누어 계산하고, 서로의 계산 결과를 빠르게 주고받으며 함께 작업해야 하는 경우가 많다는 점이 중요합니다.
그래서 AI 데이터센터에서는 GPU 자체의 성능뿐 아니라 GPU와 GPU를 빠르게 연결하는 내부 네트워크가 특히 중요합니다.
여기에 많은 고성능 장비를 함께 운영하면서 필요한 전력과 냉각 환경도 함께 고려해야 합니다. ASHRAE도 AI 데이터센터 설계에서 전력과 냉각을 주요 설계 요소로 다루고 있습니다.
데이터센터는 무엇을 하는 곳일까?
데이터센터는 서버와 저장장치, 네트워크 장비 등을 모아 운영하는 시설입니다.
우리가 사용하는 웹사이트와 앱, 기업의 업무 시스템과 클라우드 서비스도 데이터센터의 서버에서 실행될 수 있습니다.
서버를 계속 작동시키려면 컴퓨터만 가져다 놓아서는 안 됩니다.
- 장비에 전력을 안정적으로 공급해야 합니다.
- 서버에서 발생하는 열을 제거해야 합니다.
- 서버와 서버를 네트워크로 연결해야 합니다.
- 많은 장비를 안정적으로 운영할 수 있는 환경이 필요합니다.
따라서 데이터센터에는 서버뿐 아니라 전력·냉각·네트워크 같은 기반 시설도 함께 필요합니다.
AI 데이터센터도 이런 기본 요소는 같습니다.
차이는 AI 연산을 위해 여러 고성능 연산 장비를 함께 사용하면서 장비를 연결하는 방법과 이를 지원하는 환경이 달라질 수 있다는 것입니다. ASHRAE도 AI 데이터센터에서는 전력·냉각·시설 구조를 서로 분리된 문제가 아니라 함께 설계해야 하는 요소로 보고 있습니다.
AI 데이터센터에는 CPU 대신 GPU가 들어갈까?
앞선 글에서는 GPU가 많은 계산을 동시에 처리하는 데 적합해 AI 연산에 널리 사용된다는 내용을 살펴봤습니다.
그렇다고 AI 서버가 CPU를 빼고 그 자리에 GPU만 넣은 컴퓨터라는 뜻은 아닙니다.
AI 서버에서도 CPU와 GPU를 함께 사용할 수 있습니다.
CPU가 시스템의 여러 작업을 처리하고, GPU가 대규모 AI 연산을 담당하는 식입니다. 실제 AI용 데이터센터 제품도 GPU뿐 아니라 CPU와 네트워크 장비 등을 함께 구성합니다.
여러 CPU와 GPU를 하나의 서버 랙(server rack) 안에 구성하기도 합니다.
서버 랙은 서버와 네트워크 장비 등을 위아래로 장착해 사용하는 큰 금속 프레임이나 캐비닛입니다.
데이터센터 사진에서 서버가 여러 층으로 빼곡하게 들어가 있는 큰 장을 떠올리면 이해하기 쉽습니다.
중요한 것은 GPU가 몇 개 들어가느냐가 아닙니다.
여러 GPU를 하나의 큰 연산에 함께 사용할 때 이 장비들을 어떻게 연결할 것인가가 AI 데이터센터를 이해하는 중요한 출발점입니다.
여러 GPU가 하나의 문제를 함께 계산한다
일반 데이터센터에도 많은 서버가 연결되어 있습니다.
하지만 각 서버가 서로 다른 역할을 담당하는 경우가 많습니다.
예를 들어 웹사이트를 보여주는 서버가 필요한 정보를 데이터베이스 서버에 요청할 수 있습니다.
쉽게 비유하면 한 사람은 고객을 응대하고 다른 사람은 필요한 자료를 찾아주는 것과 비슷합니다.
서로 정보를 주고받지만 각자가 맡은 일은 다릅니다.
대규모 AI 연산에서는 조금 다른 상황이 생깁니다.
AI 모델의 규모가 크거나 많은 계산을 빠르게 처리해야 한다면 여러 GPU를 불러 하나의 큰 문제를 나누어 계산하게 할 수 있습니다. NVIDIA의 GPU 연결 기술도 AI 학습과 추론에서 여러 GPU가 빠르게 서로 통신할 수 있도록 설계되어 있습니다.
쉽게 말하면,
“각자 자기 일 해.”보다 “다 모여봐. 우리 이 문제 하나 같이 풀어야 해.”에 가깝습니다.
GPU마다 하나의 큰 계산에서 맡은 부분이 있고, 계산 과정에서 다른 GPU의 결과가 필요할 수 있습니다.
그래서 한 GPU가 자신의 계산을 끝내더라도 필요한 결과가 아직 도착하지 않았다면 다음 계산을 기다려야 할 수 있습니다.
즉 GPU 하나의 계산 속도가 아무리 빨라도 GPU들이 서로 결과를 주고받는 속도가 느리면 전체 AI 연산도 느려질 수 있습니다.
그래서 대규모 AI 시스템에서는 GPU 한 개의 성능만큼이나 여러 GPU를 얼마나 빠르게 연결할 수 있는가가 중요해집니다.

그래서 AI 데이터센터에서는 내부 네트워크가 특히 중요하다
일반 데이터센터에서도 네트워크는 중요합니다.
사용자의 요청을 서버에 전달해야 하고, 서로 다른 역할을 하는 서버들도 필요한 데이터를 주고받아야 합니다.
하지만 여러 GPU가 하나의 AI 연산을 함께 처리하면 네트워크의 역할이 하나 더 생깁니다.
GPU들이 하나의 문제를 함께 풀기 위해 서로의 계산 결과를 빠르게 주고받아야 합니다.
사람 여러 명이 한 문제를 함께 푼다고 생각해 보겠습니다.
각자 맡은 부분을 아무리 빨리 풀어도 서로의 결과를 늦게 전달한다면 다른 사람이 다음 계산을 이어가기 어렵습니다.
GPU도 비슷합니다.
그래서 AI 데이터센터에서는 외부의 사용자와 서버를 연결하는 네트워크뿐 아니라 GPU와 GPU, 서버와 서버를 빠르게 연결하는 내부 네트워크가 AI 연산 성능에 직접 영향을 줄 수 있습니다.
실제로 NVIDIA는 여러 GPU가 하나의 큰 연산 장치처럼 동작할 수 있도록 GPU 간 고속 통신을 위한 NVLink와 NVLink Switch를 제공하고 있습니다. 최신 랙 단위 시스템에서는 수십 개의 GPU를 하나의 NVLink 영역으로 연결하기도 합니다.
기술 이름을 모두 외울 필요는 없습니다.
중요한 것은 차이입니다.
일반적인 서버 환경에서는 여러 장비가 각자의 일을 하면서 필요한 정보를 주고받는다면, 대규모 AI 환경에서는 여러 GPU가 하나의 일을 함께 하기 위해 계산 결과를 계속 주고받을 수 있습니다.
그래서 AI 데이터센터를 볼 때는 GPU가 몇 개 있는지만 볼 것이 아니라 그 GPU들이 얼마나 빠르게 서로 연결되어 있는가도 함께 봐야 합니다.
여러 GPU를 한곳에서 돌리면 전력도 필요하다
AI 데이터센터에서 전력 이야기가 많이 나오는 이유도 GPU가 특별한 전기를 사용하기 때문은 아닙니다.
대규모 AI 시스템에서는 CPU와 GPU, 메모리와 네트워크 장비 등 많은 고성능 장비를 한곳에 모아 동시에 운영할 수 있습니다.
그만큼 서버 랙 하나 또는 일정 공간에 필요한 전력이 커질 수 있습니다.
ASHRAE도 AI와 고성능 컴퓨팅 환경에서는 기존 데이터센터보다 높은 전력 사용이 한곳에 집중되는 구성이 나타날 수 있다고 설명하며, 데이터센터 설계 단계부터 충분한 전력 공급 능력을 고려하도록 권고하고 있습니다.
따라서 기존 데이터센터에 AI 장비를 대규모로 추가하려면 서버가 들어갈 자리만 확인해서는 부족할 수 있습니다.
그 장비에 필요한 전력을 실제로 공급할 수 있는지도 함께 확인해야 합니다.
다만 이것은 AI 데이터센터와 일반 데이터센터를 나누는 가장 중요한 차이라기보다는 많은 고성능 연산 장비를 함께 운영하면서 커지는 물리적 조건으로 이해하는 것이 좋습니다.
많은 장비를 돌리면 냉각 방식도 달라질 수 있다
GPU가 CPU보다 항상 더 뜨겁다고 단순하게 말할 수는 없습니다.
중요한 것은 많은 고성능 연산 장비가 한곳에서 전력을 사용하면 그만큼 한곳에서 제거해야 할 열도 많아질 수 있다는 점입니다.
기존 데이터센터에서는 차가운 공기를 서버에 보내 열을 식히는 공랭 방식이 널리 사용됩니다.
하지만 높은 전력을 사용하는 장비가 좁은 공간에 집중되면 공기만으로 열을 제거하기 어려운 환경도 생길 수 있습니다.
그래서 고밀도 AI 시스템에서는 액체 냉각(Liquid Cooling)도 중요해지고 있습니다. ASHRAE도 고밀도 AI와 고성능 컴퓨팅 환경에서 액체 냉각을 중요한 냉각 방식으로 제시하고 있습니다.
대표적인 방법 가운데 하나는 GPU나 CPU 가까이까지 냉각수를 보내 열을 가져오는 직접 칩 냉각(Direct-to-Chip Liquid Cooling)입니다.
모든 AI 데이터센터가 반드시 액체 냉각을 사용해야 하는 것은 아닙니다.
사용하는 장비와 배치 방식에 따라 기존 공랭으로 운영할 수도 있습니다.
하지만 한곳에 많은 고성능 장비를 배치할수록 발생한 열을 어떻게 빠르게 제거할 것인가가 더 중요한 문제가 됩니다.

이런 냉각 부담을 줄이려는 방법 가운데 하나로 최근에는 바닷물을 냉각에 활용할 수 있는 해저 데이터센터도 다시 관심을 받고 있습니다. 실제로 중국에서는 해수를 냉각에 활용하는 상업용 해저 데이터센터와 AI 연산용 시설이 구축되고 있습니다.
즉 AI 데이터센터의 냉각 문제는 단순히 에어컨을 더 많이 설치하는 문제가 아니라 많은 연산 장비에서 발생하는 열을 어떤 방식으로 밖으로 옮길 것인가의 문제입니다.
일반 데이터센터와 AI 데이터센터를 비교하면?
AI 데이터센터의 특징은 GPU라는 특정 부품 하나에 있지 않습니다.
특히 대규모 AI 연산에서는 여러 GPU가 하나의 작업을 함께 수행할 수 있도록 빠르게 연결하는 구조가 중요해진다는 점이 가장 이해하기 쉬운 차이입니다.
| 구분 | 일반적인 서버 중심 데이터센터 | 대규모 AI 연산을 위한 데이터센터 |
|---|---|---|
| 장비의 역할 | 여러 서버가 각자의 업무를 처리 | 여러 GPU가 하나의 연산을 나누어 처리할 수 있음 |
| 장비 간 통신 | 각 서버가 필요할 때 데이터를 주고받음 | 같은 연산에 참여하는 GPU들이 계산 결과를 빠르게 주고받아야 할 수 있음 |
| 내부 네트워크 | 서버와 서비스의 연결에 사용 | GPU 간 연결 속도가 AI 연산 성능에 직접 영향을 줄 수 있음 |
| 전력 | 서버 구성에 맞춰 공급 | 많은 고성능 장비를 한곳에 배치하면 높은 전력이 필요할 수 있음 |
| 냉각 | 공랭 방식이 널리 사용됨 | 고밀도 구성에서는 액체 냉각이 필요할 수 있음 |
모든 AI 데이터센터가 똑같은 구조를 사용하는 것은 아닙니다.
작은 AI 서비스를 운영하는 서버와 매우 큰 AI 모델을 학습하기 위해 많은 GPU를 연결한 시스템은 필요한 환경이 다릅니다.
또한 일반 데이터센터에서도 GPU를 사용할 수 있고, 여러 서버가 하나의 작업을 나누어 처리하는 시스템도 있습니다.
따라서 AI 데이터센터와 일반 데이터센터 사이에 GPU의 유무만으로 나눌 수 있는 절대적인 경계가 있는 것은 아닙니다.
다만 대규모 AI 연산에서는 여러 GPU가 같은 문제를 함께 처리하는 구조가 많이 사용되면서 GPU 사이의 빠른 네트워크 연결이 특히 중요해지고, 많은 고성능 장비를 지원하기 위한 전력과 냉각 요구도 함께 커질 수 있습니다.
DANA NOTES 한 줄 정리
여러 사람이 하나의 문제를 나누어 풀고 서로의 답을 공유하며 답을 찾아가는 집단지성처럼, 대규모 AI 연산에서는 여러 GPU가 하나의 문제를 나누어 계산하고 결과를 주고받습니다. 그래서 AI 데이터센터에서는 일반적인 데이터센터보다 GPU 사이의 빠른 네트워크 연결이 특히 중요합니다.


