IT전산/NAS·스토리지

AI 인프라 구축, GPU 서버만큼 스토리지 설계가 중요한 이유

CHANGLI 2026. 9. 29. 15:40

AI 구축에는 스토리지 설계도 중요합니다

나스_창리정보통신

기업에서 AI 구축을 검토할 때 가장 먼저 관심을 갖는 장비는 대부분 GPU 서버입니다.
어떤 GPU를 몇 장 넣을지, 
메모리는 얼마나 필요한지를 먼저 비교하게 되는데요.
물론 AI 연산에서 GPU의 성능은 매우 중요합니다.
하지만 AI 인프라는 GPU 서버 한 대만으로 완성되지 않습니다.

 

AI가 사용할 데이터가 어디에 저장되어 있고, 
그 데이터를 얼마나 빠르게 읽어 GPU까지 전달할 수 있는지에 따라 
실제 연산 효율이 달라질 수 있기 때문입니다.
특히 기업 내부 데이터를 활용해 AI 데이터레이크를 구축하거나 
대규모 데이터를 학습·분석하는 환경이라면
GPU 서버 못지 않게 스토리지 성능과 설계에 신경써야 합니다.

 


데이터레이크, 스토리지 설계가 중요한 이유

AI_연산과 _올플래시_스토리지

AI 학습 과정에서는 스토리지에 저장된 데이터를 읽고, 
네트워크를 통해 GPU 서버로 전달한 뒤 연산을 수행합니다.
GPU가 연산을 수행한 뒤에는 학습 결과와 모델 상태를 다시 저장하는 작업도 반복됩니다.
데이터→ 스토리지→ 네트워크→ GPU 서버→ AI 연산→ 결과 및 체크포인트 저장
결국 이 모든 과정이 하나로 순환됩니다.
GPU의 연산 성능은 충분한데 스토리지에서 데이터를 읽어오는 속도가 느리다면 
GPU가 데이터를 기다리는 시간이 생길 수 있습니다.
데이터를 한곳에 모아 원본 형태로 보관하고 꺼내쓰는 
데이터레이크(Data Lake) 역할을 하는 스토리지 설계가 중요한 이유입니다.

 


AI구축에 올플래시 스토리지, NVMe 스토리지가 필요한 이유

올플래시_스토리지

 

일반적인 파일 서버나 NAS를 도입할 때는 
50TB, 100TB처럼 필요한 저장 용량부터 계산하는 경우가 많습니다.
하지만 AI 스토리지를 용량만으로 판단하는 것은 불리합니다.

얼마나 빠르게 데이터를 읽고 쓸 수 있는지,
몇 대의 GPU 서버가 동시에 접근하는지,
작은 파일과 대용량 파일 중 무엇이 많은지,
학습과 추론 중 어떤 작업이 중심인지,
체크포인트를 얼마나 자주 기록하는지,
네트워크에서 어느 정도의 대역폭을 확보할 수 있는지까지 함께 봐야 합니다.

 

큐샌_스토리지

여기에서 Throughput, Latency, IOPS 같은 개념이 중요해집니다.
Throughput은 일정 시간 동안 얼마나 많은 데이터를 전달할 수 있는지,
Latency는 데이터를 요청한 뒤 응답을 받기까지의 지연시간,
IOPS는 초당 얼마나 많은 입출력 작업을 처리할 수 있는지를 의미합니다.

​이 때문에 고성능 AI 구축에서는 
올플래시 스토리지나 NVMe 스토리지를 검토하게 됩니다.
그 중에서도 NVMe는 SATA보다 높은 대역폭을 사용할 수 있는 
PCIe 기반 인터페이스를 이용하기 때문에 고속 SSD의 성능을 활용하는 데 유리합니다.

 


QSAN XN4226S-4C로 보는 NVMe 스토리지

QSAN_고성능서버

 

이러한 고성능 데이터 처리 환경에서 살펴볼 수 있는 장비가 
큐샌(QSAN)의 XCubeNXT XN4226S-4C입니다.

 

유니파이드스토리지

XN4226S-4C는 2U 랙마운트 크기에 
2.5인치 U.2 NVMe SSD 26개를 장착할 수 있는 Unified Storage입니다.
이 모델의 특징은 단순히 NVMe SSD를 많이 넣을 수 있다는 데 있지 않습니다.
NVMe 기반으로 스토리지 내부의 데이터 병목을 줄이고,
10GbE에서 25GbE·100GbE와 Fibre Channel까지 연결 대역폭을 확장하고,
듀얼 전원공급장치와 Cache-to-Flash를 통해 
예상하지 못한 장애 상황까지 대비하는 구조를 갖추고 있다는 점이 
기업용 AI 인프라에서 눈여겨볼 부분입니다.

 

MVNe_스토리지

 

NFS와 CIFS 같은 파일 방식은 물론 iSCSI, FCP, NVMe-oF도 지원하기 때문에 
기존 파일 서버 환경과 고성능 블록 스토리지 환경을 함께 구성할 수 있다는 것도 특징입니다.
특히 NVMe-oF는 고속 네트워크를 통해 외부 NVMe 스토리지에 접근하는 기술로 
NVMe의 빠른 I/O 성능을 서버 외부의 공유 스토리지 구조로 확장할 때 활용할 수 있습니다.

​이처럼 빠른 데이터 처리가 가능한 유니파이드 스토리지 이기 때문에
여러 GPU 서버가 동시에 대용량 데이터를 읽는 환경에서
더욱 유리하게 사용할 수 있습니다.

 


 

네트워크 설계도 중요합니다

AI인프라_구축

 

이처럼 XN4226S-4C 는 NVMe-oF 기능이나 고속 네트워크 확장을 지원하지만
그만큼 주변의 네트워크 환경도 받쳐줘야 합니다.
예를 들어 스토리지와 GPU 서버가 모두 100GbE를 지원하더라도 
중간 스위치나 업링크 구간이 이를 따라가지 못한다면 그 구간에서 다시 병목이 발생하기 때문이죠.
그래서 AI 인프라를 구축할 때에는
GPU 서버, 스토리지, 네트워크 까지 하나의 흐름으로 묶어 설계할 필요가 있습니다.

 


AI 구축은 결국 장비 구매가 아닌 인프라 설계입니다

 

AI구축_인프라_설계

 

 

 

결국 중요한 것은 가장 비싼 GPU를 선택하는 것이 아닙니다.
우리 회사가 어떤 데이터를 AI에 활용할지, 어느 정도의 처리량이 필요한지, 
향후 GPU 서버와 데이터가 얼마나 증가할지를 먼저 계산하고 
그에 맞춰 데이터레이크 역할을 하는 스토리지의 설계를 함께해야 합니다.
기업에서 자체적인 AI 인프라 구축을 계획하고 계시다면
서버와 네트워크, 스토리지 환경을 함께 검토해 
데이터 규모와 업무 목적에 맞는 인프라를 구성하시기 바랍니다.