[워크삽] AWS 트레니엄 기반 vLLM 워크삽(1)-기초개념
대규모 생성형 AI 모델을 호스팅할 때 알아야 할 기본 개념을 살펴본다. 또한 AWS Trainium 하드웨어를 vLLM 및 NeuronX Distributed(NxD)와 결합해 대규모 모델 배포 문제를 해결하는 방법을 알아본다.
1. 대규모 언어 모델 배포의 어려움
대규모 언어 모델을 실제 서비스 환경에서 추론용으로 배포하면 기존 방식만으로 해결하기 어려운 몇 가지 중요한 문제가 발생한다.
-
1-1. 메모리 제약(Memory Constraints): Llama 3.1 8B와 같은 모델은 FP32 형식의 가중치만 저장해도 32GB 이상의 메모리가 필요하다. 이는 단일 가속기가 제공하는 메모리 용량을 초과할 수 있다.
-
1-2. 성능 병목: 추론 지연 시간이 길고 처리량이 제한되면 사용자가 응답을 오래 기다려야 한다. 결과적으로 서비스의 전반적인 사용자 경험이 나빠진다.
-
1-3. 비용 비효율(Cost Inefficiency): 가속기와 컴퓨팅 자원을 효율적으로 활용하지 못하면 인프라 운영 비용이 증가한다.
-
1-4. 운영 복잡성(Operational Complexity): 여러 가속기에 걸쳐 모델을 분산 배포하고 운영하려면 분산 시스템과 AI 인프라에 대한 전문적인 지식이 필요하다.
모델의 크기가 계속 증가하면 이러한 문제는 더욱 뚜렷해진다. 따라서 실제 운영 환경에서 대규모 모델을 성공적으로 서비스하려면 효율적인 배포 전략이 반드시 필요하다.
2. 전체 추론 스택
AWS는 Trainium 하드웨어에서 대규모 모델을 배포할 수 있도록 다음과 같은 통합 추론 스택을 제공한다.

표로 정리하면 다음과 같다.
| 계층 | 주요 구성 요소 |
|---|---|
| 모델 서버 | Hugging Face Text Generation Inference, vLLM, SageMaker Large Model Inference, NVIDIA Triton Inference Server, Ray Serve, TorchServe |
| 컴퓨팅 및 오케스트레이션 | AWS ParallelCluster, Amazon SageMaker, AWS Batch, Amazon ECS, Amazon EKS |
| 실행 환경 | Neuron 딥러닝 컨테이너(Neuron DL Containers), Neuron 딥러닝 AMI(Neuron DLAMIs) |
| 소프트웨어 개발 환경 | AWS Neuron SDK |
| AI 가속 하드웨어 | AWS Trainium 및 Inferentia 인스턴스 |
이 스택은 전용 AI 가속 하드웨어와 소프트웨어 프레임워크를 통합해 실제 운영 환경에서 사용할 수 있는 추론 기능을 제공한다. 특히 vLLM은 모델 서빙을 담당하고, NeuronX Distributed는 모델을 여러 NeuronCore에 분산한다. Amazon EKS는 컨테이너화된 추론 서비스를 배포하고 확장하는 역할을 맡는다. 가장 아래에서는 Trainium과 Inferentia가 실제 모델 연산을 처리한다.
3. 이 워크숍에서 배우는 내용
이후 과정에서는 다음 내용을 학습한다.
1) AWS Trainium 인스턴스에 vLLM과 NeuronX Distributed를 배포한다. 2) 모델을 여러 가속기에 효율적으로 분산하도록 텐서 병렬화(Tensor Parallelism)를 구성한다. 3) 여러 NeuronCore에 걸쳐 추론 서비스를 확장한다. 4) 추론 성능을 모니터링하고 컴퓨팅 자원 활용률을 최적화한다. 5) 실제 운영 환경에서 사용할 수 있는 LLM 서빙 인프라를 구축한다.
이 기초 과정은 AWS가 AI 연산을 위해 설계한 전용 하드웨어와 소프트웨어 스택을 이용해 실제 대규모 모델 배포 문제를 해결할 수 있도록 준비하는 단계다.
4. 기초개념의 세부 항목
- AWS AI 칩
- 텐서 병렬화(Tensor Parallelism)
- vLLM
- NeuronX Distributed(NxD)
- Amazon EKS
댓글남기기