[워크삽] AWS 트레니엄 워크삽(9)-vLLM 배포
이번에는 모델 준비를 위한 Init Container 패턴이 적용된 Pod를 사용해 EKS 클러스터에 vLLM을 배포한다. 이 배포는 S3 Model Cache, 자동 모델 컴파일 및 프로덕션 준비형 구성을 사용하는 최적화된 방식을 적용한다.
이번에는 모델 준비를 위한 Init Container 패턴이 적용된 Pod를 사용해 EKS 클러스터에 vLLM을 배포한다. 이 배포는 S3 Model Cache, 자동 모델 컴파일 및 프로덕션 준비형 구성을 사용하는 최적화된 방식을 적용한다.
이 블로그에서는 AWS Trainium 인스턴스를 사용해 vLLM 배포에 최적화된 EKS 클러스터를 생성한다. vLLM 워크로드를 위한 프로덕션 준비형 패턴에 중점을 두고, 적절한 네트워킹과 리소스 할당으로 클러스터를 구성한다.
자! 이제 본격적으로 워크삽을 시작하겠다. 이 워크삽은 AWS Trainium/Inferentia 인스턴스와 Amazon EKS의 vLLM을 사용해 Large Language Model을 엔터프라이즈 규모로 배포하는 방법을 보여준다. 이 아키텍처는 AWS AI Chip과 고급 최적...
이번 실습에서는 EKS 기반 vLLM 실습에서 생성한 모든 리소스를 정리하는 절차를 단계별로 설명한다. 불필요한 AWS 요금이 발생하지 않도록 다음 단계를 수행한다.
이번에는 vLLM 배포에 수평 Pod 오토스케일러(Horizontal Pod Autoscaler, HPA)를 구성해 CPU 사용률에 따라 Pod 수를 자동으로 조정한다. 이를 통해 필요에 따라 Pod를 추가하거나 제거하여 변동하는 부하를 효율적으로 처리할 수 있다.
이번에는 vLLM 배포에 대한 종합적인 성능 테스트와 성능 검증을 수행한다. 실제와 유사한 워크로드를 시뮬레이션하고 성능 특성을 측정하기 위해 다양한 도구를 사용한다. 여기에는 여러 플랫폼과 구성에서 LLM 추론 성능을 평가하는 업계 표준 벤치마킹 도구인 llmperf가 포함된다.
이번 블로그는 vLLM 배포를 위해 Prometheus, Grafana 및 CloudWatch를 사용한 모니터링을 구성한다.
이번에는 단순한 HTTP Load Balancer를 통해 vLLM 배포에 외부 접근을 제공하도록 NGINX Ingress Controller를 구성한다. 이 방식은 vLLM API Endpoint에 대한 간단한 외부 접근을 제공한다.
Amazon EKS는 AWS와 온프레미스에서 Kubernetes를 쉽게 실행할 수 있게 해주는 관리형 Kubernetes 서비스다. Amazon EKS는 Kubernetes 적합성 인증을 받았으므로, 업스트림 Kubernetes에서 실행되는 기존 애플리케이션은 Amazon EKS와...
NeuronX Distributed(NxD)는 AWS Neuron 하드웨어에서 대규모 머신러닝 워크로드를 처리하도록 특별히 설계된 AWS의 분산 컴퓨팅 프레임워크다. 이번 블로그에서는 NxD 추론 아키텍처에 대해 상세히 정리해 보았다.