최근 포스트

[실습] NVIDIA Triton Inference Server를 이용한 추론

10 분 소요

두번째 실습에서는 추론 서빙 패턴으로 동적 배칭, 처리량과 Triton 추론 모델에 대해 알아보도록 하자! 모델이 하나 있다고 가정했을 때, 사용자 1,000명이 동시에 이 모델에 질의를 보내려고 한다. 가장 먼저 떠올리는 방식은 Flask나 FastAPI로 모델을 래퍼로 생성하고...

[실습] vLLM을 이용한 라마8b 서빙 배포

17 분 소요

프로덕션 운영 환경에서 vLLM을 이용해 라마 8b 모델을 LLM 배포와 서빙에 대해 실습을 해 보자. transformers로 모델을 불러와 model.generate()를 호출하는 방식은 실험 단계에서는 사용할 수 있지만, 프로덕션 환경에는 적합하지 않다. 그 이유는 다음과 같...

NVIDIA GPU 기반 생성형AI 실습

1 분 소요

최근 생성형 AI 개발의 중심은 단순히 LLM API를 호출하는 단계에서 벗어나고 있다. 실제 서비스 환경에서는 어떤 모델을 선택할 것인지뿐만 아니라, 어떻게 배포하고, 얼마나 빠르게 추론하며, GPU 자원을 어떻게 효율적으로 활용할 것인지가 중요한 경쟁력이 되고 있다.

모델 추론과 서빙 기초

1 분 소요

매주 일요일마다 온라인으로 Hands-On LLM Serving and Optimization Study 를 진행하고 있다. 1주차에서는 LLM 모델의 기초가 되는 ‘트랜스포머 아키텍처’와 ‘LLM 모델 서빙 소개’에 대해서 학습하였다. 관련해서 참고할 만한 자료를 정리했다.

엔터프라이즈 기업들이 GPU가 활용률이 5% 밖에 안되는 이유

4 분 소요

지난 2년 동안 엔터프라이즈 기업들은 “GPU 확보 경쟁”이라는 명분 아래 과도한 데이터센터 투자와 비대한 IT 예산을 정당화해 왔습니다. (미국 기업 기준). H100 같은 GPU는 사실상 새로운 석유처럼 취급됐고, 지금 용량을 확보하지 않으면 AI 경쟁에서 뒤처질 것이라는 분위...