[실습] PyTorch 프로파일러와 텐서보드 활용
실습 5 — PyTorch 프로파일러(PyTorch Profiler)와 텐서보드(TensorBoard)
실습 5 — PyTorch 프로파일러(PyTorch Profiler)와 텐서보드(TensorBoard)
실습 6 — Nsight Systems Profiling: GPU 성능의 40%를 낭비하는 병목 찾기
실습 5 — 재현 가능한 학습(Reproducible Training): 설정 플래그, 성능 비용, 실행 산출물
실습 4 — LLM 양자화 및 최적화(bitsandbytes: INT8와 NF4)
실습 3 — vLLM 운영 서빙(Production Serving): 페이지드어텐션, 연속 배칭, 접두어 캐싱
두번째 실습에서는 추론 서빙 패턴으로 동적 배칭, 처리량과 Triton 추론 모델에 대해 알아보도록 하자! 모델이 하나 있다고 가정했을 때, 사용자 1,000명이 동시에 이 모델에 질의를 보내려고 한다. 가장 먼저 떠올리는 방식은 Flask나 FastAPI로 모델을 래퍼로 생성하고...
프로덕션 운영 환경에서 vLLM을 이용해 라마 8b 모델을 LLM 배포와 서빙에 대해 실습을 해 보자. transformers로 모델을 불러와 model.generate()를 호출하는 방식은 실험 단계에서는 사용할 수 있지만, 프로덕션 환경에는 적합하지 않다. 그 이유는 다음과 같...
최근 생성형 AI 개발의 중심은 단순히 LLM API를 호출하는 단계에서 벗어나고 있다. 실제 서비스 환경에서는 어떤 모델을 선택할 것인지뿐만 아니라, 어떻게 배포하고, 얼마나 빠르게 추론하며, GPU 자원을 어떻게 효율적으로 활용할 것인지가 중요한 경쟁력이 되고 있다.
매주 일요일마다 온라인으로 Hands-On LLM Serving and Optimization Study 를 진행하고 있다. 1주차에서는 LLM 모델의 기초가 되는 ‘트랜스포머 아키텍처’와 ‘LLM 모델 서빙 소개’에 대해서 학습하였다. 관련해서 참고할 만한 자료를 정리했다.
지난 2년 동안 엔터프라이즈 기업들은 “GPU 확보 경쟁”이라는 명분 아래 과도한 데이터센터 투자와 비대한 IT 예산을 정당화해 왔습니다. (미국 기업 기준). H100 같은 GPU는 사실상 새로운 석유처럼 취급됐고, 지금 용량을 확보하지 않으면 AI 경쟁에서 뒤처질 것이라는 분위...