모델 추론과 서빙 기초
매주 일요일마다 온라인으로 Hands-On LLM Serving and Optimization Study 를 진행하고 있다. 1주차에서는 LLM 모델의 기초가 되는 ‘트랜스포머 아키텍처’와 ‘LLM 모델 서빙 소개’에 대해서 학습하였다. 관련해서 참고할 만한 자료를 정리했다.
1. 모델 서빙
- 스터디 내용 도식화 정리: https://winning-the-lotto.tistory.com/23
- 제 1 장 모델 서빙 개요: https://devlos.tistory.com/125
- 제 2 장 LLM 서빙 소개: https://devlos.tistory.com/126
2. 트랜스포머 모델 동작 원리
- 트랜스포머 모델을 이해하기 위한 기초 수학 정리(인터렉티브 표 포함
- 트랜스포머 동작 정리 - 인터렉티브 표 포함
- Transformer격파하기
- Karpathy의 microGPT(ChatGPT를 만드는 데 필요한 알고리즘의 뼈대만 남긴 미니어처 버전) 뜯어보기
- 외부 라이브러리 없이 NumPy만으로 미니 GPT를 만들어 forward부터 샘플링·KV Cache 벤치마크 실행, 실제 로그로 Transformer의 각 단계를 검증
- 해당 실습 코드 - minigpt.py
3. 트랜스포머 모델 동작 내부 원리
- AI 개요: 가중치, 행렬, 그리고 학습과 GPU
- LLM과 트랜스포머 개요
- Transformer: Transformer Explainer
- Transformer: 임베딩
- Transformer: 트랜스포머 블록과 셀프 어텐션 레이어
- Transformer: 셀프 어텐션 계산 해부
- Transformer: MLP와 트랜스포머 블록 마무리
- Transformer: 출력층과 샘플링, 아키텍처 마무리
- [트랜스포머 동작 이해를 돕는 시각화 제공 사이트, Transformer Explainer (https://poloclub.github.io/transformer-explainer/)
- LLM Visualization
4. vLLM
- vLLM 튜닝 전 → 후에 성능 비교할 수 있게 구글 Colab ipynb 작성
- 구글 Colab ipynb 링크
- LLM 기초 Attention부터 최적화 Prefill/Decode, FlashAttention까지
- AMD Radeon AI PRO R9700(CUDA 대신 → AMD ROCm)’ GPU 환경에서 vLLM 실습(측정)
댓글남기기