최근 포스트

쿠버네티스 기반 LLM용 vLLM 분산 추론 llm-d

2 분 소요

llm-d는 대규모 모델 분산 추론(Large Language Model Distributed Inferenc)를 의미하며, 대규모 언어 모델(LLM)을 쿠버네티스(Kubernetes) 환경에서 대규모 서비스 형태로 운영하기 위한 오픈소스 분산 추론(Inference) 플랫폼이다....

vLLM 실습 도서

1 분 소요

현재 Wikidocs 를 통해 여유가 생길때 마다 'vLLM 실습' 도서를 소스코딩과 함께 글을 작성중이다.

AMD, 앤트로픽에 수십억 달러 규모 AI 서버 공급 계약 체결

1 분 소요

AMD와 앤트로픽이 수백억 달러 규모의 AI 서버 공급 계약을 체결했다. 이번 계약은 NVIDIA 중심의 AI 인프라 시장에서 AMD의 입지를 확대하는 동시에, 앤트로픽에는 대규모 AI 연산 인프라를 안정적으로 확보할 수 있는 기반을 제공한다.

추론 엔지니어링의 부상 (3)

최대 1 분 소요

추론 엔지니어링의 부상의 두번쨰 글은 추론 최적화 기술에 대해 알아보도록 하겠다. 이전 장에서 설명한 것처럼, Prefill과 Decode 구조를 이해하면 추론 엔지니어링에서 사용하는 주요 최적화 기술을 훨씬 쉽게 정리할 수 있다. 각 기술은 특정 단계를 가속하거나, 서로 다른 이...

추론 엔지니어링의 부상 (2)

5 분 소요

Prefill과 Decode 구조를 이해하면 추론 엔지니어링에서 사용하는 주요 최적화 기술을 훨씬 쉽게 정리할 수 있다. 각 기술은 특정 단계를 가속하거나, 서로 다른 이유로 두 단계를 모두 개선하거나, 또는 Prefill과 Decode 구조 자체를 중심으로 시스템을 재구성한다. ...

추론 엔지니어링의 부상 (1)

4 분 소요

대규모 언어 모델(LLM)이 응답을 생성할 때마다 동일한 GPU에서 두 가지 연산이 순차적으로 수행된다. 첫 번째 연산은 입력 프롬프트를 처리하고 하나의 토큰을 생성한다. 두 번째 연산은 그 이후의 모든 토큰을 하나씩 순차적으로 생성한다.

엔터프라이즈 기업들이 GPU가 활용률이 5% 밖에 안되는 이유

4 분 소요

지난 2년 동안 엔터프라이즈 기업들은 “GPU 확보 경쟁”이라는 명분 아래 과도한 데이터센터 투자와 비대한 IT 예산을 정당화해 왔습니다. (미국 기업 기준). H100 같은 GPU는 사실상 새로운 석유처럼 취급됐고, 지금 용량을 확보하지 않으면 AI 경쟁에서 뒤처질 것이라는 분위...

NVIDIA Triton Inference Server 주요 컴포넌트

1 분 소요

NVIDIA Triton Inference Server 에서 가장 핵심적인 Model Store, Model Analyzer, Model Performance Analyzer 등의 주요 컴포넌트 및 도구에 대해 정리해 보도록 하겠습니다.

NAND 스토리지 수요가 급증한 SanDisk 실적

1 분 소요

샌디스크가 AI 붐으로 NAND 스토리지 수요가 급증했고, 장기 공급계약과 60억 달러 자사주 매입을 발표했다고 로이터가 보도했습니다. 특히, 샌디스크가 1~5년짜리 장기 공급계약 5건을 체결했고, 그중 3건은 총 420억 달러 규모라고 합니다. 이러한 결과는 샌디스크가 단순한 소...

OpenAI Agents SDK로 시작하는 에이전틱 AI 애플리케이션 개발

4 분 소요

ChatGPT 등장 이후 대규모 언어 모델(LLM)은 자연어 이해와 생성 능력에서 놀라운 발전을 보여주었다. 하지만 실제 업무 환경에서는 단순히 질문에 답하는 모델을 넘어, 스스로 목표를 이해하고 필요한 도구를 호출하며 여러 작업을 조합하는 에이전틱(Agentic) AI가 요구되고...