필수 LLM 최적화 기법(3)
LLM은 놀라운 기능을 가능하게 했지만 매우 큰 모델 크기 때문에 실제 운영 환경에서 많은 문제가 생긴다. 고성능 GPU는 가격이 비싸고 확보하기도 어렵다. 크고 비싼 모델을 더 많은 사용자가 쓸 수 있게 하려면 모델의 핵심 성능을 지키면서 크기를 줄여야 한다. 이때 모델 압축 기...
LLM은 놀라운 기능을 가능하게 했지만 매우 큰 모델 크기 때문에 실제 운영 환경에서 많은 문제가 생긴다. 고성능 GPU는 가격이 비싸고 확보하기도 어렵다. 크고 비싼 모델을 더 많은 사용자가 쓸 수 있게 하려면 모델의 핵심 성능을 지키면서 크기를 줄여야 한다. 이때 모델 압축 기...
LLM을 서빙할 때 트랜스포머 블록(Transformer block)의 주요 구성 요소는 어텐션(attention) 계층과 피드포워드 계층(feedforward layer, FFN)이다. FFN은 다층 퍼셉트론(multilayer perceptron, MLP) 계층으로 구성된다. ...
이번 블로그에서 중요한 LLM 최적화 기법을 하나씩 자세히 다룬다. 어떤 상황에서 어떤 방법으로 왜 이 기법들을 사용해야 하는지 판단할 수 있도록 하는 것이 목적이다. 최적화의 핵심 개념을 이해하고 대부분의 실무 목표를 달성하는 데 필요한 기본 기법에 집중한다.
오늘 NVIDIA의 실적 발표 말고도 AI 생태계 시스템에 아주 흥미로운 소식이 들려왔다. 불과 며칠 전에 허깅페이스가 합병할 기업을 찾는다는 뉴스가 떠 있는 데, 바로 엔비디아가 오픈소스 AI 모델 공유 플랫폼으로 유명한 허깅페이스(Hugging Face)를 129억 달러에 인수...
전체 워크삽 실습은 기업용 문서 파일을 OpenAI에 있는 클라우드 서비스에 있는 벡터 스토어(Vector Store)에 저장하고 검색 가능한 지식 기반 시스템을 구축하는 것이다. 전체적으로 Retrieval API와 Responses API의 File Search를 직접 사용하며...
이번 글에서는 RAG의 간단한 개념과 관리형 RAG와 기업 사내 보안, 그리고 OpenAI의 RAG API, Vector Store, File Search 등에 대해 살펴본다. RAG는 외부 문서를 검색해 최신 정보와 사내 지식을 근거로 답변을 생성하는 기술이다.
국내 대기업에 다양한 분야의 RAG 와 Agent 개발 경험을 바탕으로 해 기업용 문서(markdown 파일, PDF 문서) 등을 OpenAI의 관리형 RAG API를 직접 호출해 검색()Retrieval)과 생성(Generation)의 차이를 이해하도록 만든 초보자들도 따라해 볼...
2025년 11월 Claude Code 변곡점 이후, 긴 컨텍스트와 멀티턴 에이전트 워크로드는 빠르게 증가했다. 현재 이러한 워크로드는 실제 운영 환경의 추론 트래픽 대부분을 차지하고 있다. 2026년 4월에는 OpenAI의 엔터프라이즈 에이전트 지출 규모가 ChatGPT 지출 규...
AgentX는 기존의 단순 LLM 벤치마크를 넘어 실제 에이전트형 AI 워크로드(멀티턴, 긴 컨텍스트, 도구 호출, 서브 에이전트)를 평가하기 위해 만들어진 벤치마크다. 에이전트 추론 성능은 GPU 연산 성능보다 KV 캐시 관리, Prefix Cache 재사용률, 라우팅, 메모리 ...
OpenAI는 최근 몇 주 동안 두 가지 사건을 통해 고도화되는 AI 시스템의 위험이 빠르게 커지고 있음을 확인했다.