최근 포스트

NVIDIA Triton Inference Server 주요 컴포넌트

1 분 소요

NVIDIA Triton Inference Server 에서 가장 핵심적인 Model Store, Model Analyzer, Model Performance Analyzer 등의 주요 컴포넌트 및 도구에 대해 정리해 보도록 하겠습니다.

NAND 스토리지 수요가 급증한 SanDisk 실적

1 분 소요

샌디스크가 AI 붐으로 NAND 스토리지 수요가 급증했고, 장기 공급계약과 60억 달러 자사주 매입을 발표했다고 로이터가 보도했습니다. 특히, 샌디스크가 1~5년짜리 장기 공급계약 5건을 체결했고, 그중 3건은 총 420억 달러 규모라고 합니다. 이러한 결과는 샌디스크가 단순한 소...

OpenAI Agents SDK로 시작하는 에이전틱 AI 애플리케이션 개발

4 분 소요

ChatGPT 등장 이후 대규모 언어 모델(LLM)은 자연어 이해와 생성 능력에서 놀라운 발전을 보여주었다. 하지만 실제 업무 환경에서는 단순히 질문에 답하는 모델을 넘어, 스스로 목표를 이해하고 필요한 도구를 호출하며 여러 작업을 조합하는 에이전틱(Agentic) AI가 요구되고...

메모리 6배 절약, 속도는 8배 키운 구글 터보퀀트

2 분 소요

어제 SK하이닉스와 삼성전자 주식이 엄청나게 빠졌다. 바로 구글 터보퀀트(TurboQuant) 기술 때문이라는 이야기가 나왔다. 도대체 어떤 기술인지 궁금해서 논문을 찾아 읽어 보고 정리해 보았다.

AWS·구글·AMD가 설계한 ‘포스트 GPU’ 시대

1 분 소요

지난 1월호가 NVIDIA GPU 중심의 AI 팩토리 였다면, 이번 MIT 테크 리뷰 저널 코리아 2월호는, NVIDIA GPU와 경쟁하고 있는 구글 TPU, AWS 트레니엄, 그리고 AMD 최신 칩 전략에 대해 살펴 보는 글을 기고했다.

쿠버네티스 환경에서 LLM 운영 시작.md

2 분 소요

매주 일요일마다 온라인으로 “Generative AI on Kubernetes” 라는 책을 읽으면서 현업에서 일하는 분들과 스터디를 하고 있으며, 저도 관련해서 발표를 맡아서 진행했다. 오늘은 1장의 내용을 요약해서 정리하도록 하겠다.

DeepSeek의 mHC 논문을 읽고

11 분 소요

오늘 아침 페이스북에 하정우 AI미래기획수석이 DeepSeek에서 나온 mHC 논문을 올려서 나도 한번 논문을 읽어 보고 분석해 보았다. 올린 포스팅의 댓글 중에 우스개 소리로 이 논문을 분석하는 것이 공직자의 언어가 아니다(?)라는 댓글도 재미있었다. 안 그래도 이 논문은 중국 ...

OpenAI Agents 패턴(7)-RAG 기반 엔터프라이즈 지식 에이전트

1 분 소요

이 예제는 OpenAI Agents SDK를 사용하여 회사 문서를 검색하고 답변하는 지식 기반 AI Agent(RAG Agent)를 만드는 기본 예제를 만들어 보았다. RAG(Retrieval Augmented Generation)는 LLM이 외부 지식을 검색하여 답변 생성에 활용...