최근 포스트

[분석] 에이전트형 추론에서 CUDA 생태계 경쟁력(2)

1 분 소요

2025년 11월 Claude Code 변곡점 이후, 긴 컨텍스트와 멀티턴 에이전트 워크로드는 빠르게 증가했다. 현재 이러한 워크로드는 실제 운영 환경의 추론 트래픽 대부분을 차지하고 있다. 2026년 4월에는 OpenAI의 엔터프라이즈 에이전트 지출 규모가 ChatGPT 지출 규...

[분석] 에이전트형 추론에서 CUDA 생태계 경쟁력(1)

1 분 소요

AgentX는 기존의 단순 LLM 벤치마크를 넘어 실제 에이전트형 AI 워크로드(멀티턴, 긴 컨텍스트, 도구 호출, 서브 에이전트)를 평가하기 위해 만들어진 벤치마크다. 에이전트 추론 성능은 GPU 연산 성능보다 KV 캐시 관리, Prefix Cache 재사용률, 라우팅, 메모리 ...

청소년을 위한 ChatGPT for Teens 출시

1 분 소요

ChatGPT for Teens가 주민등록번호나 사회보장번호가 필요없이 18세 미만 계정이 자동적으로 대상 적용되는 것이 서비스 흥미롭네요!

[실습] OpenAI 에이전트 도커 워크삽 (11)-문제해결

1 분 소요

이 실습은 도커 허브(Docker Hub) 또는 사설 레지스트리(Private Registery) 로 이동하는 방법이다. 참고로 도커 허브란 도커 이미지를 저장하고 공유하는 클라우드 저장소이다. 또한, 사설 레지스트리는 기업 조직 내부에서만 사용하는 비공개 도커 이미지 저장소를 말...

[실습] OpenAI 에이전트 도커 워크삽 (10)-Docker Hub

1 분 소요

이 실습은 도커 허브(Docker Hub) 또는 사설 레지스트리(Private Registery) 로 이동하는 방법이다. 참고로 도커 허브란 도커 이미지를 저장하고 공유하는 클라우드 저장소이다. 또한, 사설 레지스트리는 기업 조직 내부에서만 사용하는 비공개 도커 이미지 저장소를 말...

LLM 서빙 베스트 사례

9 분 소요

제 4 장의 내용을 읽고 아래와 같은 질문과 답변을 달았다. 이 장을 하나의 흐름으로 정리하면 이렇게 된다. 따라서 이 챕터의 가장 중요한 메시지는 세 문장으로 압축할 수 있다.