1 분 소요

2025년 11월 Claude Code 변곡점 이후, 긴 컨텍스트와 멀티턴 에이전트 워크로드는 빠르게 증가했다. 현재 이러한 워크로드는 실제 운영 환경의 추론 트래픽 대부분을 차지하고 있다. 2026년 4월에는 OpenAI의 엔터프라이즈 에이전트 지출 규모가 ChatGPT 지출 규모를 넘어섰다. 에이전트 워크플로우가 확실하게 주도권을 가져왔다.

SemiAnalysis는 AgentX 1.0을 공개했다. AgentX 1.0은 세계 최초의 완전한 오픈소스 멀티턴 에이전트 코딩 추론 벤치마크다. 이 벤치마크는 100만 토큰 컨텍스트 길이를 지원하며 Apache 2.0 라이선스로 공개된다.

1. AgentX 1.0 개요

과거 대부분의 성능 측정은 고정된 시퀀스 길이의 프리필(prefill)과 디코드(decode) 워크로드를 기준으로 수행됐다. 하지만 이러한 방식은 실제 워크로드를 정확하게 측정하지 못한다.

실제 환경은 다음과 같은 형태다. 멀티턴 대화, 긴 컨텍스트, 높은 프리필 재사용률, 서브 에이전트의 순간적인 실행, KV 캐시 오프로딩, 그리고 수많은 도구 호출이 발생한다. 따라서 SemiAnalysis는 AI 하드웨어와 소프트웨어 성능을 측정하는 올바른 방법을 만들고자 했다.

SemiAnalysis는 이 데이터셋을 구축하는 데 300만 달러 이상의 비용을 사용했다.InferenceXv3는 기존의 “고정 시퀀스 길이” 시나리오(8k1k, 1k1k, 1k8k) 외에 AgentX라는 새로운 현실적인 시나리오를 구현한다.

기존 벤치마크가 단일 요청 기반의 8K 입력과 1K 출력 토큰 트래픽을 사용했다면, AgentX는 실제 에이전트 코딩 트래픽을 사용한다. 즉, 실제 멀티턴 에이전트 사용 패턴을 기반으로 한다.

2. 전체 테스트 매트릭스

전체 테스트 매트릭스는 약 2MW 규모의 지속적으로 운영되는 컴퓨팅 환경에서 실행된다. 1,000개 이상의 칩을 사용하며 다양한 SKU를 포함한다. 테스트 대상은 다음과 같다.

  • MI355X
  • GB300 NVL72
  • GB200 NVL72
  • B300
  • B200
  • MI325
  • MI300X
  • H200
  • RTX Pro Server

루빈(Rubin)은 이번 달 말 추가될 예정이며, TPU와 MI455X UALoE72는 올해 후반 추가될 예정이다. NVIDIA와 AMD 모두 에이전트형 워크로드에서 뛰어난 성능을 보여주고 있다.

NVIDIA는 많은 최신 프론티어 모델에서 매우 좋은 성능을 보여주고 있으며, AMD 역시 특정 비교 조건에서는 일부 프론티어 모델에서 좋은 결과를 보여준다.

3. AgentX가 산업에 미친 영향

AgentX가 처음 몇 달 동안 만들어낸 가장 중요한 결과는 단순히 오픈소스 데이터셋을 만든 것이 아니다. 가장 중요한 결과는 AgentX를 기준점으로 삼아 실제 운영 환경의 에이전트 워크로드를 최적화하는 과정에서 발생한 산업 전체의 영향이다.

현재 vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache, Mooncake 등에 70개 이상의 상위(upstream) PR이 반영되었다. 대부분의 최적화 결과는 실제 운영 트래픽에도 적용 가능하다. 이후 문서에서는 이러한 각각의 최적화 내용을 자세히 설명한다.

댓글남기기