2 분 소요

AI 에이전트는 추론 워크로드의 복잡성을 근본적으로 바꾸었다. 기존 LLM 추론은 보통 하나의 프롬프트에 대해 답을 생성하는 방식으로 측정할 수 있었다. 하지만 에이전틱 AI는 다르다. 모델이 여러 번 생각하고, 도구를 호출하고, 중간 결과를 관찰한 뒤 다시 판단하는 과정을 반복한다.

지금까지 업계에는 이런 에이전트형 추론 시스템의 성능을 표준화해 측정할 방법이 부족했다. 이에 Artificial AnalysisAA-AgentPerf라는 새로운 벤치마크를 공개했다. NVIDIA는 이 벤치마크가 실제 에이전틱 코딩 작업을 대표하는 궤적을 기반으로 한 최초의 멀티벤더 공개 벤치마크라고 설명한다.

1. AA-AgentPerf란 무엇인가?

AA-AgentPerf는 Artificial Analysis가 만든 하드웨어 벤치마크다. 핵심은 하나의 추론 시스템이 정해진 성능 목표를 만족하면서 동시에 몇 개의 AI 에이전트를 지원할 수 있는지를 측정하는 것이다.

여기서 성능 목표는 서비스 수준 목표(SLO)로 정의된다. SLO는 출력 토큰 속도와 TTFT, 즉 첫 토큰이 나오기까지 걸리는 시간을 기준으로 삼는다. 결과는 서로 다른 하드웨어 구성을 비교할 수 있도록 가속기당, 메가와트당 기준으로 정규화된다.

Artificial Analysis도 AA-AgentPerf를 “에이전트 시대를 위한 하드웨어 벤치마크”라고 설명한다. 단순한 합성 프롬프트가 아니라 실제 코딩 에이전트의 다중 턴 작업, 긴 컨텍스트, 도구 호출 패턴을 반영하려는 것이 목적이다.

2. 왜 에이전틱 코딩 성능 측정이 어려운가?

에이전틱 워크로드의 가장 큰 특징은 비결정성이다. LLM이 매번 같은 길로 가지 않는다. 어떤 요청에서는 바로 답을 내고, 어떤 요청에서는 여러 번 도구를 호출하며, 어떤 요청에서는 코드 수정과 검증을 반복한다.

그래서 단순히 “초당 몇 토큰을 생성했는가”만으로는 에이전트 성능을 제대로 설명할 수 없다. AA-AgentPerf는 사전에 기록된 에이전틱 코딩 궤적을 사용해, 추론과 도구 사용이 섞인 실제 작업 흐름을 재현한다. 이 궤적은 공개 코드 저장소의 이슈 해결 작업을 기반으로 하며, 여러 사용 사례와 12개 이상의 프로그래밍 언어를 포함한다.

이 벤치마크는 입력·출력 시퀀스 길이도 현실적으로 반영한다. 요청 길이는 5K에서 131K 토큰까지 분포하며, 평균은 약 27K 토큰이다. 도구 호출은 CPU 측 작업으로 매핑하고, 중앙값 1초 지연을 갖는 분포로 시뮬레이션한다. 또한 벤치마크 전용 최적화를 막기 위해 테스트 세트는 비공개로 유지된다.

3. 측정 방식

AA-AgentPerf는 추론 시스템에 수천 개의 동시 요청을 보내고, 각 요청은 사전에 기록된 에이전트 궤적 데이터셋에서 가져온다. 각 실행마다 독립성을 보장하기 위해 궤적 단계 앞에 동적 프리픽스를 붙인다.

그다음 정해진 SLO 기준을 만족하는지 확인한다. 가장 높은 동시성 수준, 즉 동시에 실행 가능한 에이전트 수가 공식 결과로 기록된다.

출시 시점의 테스트는 DeepSeek-V4-Pro를 대상으로 하며, Artificial Analysis의 서버리스 API 벤치마크 데이터를 바탕으로 여러 SLO 등급을 정의했다. 예를 들어 DeepSeek-V4-Pro 테스트의 SLO는 출력 속도 30, 100, 300 tokens/s와 각각 P95 TTFT 10초, 5초, 3초 기준으로 구성된다.

4. 결과 해석 방법

AA-AgentPerf는 추론 시스템에 수천 개의 동시 요청을 보내고, 각 요청은 사전에 기록된 에이전트 궤적 데이터셋에서 가져온다. 각 실행마다 독립성을 보장하기 위해 궤적 단계 앞에 동적 프리픽스를 붙인다.

그다음 정해진 SLO 기준을 만족하는지 확인한다. 가장 높은 동시성 수준, 즉 동시에 실행 가능한 에이전트 수가 공식 결과로 기록된다.

출시 시점의 테스트는 DeepSeek-V4-Pro를 대상으로 하며, Artificial Analysis의 서버리스 API 벤치마크 데이터를 바탕으로 여러 SLO 등급을 정의했다. 예를 들어 DeepSeek-V4-Pro 테스트의 SLO는 출력 속도 30, 100, 300 tokens/s와 각각 P95 TTFT 10초, 5초, 3초 기준으로 구성된다.

NVIDIA는 이를 바탕으로 GB300 NVL72가 이전 세대 H200 대비 메가와트당 최대 20배 더 많은 동시 에이전트 처리 성능을 제공한다고 주장한다.

5. GB300 NVL72가 강한 이유

NVIDIA는 GB300 NVL72의 성능이 단순히 GPU 하나의 성능 때문만은 아니라고 설명한다. 핵심은 하드웨어와 소프트웨어의 공동 최적화다.

SGLang, TensorRT-LLM, vLLM 같은 런타임은 WideEP와 DeepEP 같은 최적화를 활용해 MoE 전문가 실행을 NVL72 전체 도메인으로 분산한다. 이를 통해 수천 개 에이전트 세션에서 효과적인 배치 크기를 키우고 GPU 활용률을 높인다.

또한 DeepGEMM, Mega MoE 최적화, MXFP4/MXFP8 커널, fused MoE 등을 통해 NVLink 통신과 Tensor Core 연산을 겹치게 만들어 추론과 코드 생성 토큰 처리량을 높인다.

GB300 NVL72는 72개의 GPU를 하나의 고대역폭 NVLink 패브릭으로 연결한다. 덕분에 파라미터, KV 캐시, 중간 결과를 빠르게 공유할 수 있다. 이는 장시간 실행되는 에이전틱 코딩 세션에서 특히 중요하다.

nvidia-aa-perf

댓글남기기