최근 포스트

세계에서 가장 빠른 수퍼컴퓨터는?

2 분 소요

중국이 세계에서 가장 빠른 슈퍼컴퓨터 순위에서 미국을 제치고 다시 1위에 올랐다. 이번에 1위를 차지한 시스템은 신위태호지광(LineShine)으로, 중국 선전에 있는 국가슈퍼컴퓨팅센터에 설치된 슈퍼컴퓨터다. 이 시스템은 2026년 6월 발표된 TOP500 순위에서 미국의 엘 캐피...

AI 데이터센터의 다음 경쟁은?

3 분 소요

AI 인프라 경쟁은 지금까지 주로 GPU, 네트워크, 메모리, 스토리지 중심으로 이야기되어 왔다. 더 많은 GPU를 넣고, 더 빠른 네트워크로 묶고, 더 큰 모델을 더 빠르게 학습·추론하는 것이 핵심 경쟁력처럼 보였다. 하지만 AI 팩토리가 대형화되면서 새로운 병목이 전면에 등장하...

에이전틱 AI 벤치마크에서 코딩 성능은?

2 분 소요

AI 에이전트는 추론 워크로드의 복잡성을 근본적으로 바꾸었다. 기존 LLM 추론은 보통 하나의 프롬프트에 대해 답을 생성하는 방식으로 측정할 수 있었다. 하지만 에이전틱 AI는 다르다. 모델이 여러 번 생각하고, 도구를 호출하고, 중간 결과를 관찰한 뒤 다시 판단하는 과정을 반복한...

AI 데이터센터 네트워크

6 분 소요

AI 인프라를 이야기할 때 가장 먼저 떠오르는 것은 GPU다. H100, H200, B200, B300 같은 이름이 나오고, FLOPS가 얼마인지 텐서 코어 성능이 얼마나 좋아졌는지 시작한다. 그런데 막상 AI 시스템을 실제로 운영해 보면 질문은 조금 달라진다. GPU가 얼마나 빠...

Claude Code가 보여준 에이전트 설계 방향은

4 분 소요

최근 UCL 연구진이 Claude Code의 구조를 분석한 논문을 공개했다. 논문의 제목은 Dive into Claude Code: The Design Space of Today’s and Future AI Agent Systems다.

추론 엔지니어링의 부상 (3)

3 분 소요

세번째 추론 엔지니어링에 투자헤야 시점은 언제일까? 이러한 추론 최적화 기술을 실제 운영 환경에 적용하는 것은 상당한 작업이다. 여러 최적화 기술을 함께 결합하면 시스템 복잡성은 더욱 증가한다. 따라서 모든 엔지니어링 팀이 반드시 고민해야 하는 질문은 다음과 같다.

추론 엔지니어링의 부상 (2)

5 분 소요

Prefill과 Decode 구조를 이해하면 추론 엔지니어링에서 사용하는 주요 최적화 기술을 훨씬 쉽게 정리할 수 있다. 각 기술은 특정 단계를 가속하거나, 서로 다른 이유로 두 단계를 모두 개선하거나, 또는 Prefill과 Decode 구조 자체를 중심으로 시스템을 재구성한다. ...

추론 엔지니어링의 부상 (1)

4 분 소요

대규모 언어 모델(LLM)이 응답을 생성할 때마다 동일한 GPU에서 두 가지 연산이 순차적으로 수행된다. 첫 번째 연산은 입력 프롬프트를 처리하고 하나의 토큰을 생성한다. 두 번째 연산은 그 이후의 모든 토큰을 하나씩 순차적으로 생성한다.

[실습] LLM 평가 및 벤치마킹

13 분 소요

아홉번째 실습 9으로 LLM 평가 및 벤치마킹을 해 보자! LLM 평가는 이 분야에서 가장 어려운 문제 중 하나로 사람마다 “좋다”의 기준이 다르다. 자동화된 지표는 의미를 놓치기 때문에 전체 벤치마크를 실행하면 모델 하나당 수백 달러가 들 수 있다. 평가를 신뢰할 수 없다면 이후...

[실습] BatchSize와 PrecisionSweep 를 통한 GPU 성능 최적화

20 분 소요

실습 8 번쨰로 배치 크기와 수치 정밀도 스윕을 통한 성능 최적점 탐색을 해 보자! GPU 성능을 높이는 데 가장 큰 영향을 주는 조정 변수는 배치 크기(batch size)와 수치 정밀도(numerical precision)다. 이 두 요소를 적절히 설정하면 모델 구조나 프레임워...