최근 포스트

vLLM Metal로 시작하는 Apple Silicon LLM 추론

2 분 소요

최근 LLM 개발 환경에서 가장 중요한 변화 중 하나는 거대한 GPU 클러스터뿐 아니라 개인 개발자의 로컬 환경에서도 AI 모델을 직접 실행하고 실험하는 시대가 열리고 있다는 점이다.

오픈AI, GPT-5.6 가격 20%~80% 인하

2 분 소요

오픈AI가 GPT-5.6 가격 20%~80% 인하했다. GPT-5.4 수준 지능 비용이 GPT-5.6의 재귀적 자기 최적화(recursive self-optimization)로 인해 4개월 동안 13배 감소했다. 참고로 재귀적 자기 최적화는 AI 시스템이 자신의 성능을 분석하고, ...

쿠버네티스 기반 LLM용 vLLM 분산 추론 llm-d

2 분 소요

llm-d는 대규모 모델 분산 추론(Large Language Model Distributed Inferenc)를 의미하며, 대규모 언어 모델(LLM)을 쿠버네티스(Kubernetes) 환경에서 대규모 서비스 형태로 운영하기 위한 오픈소스 분산 추론(Inference) 플랫폼이다....

LLM 추론 엔진의 내부를 이해하는 첫걸음, vLLM 실습

3 분 소요

최근 생성형 AI 개발 환경에서 가장 빠르게 성장하고 있는 분야 중 하나는 LLM 추론서빙 엔지니어링이다. ChatGPT와 같은 대규모 언어 모델 서비스가 확산되면서 단순히 모델을 실행하는 것을 넘어, GPU 자원을 효율적으로 활용하고 빠르고 안정적으로 모델을 서비스하는 기술이 중...

과학 연구용 AI 워크벤치, 클로드 사이언스

3 분 소요

과학 연구용 AI 워크벤치인 Claude Science가 오늘 발표되었다. Claude Science는 기존 Claude 모델 위에 연구 도구, 데이터베이스, 코드 실행 환경, HPC 연결, 재현성 관리 기능을 추가한 형태에 가깝다.

AMD Instella-MoE가 보여준 것

8 분 소요

인공지능 산업에서 AMD는 오랫동안 다소 애매한 위치에 있었다. GPU 하드웨어 성능만 놓고 보면 NVIDIA를 추격할 수 있는 몇 안 되는 기업이지만, 실제 인공지능 개발 현장에서 AMD의 존재감은 하드웨어 사양만큼 크지 않았다.

AMD, 앤트로픽에 수십억 달러 규모 AI 서버 공급 계약 체결

1 분 소요

AMD와 앤트로픽이 수백억 달러 규모의 AI 서버 공급 계약을 체결했다. 이번 계약은 NVIDIA 중심의 AI 인프라 시장에서 AMD의 입지를 확대하는 동시에, 앤트로픽에는 대규모 AI 연산 인프라를 안정적으로 확보할 수 있는 기반을 제공한다.

NVIDIA Warp, Python으로 GPU 커널을 작성하는 새로운 방법

1 분 소요

최근 AI, 로보틱스, 디지털 트윈 분야에서는 GPU 컴퓨팅을 활용한 대규모 시뮬레이션과 물리 기반 모델링의 중요성이 커지고 있다. 하지만 GPU 프로그래밍은 CUDA C/C++ 기반 개발 경험을 요구하기 때문에 많은 Python 개발자에게 높은 진입 장벽이 있었다. NVIDIA ...

생성형AI 실습으로 배우는 LLM 운영 엔지니어링

1 분 소요

최근 생성형 AI 개발의 중심은 단순히 LLM API를 호출하는 단계에서 벗어나고 있다. 실제 서비스 환경에서는 어떤 모델을 선택할 것인지뿐만 아니라, 어떻게 배포하고, 얼마나 빠르게 추론하며, GPU 자원을 어떻게 효율적으로 활용할 것인지가 중요한 경쟁력이 되고 있다.