쿠버네티스 기반 LLM용 vLLM 분산 추론 llm-d
llm-d는 대규모 모델 분산 추론(Large Language Model Distributed Inferenc)를 의미하며, 대규모 언어 모델(LLM)을 쿠버네티스(Kubernetes) 환경에서 대규모 서비스 형태로 운영하기 위한 오픈소스 분산 추론(Inference) 플랫폼이다....
llm-d는 대규모 모델 분산 추론(Large Language Model Distributed Inferenc)를 의미하며, 대규모 언어 모델(LLM)을 쿠버네티스(Kubernetes) 환경에서 대규모 서비스 형태로 운영하기 위한 오픈소스 분산 추론(Inference) 플랫폼이다....
최근 생성형 AI 개발 환경에서 가장 빠르게 성장하고 있는 분야 중 하나는 LLM 추론서빙 엔지니어링이다. ChatGPT와 같은 대규모 언어 모델 서비스가 확산되면서 단순히 모델을 실행하는 것을 넘어, GPU 자원을 효율적으로 활용하고 빠르고 안정적으로 모델을 서비스하는 기술이 중...
과학 연구용 AI 워크벤치인 Claude Science가 오늘 발표되었다. Claude Science는 기존 Claude 모델 위에 연구 도구, 데이터베이스, 코드 실행 환경, HPC 연결, 재현성 관리 기능을 추가한 형태에 가깝다.
인공지능 산업에서 AMD는 오랫동안 다소 애매한 위치에 있었다. GPU 하드웨어 성능만 놓고 보면 NVIDIA를 추격할 수 있는 몇 안 되는 기업이지만, 실제 인공지능 개발 현장에서 AMD의 존재감은 하드웨어 사양만큼 크지 않았다.
AMD와 앤트로픽이 수백억 달러 규모의 AI 서버 공급 계약을 체결했다. 이번 계약은 NVIDIA 중심의 AI 인프라 시장에서 AMD의 입지를 확대하는 동시에, 앤트로픽에는 대규모 AI 연산 인프라를 안정적으로 확보할 수 있는 기반을 제공한다.
최근 AI, 로보틱스, 디지털 트윈 분야에서는 GPU 컴퓨팅을 활용한 대규모 시뮬레이션과 물리 기반 모델링의 중요성이 커지고 있다. 하지만 GPU 프로그래밍은 CUDA C/C++ 기반 개발 경험을 요구하기 때문에 많은 Python 개발자에게 높은 진입 장벽이 있었다. NVIDIA ...
기업 데이터의 상당 부분은 여전히 문서 형태로 존재한다. 계약서, 청구서, 금융 명세서, 의료 기록, PDF 보고서처럼 사람이 읽을 수 있지만 컴퓨터가 바로 활용하기 어려운 비정형 데이터가 대표적이다.
AI 데이터센터에서 GPU 성능을 제대로 쓰려면 이제 단순히 “좋은 GPU를 많이 사는 것”만으로는 부족하다.수백 개, 수천 개 GPU가 동시에 학습에 참여하는 순간 병목은 GPU 연산이 아니라 네트워크에서 터진다. 특히 대규모 학습에서는 GPU들이 서로 계속 데이터를 주고받는다....
오픈AI가 오늘 GPT-5.6을 공개했지만, 세 가지 모델(솔, 테라, 루나) 모두 미국 정부 요청에 따라 초기 접근이 제한됩니다. 지난 미토스처럼 이번 조치가 미국 정부가 최첨단 AI 모델을 “광범위한 출시 전 정부 검토가 필요한 기술”로 보기 시작했다는 신호입니다.
오픈AI와 브로드컴의 합작인 할라피뇨 칩을 개발했네요ㅎㅎ 얼마나 매운 맛을 보여 줄 지 주요 내용을 정리하자면 다음과 같습니다.