[워크삽] AWS 트레니엄 워크삽(4)-vLLM
이번 AWS 트레니엄 워크삽 글에서는 고성능 LLM 서빙인 vLLM에 대해 자세히 알아보도록 하겠다.
이번 AWS 트레니엄 워크삽 글에서는 고성능 LLM 서빙인 vLLM에 대해 자세히 알아보도록 하겠다.
이번 블로그는 vLLM과 AWS Trainium을 활용한 LLM 추론 확장하는 데 있어서 텐서 병렬화(Tensor Parallelism)에 대한 개념을 알아보도록 하자.
이번 AWS 트레니엄 워크삽 글에서는 AWS AI Chip에 대해 알아보자!
대규모 생성형 AI 모델을 호스팅할 때 알아야 할 기본 개념을 살펴본다. 또한 AWS Trainium 하드웨어를 vLLM 및 NeuronX Distributed(NxD)와 결합해 대규모 모델 배포 문제를 해결하는 방법을 알아본다.
SeminAnalysis는 “한국은 국가 주도의 소버린 AI와 대규모 데이터센터 구축에서 앞서가고 있지만, 모델 선정 방식에는 문제가 있으며 경제적 과실은 국내 반도체 기업보다 엔비디아가 더 크게 가져갈 수 있다”고 진단했습니다.
현재 X와 같은 다양한 소셜 미디어에서 GPT-Astra 에 대한 풍문이 떠돌고 있다. 이에 그 소문을 파악해서 다음과 같이 정리해 본다. 우선 GPT-Astra는 OpenAI의 차세대 모델군 중 하나로 장시간 에이전트 작업과 멀티 에이전트 협업, 고난도 코딩·수학·사이버 보안 능...
드와키시 파텔의 글 「에이전트 문명의 흥망성쇠」는 2026년 5월부터 7월 사이 OpenAI 내부에서 벌어진 AI 에이전트들의 비정상적인 집단 행동을 다룬다. 서로 완전히 격리되어 있어야 할 AI 에이전트들이 공유 패키지 저장소인 아티팩토리(Artifactory)를 이용해 몰래 통...
시스코(Cisco)가 전 세계 약 9만 명의 직원 모두에게 개인 맞춤형 AI 에이전트인 ‘마이에이전트(MyAgent)’를 배포했다. 월스트리트저널(WSJ)은 2026년 8월 27일 「Cisco Gave All 90,000 Employees Their Own AI Agent」(htt...
오늘 NVIDIA의 실적 발표 말고도 AI 생태계 시스템에 아주 흥미로운 소식이 들려왔다. 불과 며칠 전에 허깅페이스가 합병할 기업을 찾는다는 뉴스가 떠 있는 데, 바로 엔비디아가 오픈소스 AI 모델 공유 플랫폼으로 유명한 허깅페이스(Hugging Face)를 129억 달러에 인수...
코딩 에이전트를 사용해 모든 코드를 작성한다고 하더라도, 소프트웨어의 기본 원리를 이해하는 것은 여전히 중요하다. 그래야 자신이 원하는 방향으로 에이전트를 이끌며 적절한 트레이드오프를 선택할 수 있고, 애초에 어떤 트레이드오프가 존재하는지도 알 수 있기 때문이다. 또한 AI 애플리...