최근 포스트

Hermes Agent와 OpenAI Codex 활용

8 분 소요

앞의 블로그에서는 간단히 오픈AI Codex 와 Hermes Agent 구조에 대해 알아 보았다. 이번 글은 직접 Hermes 설치하고 완성까지 예를 보여주겠다. 또한, 서버 인프라(Ubuntu+Docker+HTTPS)를 세우고, Codex 콤비로 Hermes를 자동 설치한다.

Hermes Agent 정의와 구조

3 분 소요

Hermes는 Nous Research가 개발한 오픈소스 AI 에이전트 실행 플랫폼인 Hermes Agent 이다. 단순히 질문에 답하는 챗봇이 아니라, 대규모 언어 모델(LLM)에 파일 처리, 터미널 명령, 웹 검색, 브라우저, 메모리, 자동화, 메시징 채널 같은 도구를 연결해 ...

vLLM Metal로 시작하는 Apple Silicon LLM 추론

2 분 소요

최근 LLM 개발 환경에서 가장 중요한 변화 중 하나는 거대한 GPU 클러스터뿐 아니라 개인 개발자의 로컬 환경에서도 AI 모델을 직접 실행하고 실험하는 시대가 열리고 있다는 점이다.

오픈AI, GPT-5.6 가격 20%~80% 인하

2 분 소요

오픈AI가 GPT-5.6 가격 20%~80% 인하했다. GPT-5.4 수준 지능 비용이 GPT-5.6의 재귀적 자기 최적화(recursive self-optimization)로 인해 4개월 동안 13배 감소했다. 참고로 재귀적 자기 최적화는 AI 시스템이 자신의 성능을 분석하고, ...

쿠버네티스 기반 LLM용 vLLM 분산 추론 llm-d

2 분 소요

llm-d는 대규모 모델 분산 추론(Large Language Model Distributed Inferenc)를 의미하며, 대규모 언어 모델(LLM)을 쿠버네티스(Kubernetes) 환경에서 대규모 서비스 형태로 운영하기 위한 오픈소스 분산 추론(Inference) 플랫폼이다....

LLM 추론 엔진의 내부를 이해하는 첫걸음, vLLM 실습

3 분 소요

최근 생성형 AI 개발 환경에서 가장 빠르게 성장하고 있는 분야 중 하나는 LLM 추론서빙 엔지니어링이다. ChatGPT와 같은 대규모 언어 모델 서비스가 확산되면서 단순히 모델을 실행하는 것을 넘어, GPU 자원을 효율적으로 활용하고 빠르고 안정적으로 모델을 서비스하는 기술이 중...

과학 연구용 AI 워크벤치, 클로드 사이언스

3 분 소요

과학 연구용 AI 워크벤치인 Claude Science가 오늘 발표되었다. Claude Science는 기존 Claude 모델 위에 연구 도구, 데이터베이스, 코드 실행 환경, HPC 연결, 재현성 관리 기능을 추가한 형태에 가깝다.

AMD Instella-MoE가 보여준 것

8 분 소요

인공지능 산업에서 AMD는 오랫동안 다소 애매한 위치에 있었다. GPU 하드웨어 성능만 놓고 보면 NVIDIA를 추격할 수 있는 몇 안 되는 기업이지만, 실제 인공지능 개발 현장에서 AMD의 존재감은 하드웨어 사양만큼 크지 않았다.

AMD, 앤트로픽에 수십억 달러 규모 AI 서버 공급 계약 체결

1 분 소요

AMD와 앤트로픽이 수백억 달러 규모의 AI 서버 공급 계약을 체결했다. 이번 계약은 NVIDIA 중심의 AI 인프라 시장에서 AMD의 입지를 확대하는 동시에, 앤트로픽에는 대규모 AI 연산 인프라를 안정적으로 확보할 수 있는 기반을 제공한다.