arxiv-wiki

Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets

← 2026-08-20 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: System architecture and per-step decode flow.

Figure · 원문 PDF 5쪽 · Figure 1: System architecture and per-step decode flow.

Figure 2: Throughput vs. injected hop latency (data of Table 10, 2-stage Llama 3.1 8B). The full stack

Figure · 원문 PDF 15쪽 · Figure 2: Throughput vs. injected hop latency (data of Table 10, 2-stage Llama 3.1 8B). The full stack

Figure 3: One packed plan, drawn as the [1, 1, S, T] mask the host writes each step (4 slots, S =4; column

Figure · 원문 PDF 28쪽 · Figure 3: One packed plan, drawn as the [1, 1, S, T] mask the host writes each step (4 slots, S =4; column

한 문장 요약

여러 대의 Intel AI PC를 파이프라인 병렬로 연결해 모델을 레이어별로 미리 컴파일한 OpenVINO INT4 샤드로 배포하고(beam_idx 그래프 주입), 마스크 기반 KV-cache 되감기와 마이크로배칭을 결합해 분산·추론 성능을 단일 노드 모놀리식 기준보다 높이고 70B급 모델까지 확장 가능함을 보인다.

해결하려는 문제

현대 Intel AI PC의 통합 iGPU/NPU와 통합 메모리는 단일 노드에서 70B급 LLM을 담기에는 부족하지만, 여러 대를 협업시키면 모델을 호스팅할 수 있다. 기존의 모델 익스포트 도구는 RoPE와 동적 KV-cache 관리 때문에 레이어 경계로 깔끔히 분할되지 않으며, OpenVINO 상태ful 모델은 paged-attention이나 rewind API가 없어 표준 추측(혹은 speculative) 디코딩 구현과 맞지 않는다. 또한 단순 파이프라인 병렬은 네트워크 왕복비용 때문에 실효성 부족 문제가 있다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 논문 PDF 본문(제공된 페이지 1–34) 텍스트를 근거로 분석함. 모든 정량값, 구현 세부와 한계는 본문에 명시된 표·문단에서 직접 인용하거나 본문으로부터 합리적으로 도출한 내용만 포함함. 전력·열(thermal) 영향, 일부 장치별 장기 안정성(화재·드라이버 크래시) 등은 저자가 측정하지 않았으므로 본문 외 추가 측정값은 포함하지 않았음.