Cloud Neta 팀의 Hands-On LLM Serving and Optimization Study (LLMSO) 스터디 7주차에서는 Envoy Agent Router와 llm-d를 학습했습니다. Envoy 게이트웨이가 요청마다 모델 서버 파드를 골라 보내는 구조를 살펴보고, llm-d 라우터를 설치해 프리픽스 캐시를 보고 파드를 고르는 과정을 확인했습니다. 이번 글에서는 llm-d 학습의 연장선에서 NVIDIA Dynamo 를 살펴보겠습니다. 두 프로젝트 모두 vLLM, SGLang, TensorRT-LLM 같은 추론 엔진을 대체하지 않고, 엔진 여러 대를 묶어 요청을 분배하고 prefill과 decode를 나누고 GPU 수를 조절합니다. 기준 버전은 2026년 9월 현재 최신인 Dynamo v1...