Hands-On LLM Serving and Optimization 책의 Chapter 9는 LLM Optimization in Practice, Chapter 10은 Advancements in LLM Serving입니다. Ch9는 앞의 여덟 장에서 배운 기법을 모델 하나에 모두 적용해보는 실습 장입니다. 하드웨어를 확인하고, 벤치마크 트래픽을 만들고, 측정할 지표를 정한 다음, 양자화와 분산 서빙을 차례로 적용하면서 성능이 어떻게 달라지는지 기록합니다. Ch10은 마지막 장이고 앞으로의 방향을 소개합니다. 시맨틱 라우팅, 성능 프로파일링, 멀티모달 서빙, 엣지 서빙, Multi-LoRA, 강화학습에서의 서빙을 차례로 다루는데 각각을 짧게 설명하고 넘어갑니다. 두 장에는 책이 이름과 정의만 알려주고 ..