Hands-On LLM Serving and Optimization [Book] 책의 Chapter 7은 Advanced LLM Optimization Techniques, Chapter 8은 LLM Serving Frameworks입니다. Ch7은 GPU 한 대로 감당되지 않는 규모에서 쓰는 기법을 다룹니다. Speculative decoding, 여러 GPU에 모델 나누기, prefill과 decode 분리, KV cache offloading이 주제입니다. Ch8은 그 기법들을 실제로 구현하는 소프트웨어를 다룹니다. vLLM의 내부 구조를 따라가고 TensorRT-LLM, SGLang, llama.cpp와 비교합니다.Speculative decoding토큰을 하나 만들 때마다 GPU는 모델 가중치 ..