Hands-On LLM Serving and Optimization [Book] 책의 Chapter 5는 Challenges When Serving LLMs, Chapter 6는 Essential LLM Optimization Techniques입니다. Ch5는 LLM 서빙이 왜 어려운지를 하드웨어 단에서 설명합니다. GPU 스펙표를 읽는 법, 메모리, 연산, 인터커넥트의 역할, 모델 로딩과 실행 단계별 병목을 다룹니다. prefill, decode의 개념 이해는 LLM 서빙에서 중요한데 prefill은 compute-bound, decode는 memory-bound가 됩니다. Ch6는 서빙 성능 향상을 다룹니다. 배칭과 스케줄링, 어텐션 커널 최적화, 모델 압축, 프리픽스 캐싱 등에 대해서 소개합니다...