대규모 MoE 모델(Kimi, GLM)의 효율적 서빙 전략: Cloudflare Workers AI의 KV 캐시 양자화와 엣지 컴퓨팅 적용 사례
Cloudflare가 Kimi 및 GLM과 같은 대규모 MoE(Mixture-of-Experts) 모델을 운영하기 위해 도입한 기술적 최적화 전략을 분석합니다. KV 캐시 양자화(Quantization)를 통한 메모리 효율화와 엣지 네트워크 기반의 저지연 추론 구현 방식을 다루며, 실제 서비스 도입 시 검토해야 할 성능 및 비용 지표를 제시합니다.