로컬 LLM 양자화의 함정: 동일한 Q4_K_M 레이블인데 실제 비트(bpw)가 다른 이유와 Picchio 도구 검토
llama.cpp나 ollama 사용 시 발생하는 ‘Silent CPU Fallback’과 잘못된 토큰 생성 속도(tok/s) 문제를 분석합니다. 동일한 Q4_K_M 레이블임에도 실제 bits per weight가 다르게 나타나는 현상을 검증하는 오픈소스 도구 Picchio를 소개합니다.
llama.cpp나 ollama 사용 시 발생하는 ‘Silent CPU Fallback’과 잘못된 토큰 생성 속도(tok/s) 문제를 분석합니다. 동일한 Q4_K_M 레이블임에도 실제 bits per weight가 다르게 나타나는 현상을 검증하는 오픈소스 도구 Picchio를 소개합니다.