ローカルLLM実装 Qwythos-27BをRTX 4070 12GBで実測|1.7 tok/s、VRAM 93.3%、24GBが要る理由
Qwythos-27B-v1 Q4_K_M(実体17.31GB)をRTX 4070 12GBで実測。VRAM最大93.3%、生成1.7 token/s。全層GPU環境との比較から、量子化の選択よりVRAMに収まるかが支配的だと分かりました。
ローカルLLM実装
ローカルLLM実装
ローカルLLM実装
ローカルLLM実装