シュン

ローカルLLM実装

llama-serverが応答しない原因はウイルス対策ソフトでした|ローカルLLMで踏んだ3つの罠

llama-serverが起動しても応答を返さない。プロセスは生きていてVRAMも確保済み、GPUも回っているのにHTTPだけ返らない。手掛かりはウイルス対策ソフトの検出履歴でした。切り分け手順と、あわせて踏んだ2つの罠を実測値つきで公開します。
ローカルLLM実装

Qwen3.8-27BはRTX 4070 12GBで動くか実測|GPUに2層多く載せたら19倍遅くなった

Qwen3.8-27B Q4_K_MをRTX 4070 12GBで実測。GPUに載せる層数を42から44に増やすだけでプロンプト処理が19分の1に崩落しました。llama-benchの生データと、別の27Bモデルでの再現結果を公開します。
ローカルLLM実装

Qwythos-27BをRTX 4070 12GBで実測|1.7 tok/s、VRAM 93.3%、24GBが要る理由

Qwythos-27B-v1 Q4_K_M(実体17.31GB)をRTX 4070 12GBで実測。VRAM最大93.3%、生成1.7 token/s。全層GPU環境との比較から、量子化の選択よりVRAMに収まるかが支配的だと分かりました。
AI業界解説

Kimi K3とは?普通のPCで動かなくても、約1.56TBのオープンウェイトLLMを今保存する意味

Kimi K3は総2.8兆パラメータ、約1.56TBのオープンウェイトLLMです。特徴、ライセンス、必要容量、現在の実行環境、今保存する意味、Web・APIで使う方法を公式情報から整理します。
ローカルLLM実装

MiniCPM5-1Bを本格検証:656 MiBの小型LLMは日本語・コード・ゲーム生成に使える?

約10.8億パラメータ、Q4 656 MiBのMiniCPM5-1BをRTX 4070環境で検証。日本語、JSON、推論、コード、ツール呼び出し、4K~120K長文、ゲーム実操作、速度・VRAMをQwen/LFMと比較します。
ローカルLLM実装

Qwythos-9B v2でブラウザゲーム生成は改善した?v1 Q5/Q6/Q8・Claude Opus 4.8と比較

Qwythos-9Bの旧版Q5/Q6/Q8と新しいv2 Q8_0をRTX 4070で検証。同じ2Dシューティングを生成し、速度、VRAM、実ブラウザ動作、修正後の完成度をClaude Opus 4.8の参照結果とともにまとめます。
AIサービス比較

Claude Sonnet 5とOpus 4.8を実装タスクで比較|防災備蓄管理アプリを作らせた結果

Claude Sonnet 5とOpus 4.8に同じ防災備蓄管理アプリを作らせ、改善指示まで出して比較しました。UI、入力バリデーション、スマホ表示、実用品としての仕上がりを整理します。
ローカルLLM実装

Qwythos-9Bは32K contextで読める?VRAM 6GB環境で8K/16K/32K prefillを追加検証

Qwythos-9B-Claude-Mythos-5-1M Q4_K_MをVRAM 6GB環境で8K/16K/32K context設定にして追加検証。prefill速度、生成速度、VRAM使用量、長文内の合言葉取得をまとめます。
ローカルLLM実装

Qwythos-9BはVRAM 6GBでどこまで動く?Q4/Q5/Q6を比較検証

VRAM 6GB環境でQwythos-9B-Claude-Mythosを検証。Q4/Q5/Q6のVRAM、速度、4GB台動作の現実味を比較しました。
ローカルLLM実装

自分のGPUでローカルLLMを使う手順|OllamaでGemma 4・Qwen3を動かす

OllamaでローカルLLMを使い始める手順を、GPU/VRAM別のモデル選び、プロンプト入力例、画像解析、速度やVRAM確認まで初心者向けに整理します。