ローカルLLMが動くPC
AI開発向け
ローカルLLM / Claude Code / AI画像生成の実機ベンチマーク
59 記事 · 最終更新 2026年8月24日
この AI開発向け で答えること
- Q. Llama 3.3 70B を快適に動かすには何 GB の VRAM が必要?
- Q. RTX 5090 と Mac Studio M3 Ultra、AI 用途で結局どっち?
- Q. Claude Code を快適に動かすメモリ・CPU は?
選び方ガイド
27 件- #ローカルLLM#省電力#Wake on LAN
ローカルLLM 自宅サーバー 省電力運用ガイド 2026年版:Wake on LAN・サスペンド・アイドル節電で電気代を半分にする
自宅ローカルLLMサーバーの電気代を半分にする省電力運用ガイド。24 時間稼働の Strix Halo / Mac Studio / RTX 5090 機を、Wake on LAN で必要な時だけ起動し、サスペンド・アイドル節電・スケジューリングで待機時消費を落とす具体設定を、Linux・Windows・macOS 別に手順と月額電気代の実試算で示します。
- #Claude Code#CPU使用率#マルチコア
Claude Code の CPU 使用率とマルチコア活用 2026年版:Node.js・TypeScript 型検査・ripgrep が食う内訳と最適コア数
「Claude Code が CPU を食い尽くす」「クロードコード 推奨スペック」の答え:Node.js エージェントプロセス・TypeScript 型検査・ripgrep 検索・MCP サーバー・ローカル LLM 呼び出しが CPU をどう分けて食うかを内訳で分解し、Ryzen 9 9950X3D / Core Ultra 9 285K / M4 Max / M3 Ultra で長時間セッションを回したときの実効コア数と、8/16/24/32 コアの体感差までまとめます。
- #Cline#Roo Code#Ollama
Cline / Roo Code をローカルLLM (Ollama) で使うセットアップ完全ガイド 2026年版:Qwen3-Coder 30B A3B / Devstral Small 2 / DeepSeek-Coder-V2 で無料コーディングエージェント環境を作る
Cline は VS Code 拡張として動く OSS コーディングエージェントで、Ollama 経由でローカルLLM に接続すれば API 従量課金なしで Claude Code 相当の操作を実現できます。Roo Code は 2026-05 に extension 開発終了・Roomote へピボットしたため、実質は Cline がデファクト。Qwen3-Coder 30B A3B / Devstral Small 2 24B / DeepSeek-Coder-V2-Lite 16B を Ollama にロードし、Provider 設定・num_ctx チューニング・.clineignore トークン節約テクまで、VRAM 16GB / 24GB / 48GB 別の実運用手順を整理します。
- #Docker#Podman#NVIDIA Container Toolkit
Docker / Podman でローカルLLM を運用する完全ガイド 2026年版:NVIDIA GPU pass-through と docker compose で Ollama / vLLM / Open WebUI を本番同等に立てる
ローカルLLM をベアメタルで動かすと環境が壊れやすく、Ollama / vLLM / Open WebUI の同居も難しくなります。Docker / Podman + NVIDIA Container Toolkit で GPU pass-through を有効化し、docker compose 1 つで Ollama バックエンド・vLLM 高速サービング・Open WebUI フロントを本番同等に立てる構成を、GPU モデル別(RTX 5090 / RTX 4090 / Strix Halo)に整理します。
- #Claude Code#Codex CLI#メモリ
Claude Code / Codex のメモリは 32GB / 64GB / 128GB のどれが必要か 2026年版:エージェント長時間実行で本当に効く RAM 量を検証
Claude Code や OpenAI Codex CLI をエージェントとして数時間走らせると、メモリは VS Code・ブラウザ・ローカルLLM に食われて 32GB では swap し始めます。実消費の内訳から 32GB / 64GB / 128GB のどれを買うべきかを、クラウドAI 専用・ローカルLLM 併用・エージェント多重起動の 3 パターンで判断します。
- #KV Cache#量子化#llama.cpp
ローカルLLM KV キャッシュ量子化ガイド 2026年版:llama.cpp / vLLM で KV Cache を Q4 / Q8 に落として VRAM と tok/sec はどう変わるか
コンテキスト長 32K / 128K で VRAM が足りなくなる主犯は KV Cache です。llama.cpp の --cache-type-k q4_0 / vLLM の kv_cache_dtype で Q8 / Q4 に量子化すると、VRAM は半分〜1/4 に、tok/sec は 5〜15% 落ちる、が現実線です。設定手順・精度への影響・Flash Attention との相性まで、実装レベルで整理します。
- #ローカルLLM#48GB VRAM#RTX A6000
48GB VRAM でローカルLLMを動かす完全ガイド 2026年版:RTX A6000 / RTX 6000 Ada / RTX PRO 5000 Blackwell / 3090 x2 で 70B Q4 を回す選択肢
24GB では 70B Q4 に届かず 96GB は高すぎる、その中間の 48GB VRAM ティアで組むローカルLLM 機の設計を 2026 年時点で整理します。RTX A6000(Ampere・中古)/ RTX 6000 Ada / 発表済み RTX PRO 5000 Blackwell / RTX 3090 x2 / RTX 4090 x2 を、必要 tok/sec・PCIe 帯域・消費電力・実売価格で並べ、Llama 3.3 70B / Qwen 3 72B を 48GB で快適に回す構成の判断軸を提示します。
- #WSL2#Windows 11#Ubuntu 24.04
WSL2 でローカルLLMを動かす完全セットアップガイド 2026年版:Windows 11 で CUDA / Ollama / vLLM を Ubuntu 24.04 経由で動かすインストール手順
Windows 11 の WSL2(Ubuntu 24.04)でローカルLLM を動かすまでの手順を、GPU パススルー(NVIDIA CUDA WSL 版)・Ollama / llama.cpp / vLLM のインストール・systemd 常駐化・Windows ホストからの localhost 接続・LM Studio との併存まで、初回セットアップで詰まりがちな箇所を実コマンドで解説します。WSL2 と Windows Native どちらで動かすかの判断軸も添えています。
ベンチマーク
16 件- #ローカルLLM#VRAM 8GB#RTX 5060 Ti 8GB
VRAM 8GB でローカルLLM はどこまで動くか 実測ベンチマーク 2026年版:RTX 5060 Ti 8GB / RTX 4060 / RX 9060 XT 8GB で 3B・7B・8B・14B Q3 を回した tok/sec と VRAM 溢れの挙動
VRAM 8GB GPU(RTX 5060 Ti 8GB / RTX 4060 / RX 9060 XT 8GB)でローカルLLMは何 B・どの量子化まで動くのか、tok/sec と VRAM オフロード挙動を公開実測ベースで整理します。3B・7B・8B・14B Q3 の実測 tok/sec、KV キャッシュ溢れで CPU オフロードが発動する条件、8GB 帯での現実解を数値で示します。
- #ローカルLLM#Qwen3-Coder#DeepSeek-Coder
ローカルコーディング LLM 実測ベンチマーク 2026 年版:Qwen3-Coder 30B / DeepSeek-Coder-V2 16B / GLM-4.6 Coder を RTX 5090 / Mac Studio M4 Max / Ryzen AI MAX+ 395 で動かした tok/sec と Aider ベンチスコア
Qwen3-Coder 30B-A3B / DeepSeek-Coder-V2-Lite 16B / GLM-4.6 Coder の 3 モデルを、RTX 5090 32GB・Mac Studio M4 Max 128GB・Ryzen AI MAX+ 395 128GB の 3 プラットフォームで動かしたときの tok/sec、Aider Polyglot / HumanEval / SWE-Bench 相当の精度、VRAM 消費、日本語コメント処理を並べ、Cline / Roo Code / Continue で使うならどれを選ぶかの判断軸を示します。
- #Jetson#Jetson Orin#Jetson Thor
NVIDIA Jetson Orin Nano Super / AGX Orin / Jetson Thor でローカルLLMはどこまで動くか 実測ベンチマーク 2026年版
$249 の Jetson Orin Nano Super から $3,499 の Jetson Thor まで、NVIDIA エッジ AI モジュールでローカルLLMはどこまで実用になるかを実測ベース(tok/sec・VRAM・消費電力)で検証します。Llama 3.2 3B / Gemma 3 4B / Qwen 2.5 7B / Llama 3.1 8B を GGUF・TensorRT-LLM で動かした結果と、Strix Halo・Mac mini M4 との住み分けを整理します。
- #Strix Halo#Ryzen AI MAX+ 395#prefill
Ryzen AI MAX+ 395(Strix Halo)prefill(プロンプト処理)ボトルネック実測 2026年版:長文入力で tok/sec が落ちる仕組みと最初のトークンまでの待ち時間
Strix Halo で 8B / 32B / 70B に 4K・16K・64K・128K トークンを入れたときの prefill 速度と TTFT(最初のトークンまでの秒数)を、iGPU 帯域・KVキャッシュの詰まり方を含めて RTX 5090 / Mac Studio M4 Max と対比しながら整理します。ai max 395 prefill / strix halo prefill を検討している方向けです。
- #CPU推論#ローカルLLM#llama.cpp
ローカルLLM CPU-only 推論ベンチマーク 2026年版:GPU なしで Ryzen 9950X3D / Threadripper 9970X / Core Ultra 9 285K + DDR5 96GB / 128GB で 8B〜70B を動かした tok/sec
ローカルLLMは本当に GPU が無いと動かないのか。Ryzen 9950X3D(Zen 5 / DDR5-6000 2ch)・Threadripper 9970X(Zen 5 / DDR5-6400 4ch)・Intel Core Ultra 9 285K(Arrow Lake / DDR5-7200 2ch)を CPU-only で走らせ、llama.cpp / Ollama で Llama 3.3 8B・14B・32B・70B Q4_K_M を動かした tok/sec を整理。GPU なしでどこまで許容できるか、メモリ帯域とチャネル数の効き方を ai-dev 用途の実務目線で判断します。
- #reasoning#thinking token#DeepSeek R1
ローカルLLM Reasoning モデル 推論速度ベンチマーク 2026年版:DeepSeek R1 / QwQ / gpt-oss thinking mode の thinking token 量と GPU 別 tok/sec・待ち時間
Reasoning(Thinking)モデルは1回の応答で数千〜数万トークンの thinking token を吐くため、通常モデルと同じ tok/sec 指標では体感が測れません。DeepSeek R1 distill・QwQ 32B・gpt-oss 120B/20B の thinking mode を RTX 5090 / RTX PRO 6000 96GB / Mac Studio M3 Ultra / Ryzen AI MAX+ 395 で比較し、thinking token 生成量・最終回答までの秒数・prefill 込み実効速度を整理します。
- #VLM#Vision-Language Model#Qwen 2.5-VL
Vision-Language Model (VLM) GPU別ベンチマーク 2026年版:Qwen 2.5-VL / Llama 4 Maverick / Pixtral を RTX 5090・Mac Studio で動かす実測 tok/sec
Qwen 2.5-VL / Llama 4 Maverick / Pixtral など主要VLM(マルチモーダルLLM)を RTX 5090・PRO 6000・Mac Studio M3 Ultra・Strix Halo で動かしたときの画像トークン数・prefill 時間・生成 tok/sec・VRAM 使用量を整理。画像入力 = 数千トークンの prefill が支配的という構造から、テキストLLMとは別の判断軸でGPUを選ぶ必要がある理由を、解像度別に解説します。
- #ローカルLLM#WSL2#Linux
Windows vs Linux でローカルLLMはどっちが速いか 2026年版:WSL2 vs Ubuntu native の tok/sec を整理する
ローカルLLM を Windows native・WSL2・Linux native の3環境で動かしたとき、tok/sec はどれだけ違うのか。NVIDIA GPU では3者ほぼ同等で、Windows native も WSL2 も Linux native の90〜100%。差が出るのは ROCm(AMD GPU)と巨大モデルのロード時間という、2026年の現実解を実測ベンチの傾向から整理します。
比較
16 件- #SLM#小型LLM#Phi-4 mini
小型ローカルLLM (SLM) 実測比較 2026年版:Phi-4 mini / Gemma 3 2B / Qwen 3 0.6B / Llama 3.2 1B / SmolLM 3 の日本語能力・速度・メモリ
1B〜4B の小型ローカルLLM(SLM)5モデルを RTX 4060 8GB / iGPU / Copilot+ PC NPU / Mac mini M4 で実測比較。日本語能力・tok/sec・メモリ・ライセンスで、8Bを回せない環境や常時稼働・エッジ用途にどれを選ぶかを整理します。
- #リランカー#Reranker#BGE Reranker
ローカルLLM リランカー(Reranker)モデル比較 2026年版:BGE Reranker v2-m3 / Jina Reranker v3 / Cohere Rerank 3.5 / Ruri Reranker を日本語RAG 精度・速度・VRAM で選ぶ
ローカルLLM RAG の精度を最終的に押し上げるのはリランカー(Reranker)です。BGE Reranker v2-m3 / Jina Reranker v3 / Cohere Rerank 3.5 / Ruri Reranker を日本語RAG の nDCG@10・レイテンシ・VRAM 消費で比較し、pgvector や Qdrant からの再ランキングでどれを選ぶかを整理します。
- #Cursor#Windsurf#Cline
AI コーディング IDE 徹底比較 2026年版:Cursor / Windsurf / Cline / Zed / Continue.dev を PC要件・料金・ローカルLLM連携で選ぶ
AI コーディング IDE の Cursor / Windsurf / Cline / Zed / Continue.dev を、必要メモリ・GPU・月額料金・API 従量課金・Ollama など ローカルLLM 連携可否・エージェント機能で比較。Claude Code / Codex CLI では物足りない人が IDE 統合型に移るときの選び方を、実機PC要件込みで整理します。
- #ローカル動画生成#Wan 2.2#HunyuanVideo
ローカル動画生成 AI モデル選び方 2026年版:Wan 2.2 / HunyuanVideo / LTX Video / CogVideoX を VRAM 要件・生成時間・ライセンスで選ぶ
ローカルで動画生成 AI を回すなら Wan 2.2 / HunyuanVideo / LTX Video / CogVideoX のどれを選ぶかを、VRAM 要件(12GB / 24GB / 32GB / 48GB)、720p 5秒動画の生成時間、Text-to-Video / Image-to-Video 対応、ライセンスの商用可否、ComfyUI ノード対応で整理します。2026 年に選ぶべきモデルを用途別に判断できます。
- #Chroma#Flux.1#Stable Diffusion 3.5
Chroma / Flux.1 / SD3.5 / SDXL 画像生成モデル選び方 2026年版:Chroma を使うべきか、Flux.1 との違い・VRAM 要件・日本語プロンプト精度で選ぶ
chroma 画像生成の実態と Flux.1 / SD3.5 / SDXL との違いを、VRAM 要件・生成速度・日本語プロンプト精度・ライセンスで整理します。Chroma は Flux.1 Schnell ベースの Apache 2.0 派生で商用可、ローカル運用の VRAM 16GB / 24GB / 32GB でどこまで動くか、Flux.1 dev・SD3.5 Large・SDXL と比較して2026年に何を選ぶべきかを判断します。
- #Stable Diffusion#Flux.1#SD 3.5
AI画像生成モデル比較 2026年版:SDXL / Flux.1 dev / SD 3.5 Large / Chroma HD / OmniGen 2 を VRAM・画質・速度で選ぶ
AI画像生成は 2025〜2026 で SDXL 中心から Flux.1 dev / SD 3.5 Large / Chroma HD / OmniGen 2 へと選択肢が一気に広がりました。VRAM 要件・生成速度・プロンプト追従性・ライセンスを横並びで整理し、8GB / 12GB / 16GB / 24GB それぞれで何が動くかまでカバーします。
- #Claude Code#Codex CLI#Gemini CLI
Codex CLI / Gemini CLI / Claude Code のPC要件・レスポンス速度比較 2026年版:3大AIコーディングCLIをローカルLLM併用の可否で選ぶ
OpenAI Codex CLI / Google Gemini CLI / Anthropic Claude Code の3大AIコーディングCLIを、必要PCスペック・レスポンス速度・ローカルLLM併用可否・料金・エージェント能力で横並び比較。ローカルLLMを裏で走らせながらどのCLIが最も低スペックPCでも快適に動くか、gpt-oss 20B / Qwen 3 Coder 32B などを併用する構成込みで整理します。
- #クラウドGPU#RunPod#Vast.ai
クラウドGPUレンタル (RunPod / Vast.ai / Lambda Labs) vs ローカルLLM 完全比較 2026年版:時間課金 H100 と Strix Halo / RTX 5090 の初期投資、どちらで元が取れるか
RunPod / Vast.ai / Lambda Labs の H100・A100 時間課金と、Strix Halo 128GB / RTX 5090 32GB / Mac Studio M3 Ultra の初期投資を、時間単価・回収期間・運用の手間で比較。API 従量課金比較とは別軸の『クラウドGPU時間課金 vs 自機』の TCO 判定を 1 本にまとめます。