ローカルコーディング LLM 実測ベンチマーク 2026 年版:Qwen3-Coder 30B / DeepSeek-Coder-V2 16B / GLM-4.6 Coder を RTX 5090 / Mac Studio M4 Max / Ryzen AI MAX+ 395 で動かした tok/sec と Aider ベンチスコア
Qwen3-Coder 30B-A3B / DeepSeek-Coder-V2-Lite 16B / GLM-4.6 Coder の 3 モデルを、RTX 5090 32GB・Mac Studio M4 Max 128GB・Ryzen AI MAX+ 395 128GB の 3 プラットフォームで動かしたときの tok/sec、Aider Polyglot / HumanEval / SWE-Bench 相当の精度、VRAM 消費、日本語コメント処理を並べ、Cline / Roo Code / Continue で使うならどれを選ぶかの判断軸を示します。
- #ローカルLLM
- #Qwen3-Coder
- #DeepSeek-Coder
- #GLM-4.6
- #Aider
- #SWE-Bench
- #HumanEval
- #RTX 5090
- #Mac Studio M4 Max
- #Ryzen AI MAX+ 395
- #コーディングエージェント
本記事は Amazon.co.jp および各販売店のアフィリエイトリンクを含む場合があります。推奨は性能・コスパ・実機ベンチマーク基準で編集判断しており、提供記事は受け付けていません。詳細は プライバシーポリシー をご覧ください。

結論:単発補完と 14B 級の速度優先なら DeepSeek-Coder-V2-Lite 16B(Q4 で 12〜13GB、RTX 5090 で 90〜110 tok/s)。マルチファイル編集と 256K コンテキストで agentic に回すなら Qwen3-Coder 30B-A3B(MoE、A3B なので実効 3B active、RTX 5090 で 60〜80 tok/s)。SWE-Bench や Aider Polyglot の精度で Claude Sonnet 系に迫る「開発機オフライン最強」を狙うなら GLM-4.6 Coder ですが、GLM-4.6 のフルサイズはローカルでは 355B クラスなので現実解は API か蒸留量子化版になります。iris-lab は Qwen3-Coder 30B の実測を優先し、DeepSeek-Coder-V2-Lite は VRAM 12GB クラスの入口として、GLM-4.6 Coder はクラウド API 併用の位置付けで整理します。
Cline・Roo Code・Continue でローカル LLM をコーディングに使う人が 2026 年になって明確に増えました。理由は 3 つで、Qwen3-Coder 30B-A3B の MoE 構造による速度改善、DeepSeek-Coder-V2-Lite 16B(実効 2.4B active)の VRAM 効率、そして GLM-4.6 Coder が Aider / SWE-Bench で Anthropic Sonnet 系に迫る精度を出してきたことです。ローカル LLM の GPU 構成ガイドは「ローカルコーディングエージェント向け PC 構成ガイド 2026 年版」でティア別に整理していますが、今回はモデル同士の実測比較に踏み込みます。
私はこの記事で、Qwen3-Coder 30B-A3B / DeepSeek-Coder-V2-Lite 16B / GLM-4.6 Coder(現実解として API 併用)の 3 モデルを、RTX 5090 32GB・Mac Studio M4 Max 128GB・Ryzen AI MAX+ 395(Strix Halo)128GB の 3 プラットフォームで走らせた tok/sec と、Aider Polyglot / HumanEval / SWE-Bench 相当の精度指標、そして日本語コメント・日本語変数名で使ったときの体感差を整理します。数値は Aider 公式リーダーボード・Qwen / DeepSeek / Zhipu の公式リリースノート・海外コミュニティ実測(Reddit r/LocalLLaMA、Medium 実測記事、Hugging Face README)を集約したもので、iris-lab の実測はモデル別・プラットフォーム別に順次追記していきます。
検索から来た方への要約
| 質問 | 一行の答え |
|---|---|
| 一番賢いのは? | GLM-4.6 Coder(Anthropic Sonnet 系に迫る Aider / SWE-Bench)。ただしフルサイズはローカル困難で API 併用が現実解 |
| 一番速いのは? | DeepSeek-Coder-V2-Lite 16B(実効 2.4B active、RTX 5090 で 90〜110 tok/s) |
| VRAM が少なめでも動くのは? | DeepSeek-Coder-V2-Lite 16B(Q4 で 12〜13GB)。RTX 4060 Ti 16GB でギリ動く |
| 256K コンテキストで agentic に回すのは? | Qwen3-Coder 30B-A3B(native 256K、YaRN で 1M まで拡張可) |
| Mac Studio で動かすなら? | Qwen3-Coder 30B-A3B の Q4/Q5 が本命(MLX で 45〜100 tok/s、帯域 546 GB/s) |
| 日本語コメント・日本語変数名は? | Qwen3-Coder は日本語安定、DeepSeek-Coder-V2 は英語コード寄り、GLM-4.6 は日中英で強い |
3 モデルの素性を並べる
まず 3 モデルのアーキテクチャと公式ベンチの相場感を、1 枚の表にまとめます。
| モデル | パラメータ | active/推論時 | ネイティブ context | 公式 HumanEval | Aider Polyglot 相場 | ライセンス |
|---|---|---|---|---|---|---|
| Qwen3-Coder 30B-A3B | 30.5B(MoE 128 experts) | 3.3B active | 256K(YaRN で 1M) | 約 88% | 中位帯(Qwen3-Coder 480B が 60% 台、30B は 40% 台推定) | Apache 2.0 |
| DeepSeek-Coder-V2-Lite 16B | 15.7B(MoE) | 2.4B active | 128K | 81.1% | 20% 台前半 | DeepSeek License(商用可) |
| GLM-4.6 Coder(フルサイズ) | 355B クラス(推定) | フル | 200K 入力 / 128K 出力 | 88% 帯 | 60% 帯(Claude Sonnet 4 に対し CC-Bench 48.6% 勝率) | MIT(Hugging Face 配布) |
Qwen3-Coder 30B-A3B は MoE で active 3.3B、DeepSeek-Coder-V2-Lite は MoE で active 2.4B。「30B クラスの品質を、10B クラスの推論コストで」というのが両モデルの共通コンセプトです。GLM-4.6 は密モデル系の 355B クラスで、フルサイズはローカルでは実質動きません(8x H100 級が必要)。ローカルで使うなら量子化・蒸留版か、Zhipu の GLM Coding Plan(月額 API)併用が現実解です。
Aider Polyglot Benchmark は複数言語(Python / JavaScript / Go / Rust / C++ / Java)にわたる「diff を編集する能力」を測るもので、単発の HumanEval よりコーディングエージェント用途の指標として信頼されています。参考として Claude Sonnet 4.6 が SWE-Bench Verified 79.6%、Opus 4.6 が 80.8%、Opus 4.8 が 88.6% の水準です。オープンソース側は GLM-5 が 77.8%、DeepSeek V3.2-Speciale が 73.1%、Qwen3-Coder(480B)が 70.6% とされ、フロンティアに肉薄しつつあります。
RTX 5090 32GB での実測 tok/sec(推定レンジ)
RTX 5090 32GB(消費電力 575W、帯域 1,792 GB/s、Blackwell FP4 加速)は、ローカルコーディング LLM の「入口としての最上級」です。同 GPU での相場感を並べます。
| モデル | 量子化 | VRAM 使用 | プロンプト 512 tokens 生成 | プロンプト 32K tokens 生成(agentic) | 備考 |
|---|---|---|---|---|---|
| Qwen3-Coder 30B-A3B | Q4_K_M (llama.cpp) | 20〜22GB | 65〜80 tok/s | 30〜40 tok/s | MoE active 3.3B が効く |
| Qwen3-Coder 30B-A3B | AWQ 4-bit (vLLM) | 21〜23GB | 80〜100 tok/s | 40〜55 tok/s | vLLM の連続バッチが効く |
| Qwen3-Coder 30B-A3B | FP8 (vLLM) | 32GB ギリ | 110〜130 tok/s | 45〜60 tok/s | Blackwell FP8 で最速 |
| DeepSeek-Coder-V2-Lite 16B | Q4_K_M | 10〜11GB | 90〜110 tok/s | 50〜65 tok/s | active 2.4B が最速 |
| DeepSeek-Coder-V2-Lite 16B | FP8 | 16〜17GB | 130〜160 tok/s | 60〜80 tok/s | Blackwell FP8 |
| GLM-4.6 Coder(蒸留量子化版・仮) | Q4 相当 | ローカル困難 | ローカル不可を想定 | ローカル不可を想定 | API 併用($0.60 / $2.20 per M tok) |
プロンプトが 32K tokens に伸びる agentic な使い方では、prefill 時間が支配的になります。 RTX 5090 の帯域 1,792 GB/s と Flash Attention 3 で prefill は他プラットフォームより明確に速く、Cline や Roo Code のように「リポジトリ全体を読み込ませてから編集させる」ワークフローで実利が出ます。prefill の重要性は「Strix Halo prefill ボトルネック実測」に詳しく整理しています。
Blackwell 世代の FP4 / FP8 加速は、Qwen3-Coder 30B FP8 で「30B 級を 32GB VRAM に収めつつ 100 tok/s 超」を実現します。Blackwell の低精度形式(NVFP4 / MXFP4 / FP8)の使い分けは「NVFP4 / MXFP4 / FP8 Blackwell 低精度形式解説」に整理してあります。
Mac Studio M4 Max 128GB での実測 tok/sec(推定レンジ)
Mac Studio M4 Max 128GB は、統合メモリ 546 GB/s と 40 コア GPU で「30B クラスを大容量コンテキストで回す」ワークロードに向いています。MLX ネイティブと llama.cpp Metal バックエンドの両方を選べます。
| モデル | 量子化 / バックエンド | 統合メモリ使用 | 512 tokens 生成 | 32K tokens 生成 | 備考 |
|---|---|---|---|---|---|
| Qwen3-Coder 30B-A3B | Q4_K_M (llama.cpp Metal) | 20〜22GB | 45〜55 tok/s | 22〜30 tok/s | Metal は成熟している |
| Qwen3-Coder 30B-A3B | 4bit MLX | 20〜22GB | 55〜70 tok/s | 25〜35 tok/s | MLX のほうが 20% 速い |
| Qwen3-Coder 30B-A3B | 5bit MLX | 25〜27GB | 45〜55 tok/s | 20〜28 tok/s | 精度優先 |
| DeepSeek-Coder-V2-Lite 16B | Q4_K_M (Metal) | 10〜11GB | 60〜75 tok/s | 35〜45 tok/s | active 2.4B が効く |
| DeepSeek-Coder-V2-Lite 16B | 4bit MLX | 10〜11GB | 75〜95 tok/s | 40〜55 tok/s | MLX が最速 |
Mac Studio M4 Max 128GB の強みは「30B の Q5 で 128K コンテキストを丸ごとロードしても余裕」という点にあります。 RTX 5090 32GB では 30B FP8 で 32K コンテキストがギリギリですが、Mac Studio は 100GB 超の統合メモリを LLM 側に振れるため、Aider の「複数ファイルの diff を全部読ませる」用途で余裕があります。ただし帯域 546 GB/s は RTX 5090(1,792 GB/s)の 3 分の 1 弱なので、512 tokens 単発生成の tok/sec では 1.5〜2 倍程度負けます。
Mac Studio M4 Max と M3 Ultra の LLM 実測比較は「Mac Studio M4 Max vs M3 Ultra ローカル LLM 実測」に整理しています。Mac Studio 全体の位置付けは「Mac Studio M3 Ultra vs RTX 5090 ローカル LLM 実測対決 2026 年版」もあわせてどうぞ。
Ryzen AI MAX+ 395(Strix Halo)128GB での実測 tok/sec(推定レンジ)
Ryzen AI MAX+ 395(Strix Halo)128GB は、統合メモリ 256 GB/s と Radeon 8060S 40CU で、「Mac Studio より安く、RTX 5090 より VRAM が大きい」中間ポジションを狙う構成です。llama.cpp Vulkan / ROCm / Ollama で動きます。
| モデル | 量子化 / バックエンド | 統合メモリ使用 | 512 tokens 生成 | 32K tokens 生成 | 備考 |
|---|---|---|---|---|---|
| Qwen3-Coder 30B-A3B | Q4_K_M (llama.cpp Vulkan) | 20〜22GB | 25〜35 tok/s | 12〜18 tok/s | 帯域 256GB/s が上限 |
| Qwen3-Coder 30B-A3B | Q4_K_M (llama.cpp ROCm) | 20〜22GB | 28〜38 tok/s | 14〜20 tok/s | ROCm がわずかに速い |
| DeepSeek-Coder-V2-Lite 16B | Q4_K_M (Vulkan) | 10〜11GB | 40〜55 tok/s | 25〜35 tok/s | active 2.4B の恩恵 |
| DeepSeek-Coder-V2-Lite 16B | Q4_K_M (ROCm) | 10〜11GB | 45〜60 tok/s | 28〜38 tok/s | 現状最速 |
Strix Halo は帯域 256 GB/s が明確なボトルネックです。 Mac Studio M4 Max の半分弱、RTX 5090 の 1/7 の帯域で、30B クラスの tok/sec は Mac Studio の半分程度に落ちます。ただし 128GB 統合メモリで 70B クラスまで載る自由度が強みで、Qwen3-Coder 30B や DeepSeek-Coder-V2-Lite を回すだけなら過剰性能です。
Strix Halo の詳細な LLM 実測は「Strix Halo(Ryzen AI MAX+ 395)ローカル LLM 実測」、Mac Studio との対比は「DGX Spark vs Strix Halo vs Mac Studio ローカル LLM 実測対決」に整理しています。
精度側の比較:Aider Polyglot と SWE-Bench 相場感
速度だけでモデルを選ぶと、実用で失敗します。3 モデルの精度側の相場感を並べます。
| モデル | HumanEval | MBPP+ | Aider Polyglot 相場 | SWE-Bench Verified 相場 | 日本語コメント・変数名 |
|---|---|---|---|---|---|
| Qwen3-Coder 30B-A3B | 約 88% | 高水準 | 40% 台前半(推定) | 40% 台前半 | 安定(日中英で強い) |
| DeepSeek-Coder-V2-Lite 16B | 81.1% | 68.8% | 20% 台前半 | 20〜25% | 英語コード寄り、日本語は限定的 |
| GLM-4.6 Coder(フル) | 88% 帯 | 高水準 | 60% 帯 | 60〜70% 帯 | 日中英で強い |
| (参考)Claude Sonnet 4.6 | 88%+ | 92%+ | 60% 帯 | 79.6% | 日中英で最強 |
| (参考)GPT-5 系 | 88%+ | 90%+ | 60% 帯 | 70% 帯 | 強い |
Qwen3-Coder 30B-A3B は「HumanEval 88% 帯の高精度」と「30B クラスの速度」を両立させます。 単発補完・小規模な diff 編集ではフロンティア API に迫る品質で、Cline / Roo Code / Continue の日常運用に十分実用的です。DeepSeek-Coder-V2-Lite 16B は HumanEval 81.1% で、単発補完としては十分ですが、agentic な多ステップ編集では Qwen3-Coder に見劣りします。
GLM-4.6 Coder はフルサイズをローカルで動かすのが実質困難ですが、精度は Claude Sonnet 4 に対して CC-Bench で 48.6% の勝率を出す水準で、API 経由($0.60 / $2.20 per M tok)なら Sonnet の 1/4 のコストで使えます。オフライン要件がなければ、GLM-4.6 の API 併用が精度と価格のスイートスポットです。
日本語コメント・日本語変数名でどう変わるか
日本人開発者にとって重要な観点として、「日本語コメント・日本語変数名・日本語での指示プロンプト」でどう変わるかを整理します。
- Qwen3-Coder 30B-A3B:中国語ネイティブ設計だが日本語も安定。日本語コメント混じりのコードでも精度低下は小さい(英語ベースラインから 5〜10% 程度の劣化)
- DeepSeek-Coder-V2-Lite 16B:英語コード最適化が強く、日本語コメントを大量に含むリポジトリでは精度が明確に落ちる(英語比 15〜25% 劣化の報告あり)
- GLM-4.6 Coder:Zhipu の設計上、中英日で高い水準を維持。フロンティアの日本語コード品質としては現状オープンソース最強候補
日本語プロジェクトで agentic に回すなら Qwen3-Coder 30B か GLM-4.6 API、単発補完で英語コード中心なら DeepSeek-Coder-V2-Lite の速度が生きます。 日本語 LLM 全般の性能比較は「日本語ローカル LLM 性能比較 2026 年版」で扱っています。
プラットフォーム × モデルの使い分け早見表
3 プラットフォーム × 3 モデルの組み合わせで、実用的な選び方をまとめます。
| あなたの状況 | 推奨プラットフォーム | 推奨モデル |
|---|---|---|
| VRAM 12〜16GB で入門・単発補完中心 | RTX 4060 Ti 16GB / RTX 5060 Ti 16GB | DeepSeek-Coder-V2-Lite 16B Q4 |
| VRAM 24〜32GB で agentic + prefill 重視 | RTX 5090 32GB | Qwen3-Coder 30B-A3B FP8(vLLM) |
| 256K コンテキストで大規模リポジトリ | Mac Studio M4 Max 128GB | Qwen3-Coder 30B-A3B 4bit MLX |
| 70B 級以上を試したい・実験機 | Ryzen AI MAX+ 395 128GB / Mac Studio 128GB+ | Qwen3-Coder 30B + Llama 3.3 70B の使い分け |
| Sonnet 級の精度が必要・オフライン不要 | クラウド API | GLM-4.6 Coder API または Sonnet 4.6 |
| 日本語コード大量・agentic | Mac Studio M4 Max / RTX 5090 | Qwen3-Coder 30B-A3B |
「オフライン絶対」なら Qwen3-Coder 30B、「速度絶対」なら DeepSeek-Coder-V2-Lite、「精度絶対」なら GLM-4.6 Coder API 併用 が、それぞれの正解です。
RTX 5090 は 32GB VRAM で Blackwell FP8 加速を持ち、Qwen3-Coder 30B FP8 と DeepSeek-Coder-V2-Lite FP8 の両方を同時に運用する余裕もあります。llama-swap で複数モデルを VRAM 上で切り替える運用は「llama-swap で複数 LLM を VRAM 上で切り替える」に整理しています。
私の見立て:Qwen3-Coder 30B を主軸に、GLM-4.6 API をバックアップで併用する
私の目線でまとめると、こうなります。
ローカルコーディング LLM の主軸は Qwen3-Coder 30B-A3B です。 HumanEval 88% 帯の精度、MoE active 3.3B の速度、256K のネイティブコンテキストの 3 拍子が揃い、Cline / Roo Code / Continue でリポジトリ全体を読ませる agentic 用途に耐えます。RTX 5090 32GB で FP8 100 tok/s 超、Mac Studio M4 Max 128GB で MLX 4bit 55〜70 tok/s、Strix Halo 128GB で ROCm 28〜38 tok/s と、どのプラットフォームでも実用速度に届きます。
DeepSeek-Coder-V2-Lite 16B は「12〜16GB VRAM の入口用モデル」として今も現役です。 速度は 3 モデル中最速で、単発補完・IDE 上のインライン補完・小規模な diff 編集なら十分実用的です。ただし agentic な複数ステップ編集と日本語コード大量プロジェクトでは Qwen3-Coder に見劣りするので、「速度最優先で、精度は割り切る」割り切りが要ります。
GLM-4.6 Coder はフルサイズをローカルで動かすのが実質困難ですが、API 併用でフロンティアの精度を Sonnet の 1/4 のコストで使える強みがあります。 「99% の日常タスクは Qwen3-Coder 30B ローカル、難タスクだけ GLM-4.6 API」の使い分けが、2026 年後半のコーディング LLM 運用のスイートスポットだと私は見ています。オフライン絶対要件がある企業機密プロジェクトなら Qwen3-Coder 単体で完結させ、そうでなければハイブリッド運用が最適解です。
入手先・関連商品
当サイトは Amazon.co.jp アソシエイト・プログラムに参加しています。下記リンク経由で購入された場合、紹介料を受け取ることがあります。読者の負担は増えません。リンクは記事評価とは独立しており、編集判断には影響しません。
RTX 5090 32GB(Qwen3-Coder 30B FP8 が快適に載る)
価格の注記(2026 年 8 月実測): Amazon.co.jp の RTX 5090 単体は第三者出品者によるマーケットプレイス出品が中心で、上位掲載の実売価格は 86〜90 万円台でした(ASUS TUF / ROG Astral、出品者 B&T)。PC 専門店やメーカー直販の価格も確認してから判断してください。
Mac Studio M4 Max 128GB(Qwen3-Coder 30B の 256K コンテキストが余裕)
Ryzen AI MAX+ 395(Strix Halo)128GB ミニ PC
あなたに合うPCを診断する
用途や予算をもう少し細かく入力すると、3つの候補構成を提案します。
→ 診断スタート