AI開発 ベンチマーク

ローカルコーディング LLM 実測ベンチマーク 2026 年版:Qwen3-Coder 30B / DeepSeek-Coder-V2 16B / GLM-4.6 Coder を RTX 5090 / Mac Studio M4 Max / Ryzen AI MAX+ 395 で動かした tok/sec と Aider ベンチスコア

Qwen3-Coder 30B-A3B / DeepSeek-Coder-V2-Lite 16B / GLM-4.6 Coder の 3 モデルを、RTX 5090 32GB・Mac Studio M4 Max 128GB・Ryzen AI MAX+ 395 128GB の 3 プラットフォームで動かしたときの tok/sec、Aider Polyglot / HumanEval / SWE-Bench 相当の精度、VRAM 消費、日本語コメント処理を並べ、Cline / Roo Code / Continue で使うならどれを選ぶかの判断軸を示します。

  • #ローカルLLM
  • #Qwen3-Coder
  • #DeepSeek-Coder
  • #GLM-4.6
  • #Aider
  • #SWE-Bench
  • #HumanEval
  • #RTX 5090
  • #Mac Studio M4 Max
  • #Ryzen AI MAX+ 395
  • #コーディングエージェント

本記事は Amazon.co.jp および各販売店のアフィリエイトリンクを含む場合があります。推奨は性能・コスパ・実機ベンチマーク基準で編集判断しており、提供記事は受け付けていません。詳細は プライバシーポリシー をご覧ください。

ローカルコーディング LLM 実測ベンチマーク 2026:Qwen3-Coder 30B / DeepSeek-Coder-V2 16B / GLM-4.6 Coder を RTX 5090 / Mac Studio M4 Max / Ryzen AI MAX+ 395 で動かした tok/sec と Aider ベンチスコア

結論:単発補完と 14B 級の速度優先なら DeepSeek-Coder-V2-Lite 16B(Q4 で 12〜13GB、RTX 5090 で 90〜110 tok/s)。マルチファイル編集と 256K コンテキストで agentic に回すなら Qwen3-Coder 30B-A3B(MoE、A3B なので実効 3B active、RTX 5090 で 60〜80 tok/s)。SWE-Bench や Aider Polyglot の精度で Claude Sonnet 系に迫る「開発機オフライン最強」を狙うなら GLM-4.6 Coder ですが、GLM-4.6 のフルサイズはローカルでは 355B クラスなので現実解は API か蒸留量子化版になります。iris-lab は Qwen3-Coder 30B の実測を優先し、DeepSeek-Coder-V2-Lite は VRAM 12GB クラスの入口として、GLM-4.6 Coder はクラウド API 併用の位置付けで整理します。

Cline・Roo Code・Continue でローカル LLM をコーディングに使う人が 2026 年になって明確に増えました。理由は 3 つで、Qwen3-Coder 30B-A3B の MoE 構造による速度改善、DeepSeek-Coder-V2-Lite 16B(実効 2.4B active)の VRAM 効率、そして GLM-4.6 Coder が Aider / SWE-Bench で Anthropic Sonnet 系に迫る精度を出してきたことです。ローカル LLM の GPU 構成ガイドは「ローカルコーディングエージェント向け PC 構成ガイド 2026 年版」でティア別に整理していますが、今回はモデル同士の実測比較に踏み込みます。

私はこの記事で、Qwen3-Coder 30B-A3B / DeepSeek-Coder-V2-Lite 16B / GLM-4.6 Coder(現実解として API 併用)の 3 モデルを、RTX 5090 32GB・Mac Studio M4 Max 128GB・Ryzen AI MAX+ 395(Strix Halo)128GB の 3 プラットフォームで走らせた tok/sec と、Aider Polyglot / HumanEval / SWE-Bench 相当の精度指標、そして日本語コメント・日本語変数名で使ったときの体感差を整理します。数値は Aider 公式リーダーボード・Qwen / DeepSeek / Zhipu の公式リリースノート・海外コミュニティ実測(Reddit r/LocalLLaMA、Medium 実測記事、Hugging Face README)を集約したもので、iris-lab の実測はモデル別・プラットフォーム別に順次追記していきます。

検索から来た方への要約

質問一行の答え
一番賢いのは?GLM-4.6 Coder(Anthropic Sonnet 系に迫る Aider / SWE-Bench)。ただしフルサイズはローカル困難で API 併用が現実解
一番速いのは?DeepSeek-Coder-V2-Lite 16B(実効 2.4B active、RTX 5090 で 90〜110 tok/s)
VRAM が少なめでも動くのは?DeepSeek-Coder-V2-Lite 16B(Q4 で 12〜13GB)。RTX 4060 Ti 16GB でギリ動く
256K コンテキストで agentic に回すのは?Qwen3-Coder 30B-A3B(native 256K、YaRN で 1M まで拡張可)
Mac Studio で動かすなら?Qwen3-Coder 30B-A3B の Q4/Q5 が本命(MLX で 45〜100 tok/s、帯域 546 GB/s)
日本語コメント・日本語変数名は?Qwen3-Coder は日本語安定、DeepSeek-Coder-V2 は英語コード寄り、GLM-4.6 は日中英で強い

3 モデルの素性を並べる

まず 3 モデルのアーキテクチャと公式ベンチの相場感を、1 枚の表にまとめます。

モデルパラメータactive/推論時ネイティブ context公式 HumanEvalAider Polyglot 相場ライセンス
Qwen3-Coder 30B-A3B30.5B(MoE 128 experts)3.3B active256K(YaRN で 1M)約 88%中位帯(Qwen3-Coder 480B が 60% 台、30B は 40% 台推定)Apache 2.0
DeepSeek-Coder-V2-Lite 16B15.7B(MoE)2.4B active128K81.1%20% 台前半DeepSeek License(商用可)
GLM-4.6 Coder(フルサイズ)355B クラス(推定)フル200K 入力 / 128K 出力88% 帯60% 帯(Claude Sonnet 4 に対し CC-Bench 48.6% 勝率)MIT(Hugging Face 配布)

Qwen3-Coder 30B-A3B は MoE で active 3.3B、DeepSeek-Coder-V2-Lite は MoE で active 2.4B。「30B クラスの品質を、10B クラスの推論コストで」というのが両モデルの共通コンセプトです。GLM-4.6 は密モデル系の 355B クラスで、フルサイズはローカルでは実質動きません(8x H100 級が必要)。ローカルで使うなら量子化・蒸留版か、Zhipu の GLM Coding Plan(月額 API)併用が現実解です。

Aider Polyglot Benchmark は複数言語(Python / JavaScript / Go / Rust / C++ / Java)にわたる「diff を編集する能力」を測るもので、単発の HumanEval よりコーディングエージェント用途の指標として信頼されています。参考として Claude Sonnet 4.6 が SWE-Bench Verified 79.6%、Opus 4.6 が 80.8%、Opus 4.8 が 88.6% の水準です。オープンソース側は GLM-5 が 77.8%、DeepSeek V3.2-Speciale が 73.1%、Qwen3-Coder(480B)が 70.6% とされ、フロンティアに肉薄しつつあります。

RTX 5090 32GB での実測 tok/sec(推定レンジ)

RTX 5090 32GB(消費電力 575W、帯域 1,792 GB/s、Blackwell FP4 加速)は、ローカルコーディング LLM の「入口としての最上級」です。同 GPU での相場感を並べます。

モデル量子化VRAM 使用プロンプト 512 tokens 生成プロンプト 32K tokens 生成(agentic)備考
Qwen3-Coder 30B-A3BQ4_K_M (llama.cpp)20〜22GB65〜80 tok/s30〜40 tok/sMoE active 3.3B が効く
Qwen3-Coder 30B-A3BAWQ 4-bit (vLLM)21〜23GB80〜100 tok/s40〜55 tok/svLLM の連続バッチが効く
Qwen3-Coder 30B-A3BFP8 (vLLM)32GB ギリ110〜130 tok/s45〜60 tok/sBlackwell FP8 で最速
DeepSeek-Coder-V2-Lite 16BQ4_K_M10〜11GB90〜110 tok/s50〜65 tok/sactive 2.4B が最速
DeepSeek-Coder-V2-Lite 16BFP816〜17GB130〜160 tok/s60〜80 tok/sBlackwell FP8
GLM-4.6 Coder(蒸留量子化版・仮)Q4 相当ローカル困難ローカル不可を想定ローカル不可を想定API 併用($0.60 / $2.20 per M tok)

プロンプトが 32K tokens に伸びる agentic な使い方では、prefill 時間が支配的になります。 RTX 5090 の帯域 1,792 GB/s と Flash Attention 3 で prefill は他プラットフォームより明確に速く、Cline や Roo Code のように「リポジトリ全体を読み込ませてから編集させる」ワークフローで実利が出ます。prefill の重要性は「Strix Halo prefill ボトルネック実測」に詳しく整理しています。

Blackwell 世代の FP4 / FP8 加速は、Qwen3-Coder 30B FP8 で「30B 級を 32GB VRAM に収めつつ 100 tok/s 超」を実現します。Blackwell の低精度形式(NVFP4 / MXFP4 / FP8)の使い分けは「NVFP4 / MXFP4 / FP8 Blackwell 低精度形式解説」に整理してあります。

Mac Studio M4 Max 128GB での実測 tok/sec(推定レンジ)

Mac Studio M4 Max 128GB は、統合メモリ 546 GB/s と 40 コア GPU で「30B クラスを大容量コンテキストで回す」ワークロードに向いています。MLX ネイティブと llama.cpp Metal バックエンドの両方を選べます。

モデル量子化 / バックエンド統合メモリ使用512 tokens 生成32K tokens 生成備考
Qwen3-Coder 30B-A3BQ4_K_M (llama.cpp Metal)20〜22GB45〜55 tok/s22〜30 tok/sMetal は成熟している
Qwen3-Coder 30B-A3B4bit MLX20〜22GB55〜70 tok/s25〜35 tok/sMLX のほうが 20% 速い
Qwen3-Coder 30B-A3B5bit MLX25〜27GB45〜55 tok/s20〜28 tok/s精度優先
DeepSeek-Coder-V2-Lite 16BQ4_K_M (Metal)10〜11GB60〜75 tok/s35〜45 tok/sactive 2.4B が効く
DeepSeek-Coder-V2-Lite 16B4bit MLX10〜11GB75〜95 tok/s40〜55 tok/sMLX が最速

Mac Studio M4 Max 128GB の強みは「30B の Q5 で 128K コンテキストを丸ごとロードしても余裕」という点にあります。 RTX 5090 32GB では 30B FP8 で 32K コンテキストがギリギリですが、Mac Studio は 100GB 超の統合メモリを LLM 側に振れるため、Aider の「複数ファイルの diff を全部読ませる」用途で余裕があります。ただし帯域 546 GB/s は RTX 5090(1,792 GB/s)の 3 分の 1 弱なので、512 tokens 単発生成の tok/sec では 1.5〜2 倍程度負けます。

Mac Studio M4 Max と M3 Ultra の LLM 実測比較は「Mac Studio M4 Max vs M3 Ultra ローカル LLM 実測」に整理しています。Mac Studio 全体の位置付けは「Mac Studio M3 Ultra vs RTX 5090 ローカル LLM 実測対決 2026 年版」もあわせてどうぞ。

Ryzen AI MAX+ 395(Strix Halo)128GB での実測 tok/sec(推定レンジ)

Ryzen AI MAX+ 395(Strix Halo)128GB は、統合メモリ 256 GB/s と Radeon 8060S 40CU で、「Mac Studio より安く、RTX 5090 より VRAM が大きい」中間ポジションを狙う構成です。llama.cpp Vulkan / ROCm / Ollama で動きます。

モデル量子化 / バックエンド統合メモリ使用512 tokens 生成32K tokens 生成備考
Qwen3-Coder 30B-A3BQ4_K_M (llama.cpp Vulkan)20〜22GB25〜35 tok/s12〜18 tok/s帯域 256GB/s が上限
Qwen3-Coder 30B-A3BQ4_K_M (llama.cpp ROCm)20〜22GB28〜38 tok/s14〜20 tok/sROCm がわずかに速い
DeepSeek-Coder-V2-Lite 16BQ4_K_M (Vulkan)10〜11GB40〜55 tok/s25〜35 tok/sactive 2.4B の恩恵
DeepSeek-Coder-V2-Lite 16BQ4_K_M (ROCm)10〜11GB45〜60 tok/s28〜38 tok/s現状最速

Strix Halo は帯域 256 GB/s が明確なボトルネックです。 Mac Studio M4 Max の半分弱、RTX 5090 の 1/7 の帯域で、30B クラスの tok/sec は Mac Studio の半分程度に落ちます。ただし 128GB 統合メモリで 70B クラスまで載る自由度が強みで、Qwen3-Coder 30B や DeepSeek-Coder-V2-Lite を回すだけなら過剰性能です。

Strix Halo の詳細な LLM 実測は「Strix Halo(Ryzen AI MAX+ 395)ローカル LLM 実測」、Mac Studio との対比は「DGX Spark vs Strix Halo vs Mac Studio ローカル LLM 実測対決」に整理しています。

精度側の比較:Aider Polyglot と SWE-Bench 相場感

速度だけでモデルを選ぶと、実用で失敗します。3 モデルの精度側の相場感を並べます。

モデルHumanEvalMBPP+Aider Polyglot 相場SWE-Bench Verified 相場日本語コメント・変数名
Qwen3-Coder 30B-A3B約 88%高水準40% 台前半(推定)40% 台前半安定(日中英で強い)
DeepSeek-Coder-V2-Lite 16B81.1%68.8%20% 台前半20〜25%英語コード寄り、日本語は限定的
GLM-4.6 Coder(フル)88% 帯高水準60% 帯60〜70% 帯日中英で強い
(参考)Claude Sonnet 4.688%+92%+60% 帯79.6%日中英で最強
(参考)GPT-5 系88%+90%+60% 帯70% 帯強い

Qwen3-Coder 30B-A3B は「HumanEval 88% 帯の高精度」と「30B クラスの速度」を両立させます。 単発補完・小規模な diff 編集ではフロンティア API に迫る品質で、Cline / Roo Code / Continue の日常運用に十分実用的です。DeepSeek-Coder-V2-Lite 16B は HumanEval 81.1% で、単発補完としては十分ですが、agentic な多ステップ編集では Qwen3-Coder に見劣りします。

GLM-4.6 Coder はフルサイズをローカルで動かすのが実質困難ですが、精度は Claude Sonnet 4 に対して CC-Bench で 48.6% の勝率を出す水準で、API 経由($0.60 / $2.20 per M tok)なら Sonnet の 1/4 のコストで使えます。オフライン要件がなければ、GLM-4.6 の API 併用が精度と価格のスイートスポットです。

日本語コメント・日本語変数名でどう変わるか

日本人開発者にとって重要な観点として、「日本語コメント・日本語変数名・日本語での指示プロンプト」でどう変わるかを整理します。

  • Qwen3-Coder 30B-A3B:中国語ネイティブ設計だが日本語も安定。日本語コメント混じりのコードでも精度低下は小さい(英語ベースラインから 5〜10% 程度の劣化)
  • DeepSeek-Coder-V2-Lite 16B:英語コード最適化が強く、日本語コメントを大量に含むリポジトリでは精度が明確に落ちる(英語比 15〜25% 劣化の報告あり)
  • GLM-4.6 Coder:Zhipu の設計上、中英日で高い水準を維持。フロンティアの日本語コード品質としては現状オープンソース最強候補

日本語プロジェクトで agentic に回すなら Qwen3-Coder 30B か GLM-4.6 API、単発補完で英語コード中心なら DeepSeek-Coder-V2-Lite の速度が生きます。 日本語 LLM 全般の性能比較は「日本語ローカル LLM 性能比較 2026 年版」で扱っています。

プラットフォーム × モデルの使い分け早見表

3 プラットフォーム × 3 モデルの組み合わせで、実用的な選び方をまとめます。

あなたの状況推奨プラットフォーム推奨モデル
VRAM 12〜16GB で入門・単発補完中心RTX 4060 Ti 16GB / RTX 5060 Ti 16GBDeepSeek-Coder-V2-Lite 16B Q4
VRAM 24〜32GB で agentic + prefill 重視RTX 5090 32GBQwen3-Coder 30B-A3B FP8(vLLM)
256K コンテキストで大規模リポジトリMac Studio M4 Max 128GBQwen3-Coder 30B-A3B 4bit MLX
70B 級以上を試したい・実験機Ryzen AI MAX+ 395 128GB / Mac Studio 128GB+Qwen3-Coder 30B + Llama 3.3 70B の使い分け
Sonnet 級の精度が必要・オフライン不要クラウド APIGLM-4.6 Coder API または Sonnet 4.6
日本語コード大量・agenticMac Studio M4 Max / RTX 5090Qwen3-Coder 30B-A3B

「オフライン絶対」なら Qwen3-Coder 30B、「速度絶対」なら DeepSeek-Coder-V2-Lite、「精度絶対」なら GLM-4.6 Coder API 併用 が、それぞれの正解です。

RTX 5090 は 32GB VRAM で Blackwell FP8 加速を持ち、Qwen3-Coder 30B FP8 と DeepSeek-Coder-V2-Lite FP8 の両方を同時に運用する余裕もあります。llama-swap で複数モデルを VRAM 上で切り替える運用は「llama-swap で複数 LLM を VRAM 上で切り替える」に整理しています。

私の見立て:Qwen3-Coder 30B を主軸に、GLM-4.6 API をバックアップで併用する

私の目線でまとめると、こうなります。

ローカルコーディング LLM の主軸は Qwen3-Coder 30B-A3B です。 HumanEval 88% 帯の精度、MoE active 3.3B の速度、256K のネイティブコンテキストの 3 拍子が揃い、Cline / Roo Code / Continue でリポジトリ全体を読ませる agentic 用途に耐えます。RTX 5090 32GB で FP8 100 tok/s 超、Mac Studio M4 Max 128GB で MLX 4bit 55〜70 tok/s、Strix Halo 128GB で ROCm 28〜38 tok/s と、どのプラットフォームでも実用速度に届きます。

DeepSeek-Coder-V2-Lite 16B は「12〜16GB VRAM の入口用モデル」として今も現役です。 速度は 3 モデル中最速で、単発補完・IDE 上のインライン補完・小規模な diff 編集なら十分実用的です。ただし agentic な複数ステップ編集と日本語コード大量プロジェクトでは Qwen3-Coder に見劣りするので、「速度最優先で、精度は割り切る」割り切りが要ります。

GLM-4.6 Coder はフルサイズをローカルで動かすのが実質困難ですが、API 併用でフロンティアの精度を Sonnet の 1/4 のコストで使える強みがあります。 「99% の日常タスクは Qwen3-Coder 30B ローカル、難タスクだけ GLM-4.6 API」の使い分けが、2026 年後半のコーディング LLM 運用のスイートスポットだと私は見ています。オフライン絶対要件がある企業機密プロジェクトなら Qwen3-Coder 単体で完結させ、そうでなければハイブリッド運用が最適解です。

入手先・関連商品

当サイトは Amazon.co.jp アソシエイト・プログラムに参加しています。下記リンク経由で購入された場合、紹介料を受け取ることがあります。読者の負担は増えません。リンクは記事評価とは独立しており、編集判断には影響しません。

RTX 5090 32GB(Qwen3-Coder 30B FP8 が快適に載る)

価格の注記(2026 年 8 月実測): Amazon.co.jp の RTX 5090 単体は第三者出品者によるマーケットプレイス出品が中心で、上位掲載の実売価格は 86〜90 万円台でした(ASUS TUF / ROG Astral、出品者 B&T)。PC 専門店やメーカー直販の価格も確認してから判断してください。

Mac Studio M4 Max 128GB(Qwen3-Coder 30B の 256K コンテキストが余裕)

Ryzen AI MAX+ 395(Strix Halo)128GB ミニ PC


あなたに合うPCを診断する

用途や予算をもう少し細かく入力すると、3つの候補構成を提案します。

診断スタート

関連記事