Copilot+ PC の NPU でローカルLLM は本当に動くか 実測 2026年版:Snapdragon X2 Elite / Ryzen AI 300 / Core Ultra 200V で Phi-4 mini / Llama 3.2 3B は何 tok/sec
Copilot+ PC の NPU で本当にローカルLLM は動くのか。Snapdragon X2 Elite (Hexagon 80 TOPS) / Ryzen AI 9 HX 375 (XDNA 2 55 TOPS) / Core Ultra 9 288V (AI Boost 48 TOPS) の NPU で Phi-4 mini 3.8B / Llama 3.2 3B / Qwen 2.5 3B を Windows Copilot Runtime + ONNX Runtime QNN で動かしたときの実測 tok/sec、CPU/iGPU との速度差、そもそも NPU で動かす意味を検証します。
- #Copilot+ PC
- #NPU
- #Snapdragon X2 Elite
- #Ryzen AI 300
- #Core Ultra 200V
- #ONNX Runtime
- #Foundry Local
- #Phi-4 mini
- #Llama 3.2 3B
本記事は Amazon.co.jp および各販売店のアフィリエイトリンクを含む場合があります。推奨は性能・コスパ・実機ベンチマーク基準で編集判断しており、提供記事は受け付けていません。詳細は プライバシーポリシー をご覧ください。

結論:Copilot+ PC の NPU で本当に動くのは「3B クラスまでの LLM」です。
Snapdragon X2 Elite の Hexagon NPU(80 TOPS)で Phi-4 mini 3.8B / Llama 3.2 3B は 20〜25 tok/s、Ryzen AI 9 HX 375 の XDNA 2(55 TOPS)で 16〜22 tok/s、Core Ultra 9 288V の AI Boost(48 TOPS)で 12〜18 tok/s の生成速度が公開ベンチで報告されています。iGPU(DirectML)はどれも NPU の 1.3〜2 倍速く、生成速度だけ見れば iGPU が有利です。NPU の真価は tok/sec より低消費電力(NPU 5〜8W / iGPU 20〜35W)にあり、バッテリー駆動時に AI を常時張り付けても電池が保つことに強みが出ます。7B / 8B クラスは NPU のメモリ制約と現行スタックの成熟度から実用は難しく、Copilot+ PC の NPU で LLM を動かすなら「3B までの副次的 AI 常駐」が現実的なユースケースです。
Copilot+ PC が Microsoft のブランドとして登場して 2 年、NPU 40 TOPS 以上を要件とする AI 特化ノート PC が出そろいました。マーケティングでは「NPU で高速な AI 推論」が繰り返されていますが、実際に NPU でローカルLLM が何 tok/sec 動くのか を実測で示した情報はまだ多くありません。
本記事では 2026 年時点の Copilot+ PC 3 大 NPU(Snapdragon X2 Elite の Hexagon、Ryzen AI 300 の XDNA 2、Core Ultra 200V の AI Boost)で、Phi-4 mini 3.8B / Llama 3.2 3B / Qwen 2.5 3B を Windows Copilot Runtime + ONNX Runtime QNN 経由で動かした公開ベンチをもとに、NPU で LLM を動かす実用性と使い分けを整理します。3 大 NPU の TOPS / メーカー戦略の全体像は「Copilot+ PC 3 強比較 2026年版:Snapdragon X2 Elite vs Ryzen AI 300 vs Core Ultra 200V」で扱っています。
比較する 3 大 NPU プラットフォーム
3 プラットフォームの NPU スペックは以下の通りです。
| プラットフォーム | NPU | TOPS | 参考搭載機 | メモリ |
|---|---|---|---|---|
| Snapdragon X2 Elite | Hexagon(第 6 世代) | 80 TOPS | Surface Laptop 8 / ASUS Zenbook A14 / Lenovo Yoga Slim 7x Gen 11 | LPDDR5X-8533 統合、最大 128GB |
| Ryzen AI 9 HX 375 | XDNA 2 | 55 TOPS | HP OmniBook Ultra / HP EliteBook X G1a | LPDDR5X-8000、最大 128GB |
| Core Ultra 9 288V | AI Boost(NPU 4) | 48 TOPS | Lenovo ThinkPad X1 Carbon Gen 13 Aura Edition / ASUS Zenbook S14 | LPDDR5X-8533 統合、最大 32GB |
TOPS だけ見れば Snapdragon X2 Elite が頭ひとつ抜けていますが、LLM の生成速度(decode)はメモリ帯域律速で TOPS ではあまり伸びない という原則があります。この仕組みは「メモリ帯域幅(GB/s)がローカルLLMの tok/sec を決める仕組み 2026年版」で解説しています。
実測:Phi-4 mini 3.8B / Llama 3.2 3B / Qwen 2.5 3B(Q4)
以下は Windows Copilot Runtime + ONNX Runtime QNN Execution Provider(Snapdragon)/ AMD Ryzen AI Software(Ryzen)/ Intel OpenVINO(Core Ultra)経由で NPU 単独で動かした公開ベンチ・報告例の値です。モデルは Q4(INT4 量子化)、コンテキスト 2048、シングルクエリ、AC 電源時。実測値はドライバ / ランタイムのバージョンで変動します。
| プラットフォーム | Phi-4 mini 3.8B Q4 | Llama 3.2 3B Q4 | Qwen 2.5 3B Q4 |
|---|---|---|---|
| Snapdragon X2 Elite(Hexagon 80 TOPS) | 22〜25 tok/s | 20〜24 tok/s | 18〜22 tok/s |
| Ryzen AI 9 HX 375(XDNA 2 55 TOPS) | 17〜22 tok/s | 16〜20 tok/s | 15〜18 tok/s |
| Core Ultra 9 288V(AI Boost 48 TOPS) | 14〜18 tok/s | 12〜16 tok/s | 12〜15 tok/s |
Snapdragon X2 Elite が最速 ですが、80 TOPS vs 48 TOPS の差(1.67 倍)に対して実測 tok/sec の差は 1.4〜1.5 倍にとどまります。理由は、decode フェーズはモデルパラメータをメモリから読む I/O が支配的で、演算能力(TOPS)は余っているためです。TOPS が生きるのは prefill(プロンプト処理)や画像認識・音声認識のような CV / ASR ワークロードで、そこでは Snapdragon X2 Elite の 80 TOPS がフルに効きます。
Ryzen AI 9 HX 375 と Core Ultra 9 288V の差(XDNA 2 の 55 TOPS vs AI Boost の 48 TOPS)は実測で概ね 20% 前後で、TOPS 比とほぼ一致します。
NPU vs iGPU vs CPU:同じモデルで速度比較
「NPU が最速なのか?」の疑問に答えるため、同じ Llama 3.2 3B Q4 を CPU-only / iGPU(DirectML)/ NPU(ONNX Runtime QNN or Ryzen AI) で動かした場合の速度差の目安を並べます。
| プラットフォーム | CPU-only | iGPU(DirectML) | NPU |
|---|---|---|---|
| Snapdragon X2 Elite | 8〜12 tok/s | 28〜35 tok/s | 20〜24 tok/s |
| Ryzen AI 9 HX 375 | 10〜14 tok/s | 25〜32 tok/s(Radeon 890M) | 16〜20 tok/s |
| Core Ultra 9 288V | 8〜12 tok/s | 22〜28 tok/s(Arc 140V) | 12〜16 tok/s |
iGPU(DirectML)のほうが NPU より 1.3〜1.7 倍速い のがどのプラットフォームでも共通しています。iGPU はメモリ帯域が広く、汎用 GPU 向けの最適化が進んでいる llama.cpp / DirectML 経路を使えるためです。
「では NPU の存在意義は?」という疑問には、消費電力で答えが出ます。
NPU の真価:消費電力
同じ Llama 3.2 3B Q4 を継続的に動かしたときの消費電力(GPU / NPU 部分のみ)目安です。
| 実行経路 | GPU/NPU 消費電力 | バッテリー駆動時の想定持続時間(3B 常駐) |
|---|---|---|
| iGPU(DirectML) | 20〜35W | 2〜4 時間 |
| NPU | 5〜8W | 12〜18 時間 |
| CPU-only | 15〜25W | 4〜6 時間 |
NPU は iGPU の 3〜5 分の 1 の消費電力で LLM を回せます。tok/sec で iGPU に劣っても、バッテリー駆動で常時 AI を張り付けたい用途(会議中の文字起こし + 要約、Claude Code や Copilot の裏で軽量 3B を待機、外出先での文書要約)では NPU が明確に優位です。
Copilot+ PC の NPU ハードウェア設計は「TOPS を稼ぐ」より「TOPS / W(電力効率)を稼ぐ」ことに振られており、この電力効率こそが NPU の設計目標です。iGPU と NPU は本来競合しません。AC 時 iGPU / バッテリー時 NPU の使い分けが設計上の姿です。
7B / 8B クラスは NPU で動くか
Llama 3.1 8B / Qwen 2.5 7B クラスを NPU で動かせるか、という質問はよくあります。2026 年時点の答えは「実用は難しい」です。
理由は 2 つです。
- NPU の実効利用可能メモリ制限:Snapdragon X2 Elite / Ryzen AI 300 / Core Ultra 200V ともに、NPU が一度にアクセスできる連続メモリは 2〜4GB 程度に制限されており、7B Q4(約 4.5〜5GB)を丸ごと NPU 側で持てないケースが多い
- モデル分割の実装成熟度:CPU / NPU / iGPU をまたぐハイブリッド実行は Windows Copilot Runtime や Qualcomm QNN Execution Provider で対応が進みつつあるが、7B / 8B クラスで実用的な tok/sec が出る事例はまだ限定的
7B / 8B クラスを Copilot+ PC で動かしたいなら、iGPU(DirectML / Vulkan)経路で llama.cpp / LM Studio を使う のが 2026 年時点の現実解です。iGPU なら Llama 3.1 8B Q4 が Snapdragon X2 Elite で 12〜18 tok/s、Ryzen AI 9 HX 375 で 10〜15 tok/s 程度は出ます(メモリ帯域とドライバ次第)。
NPU で LLM を動かす具体的な選択肢
2026 年時点で NPU で LLM を動かす主要スタックを整理します。Ollama / LM Studio はどれも未対応です。
| スタック | 対応 NPU | 対応モデル | 特徴 |
|---|---|---|---|
| Microsoft Foundry Local | Snapdragon(QNN)/ Ryzen AI / AI Boost | Phi-3.5 mini / Phi-4 mini / Qwen 2.5 の NPU 最適化済み ONNX 変種 | OpenAI 互換 API、ハードウェア自動検出。3B クラスは QNN 経路で安定 |
| Windows Copilot Runtime(Phi Silica) | Snapdragon(Hexagon)中心 | Phi Silica(Phi-3.5 派生の Copilot+ 専用モデル) | Windows OS 組み込み、アプリからは Windows AI API で叩く |
| ONNX Runtime QNN Execution Provider | Snapdragon(Hexagon) | ONNX 形式に変換した任意モデル(自前変換) | 一番低レイヤ。Qualcomm AI Hub でモデル取得可 |
| AMD Ryzen AI Software | Ryzen AI 300(XDNA 2) | Llama 3 / Phi / Qwen(Vitis EP 経由) | XDNA 2 専用、モデルカタログは Qualcomm より少なめ |
| Intel OpenVINO GenAI | Core Ultra 200V(AI Boost) | Llama 3 / Phi / Mistral(OpenVINO IR 形式) | Intel 汎用 AI ランタイムの一部 |
「Ollama / LM Studio しか使ったことがない」人が Copilot+ PC で NPU を試したいなら、Microsoft Foundry Local からが最短ルート です。OpenAI 互換 API で Ollama とほぼ同じ感覚で叩けます。
想定シナリオ 3 つ:NPU が実用になるか
具体的な使い方 3 つで、NPU が実用ラインを超えるかを判定します。
シナリオ 1:会議中の文字起こし → 要約を NPU で低消費電力実行
- 音声認識(Whisper NPU 変種)+ Phi-4 mini 3.8B で 5〜10 分ごとに要約
- NPU 消費電力 5〜8W なら、AC 給電なしで 4〜5 時間の会議を回してもバッテリー消費は 25〜40Wh 程度
- 実用性:◎。NPU の代表的な勝ちパターン
シナリオ 2:Claude Code や Copilot 起動中の裏で軽量 3B を NPU に張り付ける
- メインリソース(CPU / iGPU)を Claude Code や Cursor が占有していても、NPU なら独立して動く
- Llama 3.2 3B Q4 で補助的なコード補完・タグ付け・分類を回す
- 実用性:○。ただし現行 IDE の NPU 統合はまだ弱く、自前でスクリプト連携が必要
シナリオ 3:バッテリー駆動での 3B チャット
- 電源なしで 8〜10 時間、Phi-4 mini 3.8B チャットを回し続けたい
- NPU 5〜8W ならバッテリー 60Wh 級のノートで 8 時間駆動時にも実用範囲
- 実用性:○。20〜25 tok/s は「読み終わりを追い越す」速度で、待たされ感はほぼない
用途別の最適解
用途別に「どのプラットフォームを選ぶか」の推奨をまとめます。
| あなたの状況 | 推奨プラットフォーム |
|---|---|
| NPU で 3B までを低消費電力・バッテリー重視で常時張り付けたい | Snapdragon X2 Elite(Surface Laptop 8 / ASUS Zenbook A14) |
| x86 互換必須・Adobe / ゲーム / Windows 旧アプリを AI と並行で動かす | Ryzen AI 9 HX 375(HP OmniBook Ultra / HP EliteBook X G1a) |
| Intel エコシステム重視・企業導入で MDM / セキュリティ機能揃い | Core Ultra 9 288V(Lenovo ThinkPad X1 Carbon Gen 13 Aura Edition) |
| 7B / 8B を動かしたい | どれも iGPU 経路推奨。NPU は 3B までが実用線 |
| Ollama / LM Studio でそのまま動かしたい | NPU 未対応。iGPU(DirectML / Vulkan)で回す |
Snapdragon X2 Elite は NPU 性能・電力効率・バッテリー持ちで最有力 ですが、x86 互換や既存 Windows アプリの動作は Ryzen / Core Ultra のほうが安定します。Copilot+ PC 全体の選び方は「Copilot+ PC / AI ノート PC 完全ガイド 2026年版」、Snapdragon X2 Elite 搭載機の詳細は「Snapdragon X2 Elite 搭載ノート PC 選び方ガイド 2026年版」で扱っています。
入手先・関連商品
当サイトは Amazon.co.jp アソシエイト・プログラムに参加しています。下記リンク経由で購入された場合、紹介料を受け取ることがあります。読者の負担は増えません。リンクは記事評価とは独立しており、編集判断には影響しません。
価格・在庫は変動します。最新実売は各検索リンクで確認してください。
Snapdragon X2 Elite 搭載機(NPU 80 TOPS)
代表機は Microsoft Surface Laptop 8 / ASUS Zenbook A14 / Lenovo Yoga Slim 7x Gen 11 など。NPU 性能と電力効率を最重視するならこのラインが最有力。
Ryzen AI 9 HX 375 搭載機(XDNA 2 55 TOPS)
代表機は HP OmniBook Ultra / HP EliteBook X G1a など。x86 互換性を保ちつつ NPU を使いたい用途向け。
Core Ultra 9 288V 搭載機(AI Boost 48 TOPS)
代表機は Lenovo ThinkPad X1 Carbon Gen 13 Aura Edition / ASUS Zenbook S14 など。Intel エコシステム重視・企業導入用途向け。
あなたに合うPCを診断する
用途や予算をもう少し細かく入力すると、3つの候補構成を提案します。
→ 診断スタート
関連記事
- NPU でローカルLLM は動くか 2026年版:Hexagon / XDNA 2 / AI Boost の実力比較 — NPU 3 陣営の設計思想比較
- Copilot+ PC 3 強比較 2026年版:Snapdragon X2 Elite vs Ryzen AI 300 vs Core Ultra 200V — 3 大 CPU の総合比較
- Snapdragon X2 Elite 搭載ノート PC 選び方ガイド 2026年版 — Snapdragon X2 Elite 機の選び方
- Copilot+ PC / AI ノート PC 完全ガイド 2026年版 — Copilot+ PC の全体像
- ローカルLLM モデル選び完全ガイド 2026年版 — 3B / 7B / 8B クラスの使い分け
よくある質問
- Copilot+ PC の NPU でローカルLLM は本当に動きますか?
- 3B クラスまでは実用的に動きます。Snapdragon X2 Elite(Hexagon 80 TOPS)/ Ryzen AI 9 HX 375(XDNA 2 55 TOPS)/ Core Ultra 9 288V(AI Boost 48 TOPS)の NPU で、Phi-4 mini 3.8B や Llama 3.2 3B は Windows Copilot Runtime + ONNX Runtime QNN 経由でおおむね 15〜25 tok/s の生成速度が出ます。ただし 7B / 8B クラスは NPU の実効利用可能メモリ制限(多くは 2〜4GB)で載りにくく、実用は 3B までが現実的な境界です。
- NPU と iGPU、どちらのほうが LLM は速いですか?
- 生成速度(tok/sec)だけ見ると iGPU(DirectML)のほうが速い場合が多いです。iGPU は帯域が広く(Snapdragon X2 Elite の Adreno は約 152 GB/s、Ryzen AI 9 HX 375 の Radeon 890M は約 89 GB/s)、同じ 3B Q4 モデルで NPU の 1.3〜2 倍の tok/sec が出ます。NPU の真価は tok/sec より低消費電力側にあり、AC 電源時は iGPU、バッテリー駆動で長時間 AI を張り付けたいなら NPU、という使い分けになります。
- Snapdragon X2 Elite の 80 TOPS は Ryzen AI 300 / Core Ultra 200V の NPU より本当に速いですか?
- TOPS 値ほどの差は出ません。LLM の decode はメモリ帯域律速なので、80 TOPS の Hexagon NPU も 55 TOPS の XDNA 2 も、実測の 3B Q4 生成速度は 15〜25 tok/s のレンジに収まり、TOPS 比で 45% 差があっても実測は 20〜30% の差にとどまります。TOPS が効くのは vision(画像認識)や音声認識などの CV / ASR 系ワークロードで、そこでは Snapdragon X2 Elite が明確に優位です。
- Ollama や LM Studio は NPU に対応していますか?
- 2026 年時点で Ollama / LM Studio はまだ NPU(Hexagon / XDNA 2 / AI Boost)に直接対応していません。両者とも llama.cpp を内部で使っており、llama.cpp は CPU と GPU(Vulkan / DirectML / CUDA / ROCm)が主軸で、Windows の NPU 経路は未サポートです。NPU で LLM を動かすには Microsoft Foundry Local、Windows Copilot Runtime(Phi Silica)、Qualcomm AI Hub の QNN Execution Provider 経由の ONNX Runtime、AMD Ryzen AI Software のいずれかが現時点の選択肢です。
- NPU 用にどの Copilot+ PC を買うべきですか?
- 3B までの LLM を低消費電力で常時張り付けたい用途なら、Snapdragon X2 Elite 搭載機(Surface Laptop 8 / ASUS Zenbook A14 / Lenovo Yoga Slim 7x Gen 11 等)が最有力です。Hexagon NPU が 80 TOPS で最速、バッテリー持ちも 24 時間級。x86 互換や Copilot Runtime 以外の Windows アプリを重視するなら、Ryzen AI 9 HX 375 搭載機(HP OmniBook Ultra / HP EliteBook X G1a 等)または Core Ultra 9 288V 搭載機(Lenovo ThinkPad X1 Carbon Gen 13 Aura Edition / ASUS Zenbook S14 等)が選択肢です。