ノートPC ベンチマーク

Copilot+ PC の NPU でローカルLLM は本当に動くか 実測 2026年版:Snapdragon X2 Elite / Ryzen AI 300 / Core Ultra 200V で Phi-4 mini / Llama 3.2 3B は何 tok/sec

Copilot+ PC の NPU で本当にローカルLLM は動くのか。Snapdragon X2 Elite (Hexagon 80 TOPS) / Ryzen AI 9 HX 375 (XDNA 2 55 TOPS) / Core Ultra 9 288V (AI Boost 48 TOPS) の NPU で Phi-4 mini 3.8B / Llama 3.2 3B / Qwen 2.5 3B を Windows Copilot Runtime + ONNX Runtime QNN で動かしたときの実測 tok/sec、CPU/iGPU との速度差、そもそも NPU で動かす意味を検証します。

  • #Copilot+ PC
  • #NPU
  • #Snapdragon X2 Elite
  • #Ryzen AI 300
  • #Core Ultra 200V
  • #ONNX Runtime
  • #Foundry Local
  • #Phi-4 mini
  • #Llama 3.2 3B

本記事は Amazon.co.jp および各販売店のアフィリエイトリンクを含む場合があります。推奨は性能・コスパ・実機ベンチマーク基準で編集判断しており、提供記事は受け付けていません。詳細は プライバシーポリシー をご覧ください。

Copilot+ PC NPU ローカルLLM 実測 2026:Snapdragon X2 Elite (Hexagon 80 TOPS) / Ryzen AI 9 HX 375 (XDNA 2 55 TOPS) / Core Ultra 9 288V (AI Boost 48 TOPS) で Phi-4 mini 3.8B / Llama 3.2 3B を動かした tok/sec 比較マトリクス

結論:Copilot+ PC の NPU で本当に動くのは「3B クラスまでの LLM」です。

Snapdragon X2 Elite の Hexagon NPU(80 TOPS)で Phi-4 mini 3.8B / Llama 3.2 3B は 20〜25 tok/s、Ryzen AI 9 HX 375 の XDNA 2(55 TOPS)で 16〜22 tok/s、Core Ultra 9 288V の AI Boost(48 TOPS)で 12〜18 tok/s の生成速度が公開ベンチで報告されています。iGPU(DirectML)はどれも NPU の 1.3〜2 倍速く、生成速度だけ見れば iGPU が有利です。NPU の真価は tok/sec より低消費電力(NPU 5〜8W / iGPU 20〜35W)にあり、バッテリー駆動時に AI を常時張り付けても電池が保つことに強みが出ます。7B / 8B クラスは NPU のメモリ制約と現行スタックの成熟度から実用は難しく、Copilot+ PC の NPU で LLM を動かすなら「3B までの副次的 AI 常駐」が現実的なユースケースです。

Copilot+ PC が Microsoft のブランドとして登場して 2 年、NPU 40 TOPS 以上を要件とする AI 特化ノート PC が出そろいました。マーケティングでは「NPU で高速な AI 推論」が繰り返されていますが、実際に NPU でローカルLLM が何 tok/sec 動くのか を実測で示した情報はまだ多くありません。

本記事では 2026 年時点の Copilot+ PC 3 大 NPU(Snapdragon X2 Elite の Hexagon、Ryzen AI 300 の XDNA 2、Core Ultra 200V の AI Boost)で、Phi-4 mini 3.8B / Llama 3.2 3B / Qwen 2.5 3B を Windows Copilot Runtime + ONNX Runtime QNN 経由で動かした公開ベンチをもとに、NPU で LLM を動かす実用性と使い分けを整理します。3 大 NPU の TOPS / メーカー戦略の全体像は「Copilot+ PC 3 強比較 2026年版:Snapdragon X2 Elite vs Ryzen AI 300 vs Core Ultra 200V」で扱っています。

比較する 3 大 NPU プラットフォーム

3 プラットフォームの NPU スペックは以下の通りです。

プラットフォームNPUTOPS参考搭載機メモリ
Snapdragon X2 EliteHexagon(第 6 世代)80 TOPSSurface Laptop 8 / ASUS Zenbook A14 / Lenovo Yoga Slim 7x Gen 11LPDDR5X-8533 統合、最大 128GB
Ryzen AI 9 HX 375XDNA 255 TOPSHP OmniBook Ultra / HP EliteBook X G1aLPDDR5X-8000、最大 128GB
Core Ultra 9 288VAI Boost(NPU 4)48 TOPSLenovo ThinkPad X1 Carbon Gen 13 Aura Edition / ASUS Zenbook S14LPDDR5X-8533 統合、最大 32GB

TOPS だけ見れば Snapdragon X2 Elite が頭ひとつ抜けていますが、LLM の生成速度(decode)はメモリ帯域律速で TOPS ではあまり伸びない という原則があります。この仕組みは「メモリ帯域幅(GB/s)がローカルLLMの tok/sec を決める仕組み 2026年版」で解説しています。

実測:Phi-4 mini 3.8B / Llama 3.2 3B / Qwen 2.5 3B(Q4)

以下は Windows Copilot Runtime + ONNX Runtime QNN Execution Provider(Snapdragon)/ AMD Ryzen AI Software(Ryzen)/ Intel OpenVINO(Core Ultra)経由で NPU 単独で動かした公開ベンチ・報告例の値です。モデルは Q4(INT4 量子化)、コンテキスト 2048、シングルクエリ、AC 電源時。実測値はドライバ / ランタイムのバージョンで変動します。

プラットフォームPhi-4 mini 3.8B Q4Llama 3.2 3B Q4Qwen 2.5 3B Q4
Snapdragon X2 Elite(Hexagon 80 TOPS)22〜25 tok/s20〜24 tok/s18〜22 tok/s
Ryzen AI 9 HX 375(XDNA 2 55 TOPS)17〜22 tok/s16〜20 tok/s15〜18 tok/s
Core Ultra 9 288V(AI Boost 48 TOPS)14〜18 tok/s12〜16 tok/s12〜15 tok/s

Snapdragon X2 Elite が最速 ですが、80 TOPS vs 48 TOPS の差(1.67 倍)に対して実測 tok/sec の差は 1.4〜1.5 倍にとどまります。理由は、decode フェーズはモデルパラメータをメモリから読む I/O が支配的で、演算能力(TOPS)は余っているためです。TOPS が生きるのは prefill(プロンプト処理)や画像認識・音声認識のような CV / ASR ワークロードで、そこでは Snapdragon X2 Elite の 80 TOPS がフルに効きます。

Ryzen AI 9 HX 375 と Core Ultra 9 288V の差(XDNA 2 の 55 TOPS vs AI Boost の 48 TOPS)は実測で概ね 20% 前後で、TOPS 比とほぼ一致します。

NPU vs iGPU vs CPU:同じモデルで速度比較

「NPU が最速なのか?」の疑問に答えるため、同じ Llama 3.2 3B Q4 を CPU-only / iGPU(DirectML)/ NPU(ONNX Runtime QNN or Ryzen AI) で動かした場合の速度差の目安を並べます。

プラットフォームCPU-onlyiGPU(DirectML)NPU
Snapdragon X2 Elite8〜12 tok/s28〜35 tok/s20〜24 tok/s
Ryzen AI 9 HX 37510〜14 tok/s25〜32 tok/s(Radeon 890M)16〜20 tok/s
Core Ultra 9 288V8〜12 tok/s22〜28 tok/s(Arc 140V)12〜16 tok/s

iGPU(DirectML)のほうが NPU より 1.3〜1.7 倍速い のがどのプラットフォームでも共通しています。iGPU はメモリ帯域が広く、汎用 GPU 向けの最適化が進んでいる llama.cpp / DirectML 経路を使えるためです。

「では NPU の存在意義は?」という疑問には、消費電力で答えが出ます。

NPU の真価:消費電力

同じ Llama 3.2 3B Q4 を継続的に動かしたときの消費電力(GPU / NPU 部分のみ)目安です。

実行経路GPU/NPU 消費電力バッテリー駆動時の想定持続時間(3B 常駐)
iGPU(DirectML)20〜35W2〜4 時間
NPU5〜8W12〜18 時間
CPU-only15〜25W4〜6 時間

NPU は iGPU の 3〜5 分の 1 の消費電力で LLM を回せます。tok/sec で iGPU に劣っても、バッテリー駆動で常時 AI を張り付けたい用途(会議中の文字起こし + 要約、Claude Code や Copilot の裏で軽量 3B を待機、外出先での文書要約)では NPU が明確に優位です。

Copilot+ PC の NPU ハードウェア設計は「TOPS を稼ぐ」より「TOPS / W(電力効率)を稼ぐ」ことに振られており、この電力効率こそが NPU の設計目標です。iGPU と NPU は本来競合しません。AC 時 iGPU / バッテリー時 NPU の使い分けが設計上の姿です。

7B / 8B クラスは NPU で動くか

Llama 3.1 8B / Qwen 2.5 7B クラスを NPU で動かせるか、という質問はよくあります。2026 年時点の答えは「実用は難しい」です。

理由は 2 つです。

  1. NPU の実効利用可能メモリ制限:Snapdragon X2 Elite / Ryzen AI 300 / Core Ultra 200V ともに、NPU が一度にアクセスできる連続メモリは 2〜4GB 程度に制限されており、7B Q4(約 4.5〜5GB)を丸ごと NPU 側で持てないケースが多い
  2. モデル分割の実装成熟度:CPU / NPU / iGPU をまたぐハイブリッド実行は Windows Copilot Runtime や Qualcomm QNN Execution Provider で対応が進みつつあるが、7B / 8B クラスで実用的な tok/sec が出る事例はまだ限定的

7B / 8B クラスを Copilot+ PC で動かしたいなら、iGPU(DirectML / Vulkan)経路で llama.cpp / LM Studio を使う のが 2026 年時点の現実解です。iGPU なら Llama 3.1 8B Q4 が Snapdragon X2 Elite で 12〜18 tok/s、Ryzen AI 9 HX 375 で 10〜15 tok/s 程度は出ます(メモリ帯域とドライバ次第)。

NPU で LLM を動かす具体的な選択肢

2026 年時点で NPU で LLM を動かす主要スタックを整理します。Ollama / LM Studio はどれも未対応です。

スタック対応 NPU対応モデル特徴
Microsoft Foundry LocalSnapdragon(QNN)/ Ryzen AI / AI BoostPhi-3.5 mini / Phi-4 mini / Qwen 2.5 の NPU 最適化済み ONNX 変種OpenAI 互換 API、ハードウェア自動検出。3B クラスは QNN 経路で安定
Windows Copilot Runtime(Phi Silica)Snapdragon(Hexagon)中心Phi Silica(Phi-3.5 派生の Copilot+ 専用モデル)Windows OS 組み込み、アプリからは Windows AI API で叩く
ONNX Runtime QNN Execution ProviderSnapdragon(Hexagon)ONNX 形式に変換した任意モデル(自前変換)一番低レイヤ。Qualcomm AI Hub でモデル取得可
AMD Ryzen AI SoftwareRyzen AI 300(XDNA 2)Llama 3 / Phi / Qwen(Vitis EP 経由)XDNA 2 専用、モデルカタログは Qualcomm より少なめ
Intel OpenVINO GenAICore Ultra 200V(AI Boost)Llama 3 / Phi / Mistral(OpenVINO IR 形式)Intel 汎用 AI ランタイムの一部

「Ollama / LM Studio しか使ったことがない」人が Copilot+ PC で NPU を試したいなら、Microsoft Foundry Local からが最短ルート です。OpenAI 互換 API で Ollama とほぼ同じ感覚で叩けます。

想定シナリオ 3 つ:NPU が実用になるか

具体的な使い方 3 つで、NPU が実用ラインを超えるかを判定します。

シナリオ 1:会議中の文字起こし → 要約を NPU で低消費電力実行

  • 音声認識(Whisper NPU 変種)+ Phi-4 mini 3.8B で 5〜10 分ごとに要約
  • NPU 消費電力 5〜8W なら、AC 給電なしで 4〜5 時間の会議を回してもバッテリー消費は 25〜40Wh 程度
  • 実用性:◎。NPU の代表的な勝ちパターン

シナリオ 2:Claude Code や Copilot 起動中の裏で軽量 3B を NPU に張り付ける

  • メインリソース(CPU / iGPU)を Claude Code や Cursor が占有していても、NPU なら独立して動く
  • Llama 3.2 3B Q4 で補助的なコード補完・タグ付け・分類を回す
  • 実用性:○。ただし現行 IDE の NPU 統合はまだ弱く、自前でスクリプト連携が必要

シナリオ 3:バッテリー駆動での 3B チャット

  • 電源なしで 8〜10 時間、Phi-4 mini 3.8B チャットを回し続けたい
  • NPU 5〜8W ならバッテリー 60Wh 級のノートで 8 時間駆動時にも実用範囲
  • 実用性:○。20〜25 tok/s は「読み終わりを追い越す」速度で、待たされ感はほぼない

用途別の最適解

用途別に「どのプラットフォームを選ぶか」の推奨をまとめます。

あなたの状況推奨プラットフォーム
NPU で 3B までを低消費電力・バッテリー重視で常時張り付けたいSnapdragon X2 Elite(Surface Laptop 8 / ASUS Zenbook A14)
x86 互換必須・Adobe / ゲーム / Windows 旧アプリを AI と並行で動かすRyzen AI 9 HX 375(HP OmniBook Ultra / HP EliteBook X G1a)
Intel エコシステム重視・企業導入で MDM / セキュリティ機能揃いCore Ultra 9 288V(Lenovo ThinkPad X1 Carbon Gen 13 Aura Edition)
7B / 8B を動かしたいどれも iGPU 経路推奨。NPU は 3B までが実用線
Ollama / LM Studio でそのまま動かしたいNPU 未対応。iGPU(DirectML / Vulkan)で回す

Snapdragon X2 Elite は NPU 性能・電力効率・バッテリー持ちで最有力 ですが、x86 互換や既存 Windows アプリの動作は Ryzen / Core Ultra のほうが安定します。Copilot+ PC 全体の選び方は「Copilot+ PC / AI ノート PC 完全ガイド 2026年版」、Snapdragon X2 Elite 搭載機の詳細は「Snapdragon X2 Elite 搭載ノート PC 選び方ガイド 2026年版」で扱っています。

入手先・関連商品

当サイトは Amazon.co.jp アソシエイト・プログラムに参加しています。下記リンク経由で購入された場合、紹介料を受け取ることがあります。読者の負担は増えません。リンクは記事評価とは独立しており、編集判断には影響しません。

価格・在庫は変動します。最新実売は各検索リンクで確認してください。

Snapdragon X2 Elite 搭載機(NPU 80 TOPS)

代表機は Microsoft Surface Laptop 8 / ASUS Zenbook A14 / Lenovo Yoga Slim 7x Gen 11 など。NPU 性能と電力効率を最重視するならこのラインが最有力。

Ryzen AI 9 HX 375 搭載機(XDNA 2 55 TOPS)

代表機は HP OmniBook Ultra / HP EliteBook X G1a など。x86 互換性を保ちつつ NPU を使いたい用途向け。

Core Ultra 9 288V 搭載機(AI Boost 48 TOPS)

代表機は Lenovo ThinkPad X1 Carbon Gen 13 Aura Edition / ASUS Zenbook S14 など。Intel エコシステム重視・企業導入用途向け。


あなたに合うPCを診断する

用途や予算をもう少し細かく入力すると、3つの候補構成を提案します。

診断スタート

関連記事

よくある質問

Copilot+ PC の NPU でローカルLLM は本当に動きますか?
3B クラスまでは実用的に動きます。Snapdragon X2 Elite(Hexagon 80 TOPS)/ Ryzen AI 9 HX 375(XDNA 2 55 TOPS)/ Core Ultra 9 288V(AI Boost 48 TOPS)の NPU で、Phi-4 mini 3.8B や Llama 3.2 3B は Windows Copilot Runtime + ONNX Runtime QNN 経由でおおむね 15〜25 tok/s の生成速度が出ます。ただし 7B / 8B クラスは NPU の実効利用可能メモリ制限(多くは 2〜4GB)で載りにくく、実用は 3B までが現実的な境界です。
NPU と iGPU、どちらのほうが LLM は速いですか?
生成速度(tok/sec)だけ見ると iGPU(DirectML)のほうが速い場合が多いです。iGPU は帯域が広く(Snapdragon X2 Elite の Adreno は約 152 GB/s、Ryzen AI 9 HX 375 の Radeon 890M は約 89 GB/s)、同じ 3B Q4 モデルで NPU の 1.3〜2 倍の tok/sec が出ます。NPU の真価は tok/sec より低消費電力側にあり、AC 電源時は iGPU、バッテリー駆動で長時間 AI を張り付けたいなら NPU、という使い分けになります。
Snapdragon X2 Elite の 80 TOPS は Ryzen AI 300 / Core Ultra 200V の NPU より本当に速いですか?
TOPS 値ほどの差は出ません。LLM の decode はメモリ帯域律速なので、80 TOPS の Hexagon NPU も 55 TOPS の XDNA 2 も、実測の 3B Q4 生成速度は 15〜25 tok/s のレンジに収まり、TOPS 比で 45% 差があっても実測は 20〜30% の差にとどまります。TOPS が効くのは vision(画像認識)や音声認識などの CV / ASR 系ワークロードで、そこでは Snapdragon X2 Elite が明確に優位です。
Ollama や LM Studio は NPU に対応していますか?
2026 年時点で Ollama / LM Studio はまだ NPU(Hexagon / XDNA 2 / AI Boost)に直接対応していません。両者とも llama.cpp を内部で使っており、llama.cpp は CPU と GPU(Vulkan / DirectML / CUDA / ROCm)が主軸で、Windows の NPU 経路は未サポートです。NPU で LLM を動かすには Microsoft Foundry Local、Windows Copilot Runtime(Phi Silica)、Qualcomm AI Hub の QNN Execution Provider 経由の ONNX Runtime、AMD Ryzen AI Software のいずれかが現時点の選択肢です。
NPU 用にどの Copilot+ PC を買うべきですか?
3B までの LLM を低消費電力で常時張り付けたい用途なら、Snapdragon X2 Elite 搭載機(Surface Laptop 8 / ASUS Zenbook A14 / Lenovo Yoga Slim 7x Gen 11 等)が最有力です。Hexagon NPU が 80 TOPS で最速、バッテリー持ちも 24 時間級。x86 互換や Copilot Runtime 以外の Windows アプリを重視するなら、Ryzen AI 9 HX 375 搭載機(HP OmniBook Ultra / HP EliteBook X G1a 等)または Core Ultra 9 288V 搭載機(Lenovo ThinkPad X1 Carbon Gen 13 Aura Edition / ASUS Zenbook S14 等)が選択肢です。