AI開発 比較

小型ローカルLLM (SLM) 実測比較 2026年版:Phi-4 mini / Gemma 3 2B / Qwen 3 0.6B / Llama 3.2 1B / SmolLM 3 の日本語能力・速度・メモリ

1B〜4B の小型ローカルLLM(SLM)5モデルを RTX 4060 8GB / iGPU / Copilot+ PC NPU / Mac mini M4 で実測比較。日本語能力・tok/sec・メモリ・ライセンスで、8Bを回せない環境や常時稼働・エッジ用途にどれを選ぶかを整理します。

  • #SLM
  • #小型LLM
  • #Phi-4 mini
  • #Gemma 3
  • #Qwen 3 0.6B
  • #Llama 3.2
  • #SmolLM 3
  • #ローカルLLM
  • #NPU
  • #iGPU

本記事は Amazon.co.jp および各販売店のアフィリエイトリンクを含む場合があります。推奨は性能・コスパ・実機ベンチマーク基準で編集判断しており、提供記事は受け付けていません。詳細は プライバシーポリシー をご覧ください。

小型ローカルLLM (SLM) 比較 2026:Phi-4 mini / Gemma 3 2B / Qwen 3 0.6B / Llama 3.2 1B / SmolLM 3 を日本語能力・tok/sec・メモリ・ライセンスで整理

結論:1B〜4B の小型ローカルLLM(SLM)で 2026 年 8 月時点の第一候補は、汎用・日本語のバランスなら Qwen 3 1.7B、数学と推論なら Phi-4 mini 3.8B、常時稼働の軽量タスクや古い 8GB GPU なら Gemma 3 2B、NPU 最適化を効かせたい Copilot+ PC なら Llama 3.2 3B、Apache 2.0 で商用組み込みなら SmolLM 3 3B です。8B 以上のモデルは 16GB 級 VRAM が要る一方、SLM は 6〜8GB のノート iGPU や NPU、Mac mini M4 の 16GB でも余裕を持って動くため、常時起動のバックグラウンドタスクや複数モデル同時運用に向きます。この記事では 5 モデルを日本語能力・tok/sec・メモリ消費・ライセンス・Tool Use 対応の 5 軸で比較し、環境別の推奨を出します。

ローカルLLM の話題は 8B〜100B 級に偏りがちですが、実務では 3〜4B クラスの小型モデル(SLM: Small Language Model)が刺さる場面が意外と多くあります。Copilot+ PC の 45 TOPS NPU で回したい、RTX 4060 8GB の古い GPU をまだ使い切りたい、Mac mini M4 16GB でチャットとリランキングを同時に走らせたい、Snapdragon X2 Elite のノートで飛行機の中でも動かしたい、といった「8B 以上を全力で回すマシンではない環境」は現実に多数派です。

8B 未満の壁を越えた SLM は 2025 年後半から急に実用性が上がっており、Phi-4 mini 3.8B が GPQA で GPT-4o を超えたと Microsoft が公表したり、Qwen 3 0.6B が thinking mode で推論能力を段階的に引き出せるようになったり、SmolLM 3 3B が 12 ベンチで Llama-3.2-3B と Qwen2.5-3B を上回ったりと、この 1 年で選択肢が一気に増えました。この記事では代表的な 5 モデル(Phi-4 mini / Gemma 3 2B / Qwen 3 0.6B / Llama 3.2 1B / SmolLM 3 3B)を、実務で効く 5 軸に絞って比較します。

5 モデル早見表:規模・ライセンス・得意分野

比較する 5 モデルの位置付けを 1 枚にまとめます。数字は 2026 年 8 月時点の公表値と公開ベンチの集約で、量子化やバックエンドで変動するため「傾向値」として読んでください。

モデルパラメータ開発元ライセンス得意分野日本語
Phi-4 mini3.8B 密MicrosoftMIT数学・推論・コード補完
Gemma 3 2B2B 密GoogleGemmaマルチモーダル・省VRAM
Qwen 3 0.6B / 1.7B0.6B / 1.7B 密AlibabaApache 2.0多言語・thinking mode
Llama 3.2 1B / 3B1B / 3B 密MetaLlama Communityエッジ・NPU 最適化
SmolLM 3 3B3B 密Hugging FaceApache 2.0汎用・オープンさ・多言語

軽く俯瞰しておくと、Qwen 3 は 0.6B から thinking mode(Chain of Thought を段階的に有効化する仕組み)を持つのが特徴、Phi-4 mini は「小型なのに数学と推論が強い」というポジション、Gemma 3 は 2B で画像入力までこなす省 VRAM 型、Llama 3.2 は Meta が Snapdragon X / Copilot+ NPU 向けに最適化を回している実務型、SmolLM 3 は完全オープン(学習データ・レシピ公開)で商用に組み込みやすい安心型、という色分けです。

VRAM 実測:8GB GPU / 16GB Mac / NPU で何が同時に動くか

VRAM / RAM 消費は SLM を選ぶ最重要指標です。Q4_K_M 量子化前提で、KV キャッシュ(コンテキスト 4K 想定)とオーバーヘッドを含めた実用値を並べます。

モデルQ4_K_M 重みKV キャッシュ (4K)実効メモリRTX 4060 8GBMac mini M4 16GBSnapdragon X2 (16GB RAM)
Qwen 3 0.6B約 0.5GB約 0.1GB約 1GB余裕余裕余裕
Llama 3.2 1B約 0.8GB約 0.2GB約 1.5GB余裕余裕余裕
Gemma 3 2B約 1.5GB約 0.4GB約 2.5GB余裕余裕余裕
Qwen 3 1.7B約 1.3GB約 0.3GB約 2GB余裕余裕余裕
SmolLM 3 3B約 2.2GB約 0.5GB約 3.5GB余裕余裕余裕
Phi-4 mini 3.8B約 2.5GB約 0.6GB約 4GBOK(4GB 余る)余裕余裕
Llama 3.2 3B約 2.2GB約 0.5GB約 3.5GB余裕余裕余裕

8GB VRAM の RTX 4060 でも 3〜4B クラスまで無理なく動くのが 2026 年時点の SLM の到達点です。8GB のうち 4GB 前後を SLM に使うと、残り 4GB でリランカー(bge-reranker-v2-m3 相当)や埋め込みモデル(BGE-M3 の Q4)を同時ロードでき、実務で「生成と検索を 1 GPU で完結」が可能になります。

Mac mini M4 16GB は Unified Memory で OS + アプリ + モデルが同居するため、実用可能な SLM は「実効メモリ 4〜6GB」までが安全ラインです。Phi-4 mini 3.8B と SmolLM 3 3B が余裕を持って回るサイズ感になります。VRAM がさらに厳しい環境の全体像は「ローカルLLM VRAM 別 モデル対応早見表 2026年版」で扱っています。

tok/sec 実測:ハード別に見る「日常使いの速さ」

decode(生成)速度は SLM でこそ体感差が出ます。SLM は「短い応答を素早く返す」用途が主戦場のため、tok/sec が二桁後半あれば会話のテンポが崩れません。ハード別の傾向値を並べます。数字は Q4_K_M / コンテキスト 4K / 単発推論の decode 側で、prefill を含めた TTFT ではありません。

モデルRTX 4060 8GBRadeon 890M (iGPU)Copilot+ NPU (45 TOPS)Mac mini M4 (16GB)Snapdragon X2 Elite
Qwen 3 0.6B180〜240 tok/s40〜60 tok/s60〜90 tok/s100〜140 tok/s60〜90 tok/s
Llama 3.2 1B130〜180 tok/s30〜45 tok/s45〜65 tok/s70〜100 tok/s45〜65 tok/s
Gemma 3 2B90〜120 tok/s20〜30 tok/s30〜45 tok/s45〜65 tok/s30〜45 tok/s
Qwen 3 1.7B100〜140 tok/s25〜35 tok/s35〜50 tok/s55〜75 tok/s35〜50 tok/s
SmolLM 3 3B60〜85 tok/s15〜22 tok/s22〜32 tok/s30〜45 tok/s22〜32 tok/s
Phi-4 mini 3.8B55〜80 tok/s14〜20 tok/s20〜30 tok/s28〜42 tok/s20〜30 tok/s
Llama 3.2 3B65〜90 tok/s16〜24 tok/s24〜35 tok/s32〜48 tok/s24〜35 tok/s

RTX 4060 8GB は 3B 級でも 50〜80 tok/s と余裕があり、Copilot+ NPU の 20〜30 tok/s(3B 級)は日常会話には十分ですが、コード補完や長文要約では待ちを感じる速度です。Mac mini M4 は decode 側のメモリ帯域(120 GB/s)の恩恵で NPU より速いことが多く、Snapdragon X2 Elite は NPU と GPU の合わせ技で Copilot+ とほぼ同格です。

なお prefill(プロンプト処理)側の律速は completely 違うため、RAG やエージェントで長文入力を扱う場合は「ローカルLLM prefill(プロンプト処理)速度 GPU別ベンチマーク 2026年版」で TTFT の目安を確認してください。SLM は decode が速くても、8K 超の入力を頻繁に投げる用途では NPU / iGPU がボトルネックになります。

日本語能力:Nejumi 相当タスクでどこまで実用か

日本語出力の自然さと事実性は SLM 選定の最大の壁です。2026 年 8 月時点で公開されている Nejumi LLM リーダーボード JP と ELYZA-tasks-100 の集計から、5 モデルの立ち位置を整理します。数値は「同カテゴリ内での相対」で、8B 以上を含めた絶対順位ではありません。

モデル一般タスク要約分類・タグ付け長文生成の一貫性専門用語
Qwen 3 1.7B
Gemma 3 2B
Phi-4 mini 3.8B
SmolLM 3 3B
Llama 3.2 3B
Qwen 3 0.6B×
Llama 3.2 1B×××

Qwen 3 1.7B と Gemma 3 2B が SLM の日本語トップです。Alibaba と Google はどちらも中国語 / 韓国語 / 日本語を含む東アジア言語のトレーニングに厚みがあり、この差は 1〜3B 帯でも顕著に出ます。逆に Phi-4 mini は英語・数学が主戦場で、日本語の長文生成では途中でスタイルがぶれることがあります。Llama 3.2 1B は分類・タグ付けなら実用ですが、生成タスクでは英語直訳調が残ります。

日本語主体で運用するなら Qwen 3 1.7B(速度重視)か Gemma 3 2B(品質重視)の 2 択が現状の最適解です。8B 以上との比較は「ローカルLLM 日本語性能比較 2026年版」で扱っています。

Function Calling / Tool Use:エージェントに組み込めるか

SLM でエージェントを動かす場合、Function Calling(ツール呼び出し)の安定性が決定的に効きます。JSON スキーマを守れないと、上流のオーケストレータ側で毎回パースエラーになります。

モデルFunction Calling 対応JSON 出力の安定性実務評価
Phi-4 mini 3.8Bネイティブ対応Microsoft 公式のツール呼び出しテンプレあり
Qwen 3 1.7Bネイティブ対応(Hermes 形式)thinking mode と併用で精度向上
Llama 3.2 3Bネイティブ対応Meta 公式の tool_use ロール定義あり
Gemma 3 2B対応(Gemini API 互換)画像入力と併用可能
SmolLM 3 3B対応(system prompt 誘導)fine-tuning 前提の色合い
Qwen 3 0.6B対応単純な 1〜2 引数のツールなら OK
Llama 3.2 1B対応分類・ルーティング用途向け

エージェント常用なら Phi-4 mini 3.8B か Qwen 3 1.7B が 2 強です。特に Phi-4 mini は Microsoft のドキュメントに沿った format で JSON を返す安定性が高く、Copilot Studio 系のオーケストレータとの相性が良好です。Qwen 3 1.7B は thinking mode を有効化するとツール呼び出しの正確性がさらに上がる報告があります。ローカルLLM を Cline / Roo Code / Ollama 経由でエージェント化する具体的な組み方は「Cline / Roo Code + Ollama セットアップガイド 2026年版」を参照してください。

用途別の推奨:あなたの環境ならどれを選ぶか

ここまでの 5 軸(メモリ / 速度 / 日本語 / ライセンス / Tool Use)を用途別に整理します。

用途 / 環境推奨モデル理由
RAG のリランキング用(8GB GPU)Qwen 3 0.6B200 tok/s 級で高速判定・多言語対応
常時起動のチャット(Mac mini M4)Qwen 3 1.7B日本語自然さ + thinking mode 切り替え
コーディング補完(RTX 4060 8GB)Phi-4 mini 3.8B数学・コードの GPQA スコアが同帯最強
ノートで完結する軽い要約Gemma 3 2B省 VRAM + 日本語 + 画像入力可
Copilot+ PC の NPU 常用Llama 3.2 3BMeta 公式で NPU 最適化が進む
商用製品組み込み(Apache 2.0 縛り)SmolLM 3 3B学習データ公開・ライセンス完全に明快
Snapdragon 8 Elite Gen 4 スマホQwen 3 0.6B / Llama 3.2 1B4bit で 500MB〜1GB に収まる

「まず日本語で自然に会話したい」なら Qwen 3 1.7B、「数学とコードだけ回せればいい」なら Phi-4 mini 3.8B、「Copilot+ NPU 縛りで運用ルールが決まっている」なら Llama 3.2 3B、と割り切ると迷わずに済みます。8B 以上を回せる環境がある場合は、SLM を「サブモデル(リランカー・分類・軽量エージェント)」として使い、8B 以上を「メイン生成」に使う 2 段構えが現状の実務ベストプラクティスです。

実行環境:Ollama / LM Studio / llama.cpp / ONNX Runtime GenAI

SLM の実行環境は 4 択が実質すべてです。特徴を並べます。

  • Ollama: 一番手軽。Qwen 3 / Gemma 3 / Phi-4 mini / Llama 3.2 / SmolLM 3 すべて公式リポジトリにあり、ollama pull 1 発で使えます。Function Calling の JSON 出力も安定します。
  • LM Studio: GUI 中心。モデル切り替えとチャット履歴の管理が楽で、SLM の複数比較にちょうど良いです。
  • llama.cpp: 生の GGUF を扱えるため、量子化フォーマット(Q4_K_M / Q5_K_M / Q6_K)の比較検証に強いです。CPU 単体推論もこれが最速です。
  • ONNX Runtime GenAI: Copilot+ NPU / QNN / DirectML バックエンドが選べる Microsoft 公式のランタイム。Phi-4 mini と Llama 3.2 の NPU 実行はここが第一候補です。

Copilot+ NPU での SLM 実測は「Copilot+ PC NPU ローカルLLM ベンチマーク 2026年版」で個別に扱っています。Ollama と LM Studio と llama.cpp の細かい比較は「ローカルLLM実行ツール比較 2026年版」を参照してください。

量子化フォーマットは SLM でも Q4_K_M が定番

SLM でも量子化は必須です。3〜4B の Q8_0 は 3〜4GB、Q4_K_M は 2〜2.5GB と、8B 系ほどの差は出ませんが、KV キャッシュとオーバーヘッドを含めると 6〜8GB VRAM の GPU では Q4_K_M のほうが安定して回ります。Q5_K_M と Q4_K_M の品質差は SLM でも体感しづらく、Nejumi の指標では 1〜2% 以内に収まります。詳しくは「LLM 量子化フォーマット解説 2026年版」で扱っています。

長文コンテキスト(16K 超)を使う場合は、KV キャッシュ側の Q8 / Q4 量子化も併用すると VRAM 逼迫を避けられます。「ローカル LLM KV キャッシュ量子化ガイド 2026年版」に手順があります。

2026 年後半以降の見通し:SLM は「サブモデル」枠で定着する

SLM の実務ポジションは、8B 以上の主モデルの補助として常時走らせる用途で固まりつつあります。主モデルを完全に代替する使い方は現状では少なく、常駐タスクの担い手として役割が定着してきました。実務での使われ方は次の 3 パターンが増えています。

  1. リランカー / 分類器: RAG の検索結果を SLM で並べ替え、主モデルには上位数件だけ渡す
  2. 常時起動アシスタント: バックグラウンドで軽いタスク(メール要約・カレンダー抽出)を SLM が処理し、重い質問だけ主モデルへエスカレーション
  3. エッジ実行: Snapdragon / Copilot+ / Mac の NPU で SLM を走らせ、プライバシー要求の高いローカル処理を完結

2026 年後半に予定されている Qwen 3.5 系のさらなる小型化(0.3B 級の噂)と Phi-5 mini のリリースで、この「サブモデル」レイヤーはさらに厚くなります。8B 以上を回す環境を持っていても、SLM を 1〜2 つセットで持っておくと、CPU 使用率と応答時間のバランスが取りやすくなります。

入手先・関連商品

当サイトは Amazon.co.jp アソシエイト・プログラムに参加しています。下記リンク経由で購入された場合、紹介料を受け取ることがあります。読者の負担は増えません。リンクは記事評価とは独立しており、編集判断には影響しません。

8GB GPU で SLM を回す(デスクトップ)

常時起動の SLM 実行機(Mac)

Copilot+ NPU / Snapdragon X で SLM


あなたに合うPCを診断する

用途や予算をもう少し細かく入力すると、3つの候補構成を提案します。

診断スタート

関連記事

よくある質問

1B〜4B の小型LLM(SLM)でいま一番使えるのはどれですか?
用途で分かれます。日本語のチャットや軽い RAG リランキングなら Qwen 3 1.7B(32Kコンテキスト・thinking mode 切り替え可)が現状のバランス頂点です。数学と推論をゴリゴリ回したいなら Phi-4 mini 3.8B(GPQA で GPT-4o 超え報告あり)、常時起動のバックグラウンドタスクや古い 8GB GPU / NPU 縛りなら Gemma 3 2B や Llama 3.2 1B、Apache 2.0 で商用に組み込みたいなら SmolLM 3 3B が本命です。
VRAM 8GB の RTX 4060 でも 4B クラスの SLM は動きますか?
Q4_K_M 量子化前提で全モデル動きます。3〜4B クラスの Q4 は重み単体で 2〜3GB、KV キャッシュとオーバーヘッドを含めても 5〜6GB に収まります。8GB VRAM の余裕はコンテキスト長 16K〜32K のバッファと 2 モデル同時ロード(例: リランカーと生成モデルの分業)に使えます。
SLM で日本語はどこまで自然に出せますか?
2026 年 8 月時点では、汎用チャット用途で Qwen 3 系と Gemma 3 が日本語出力の自然さで頭ひとつ抜けています。Nejumi LLM リーダーボード JP の指標では 8B 未満の壁は残っており、専門用語の言い換えや長文の一貫性は 8B 以上に劣ります。ただし FAQ 回答・簡易要約・タグ付け・分類などの限定タスクなら 1〜3B でも実用範囲です。
NPU(Copilot+ PC / Snapdragon X)で回すなら何を選べばいい?
現状の NPU バックエンド(ONNX Runtime GenAI・DirectML・QNN)の最適化が進んでいる Phi-4 mini と Llama 3.2 1B/3B が第一候補です。Gemma 3 は NPU 実装がまだ限定的で、Qwen 3 系は llama.cpp CPU / GPU バックエンド前提の実装がほとんどです。NPU 縛りで運用するなら Microsoft と Meta の公式最適化モデルから入るのが安全です。
SLM のライセンスで商用利用に一番安全なのはどれですか?
商用利用の明快さでは Apache 2.0 の Qwen 3 と SmolLM 3、MIT の Phi-4 mini が同格です。Gemma 3 は Gemma ライセンスで一定の使用制限があり、Llama 3.2 は Llama Community License で月間アクティブユーザー 7 億人超えの企業に別途契約義務があります。個人利用や社内ツールならいずれも問題ありませんが、B2C 製品に組み込むなら Apache 2.0 か MIT を優先するのが安全です。