一般向けハードウェアでローカル実行するのに最適なAIモデル

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

2026年時点で、Qwen3.5-9Bはほとんどのコンシューマー向けPCに最適な、総合力の高いローカルAIモデルです。

より適した選択肢は、用途によって変わる場合があります。コンパクトなモデルはCPUやノートパソコンで高速に動作し、8B~14Bモデルは通常、品質とメモリ使用量のバランスに最も優れています。また、速度よりもコーディング、推論、マルチモーダルの精度を重視する場合は、より大規模なモデルやMixture-of-Expertsモデルが適しています。

以下の比較では、実用的な4ビット構成を基準にしています。そのため、数十GBの重みをダウンロードする前に、手元のRAMまたはVRAMにどのモデルが適合するかを確認できます。

ローカルAIモデル比較:最終候補

順位 モデル 最適な用途 おおよその4ビット使用時サイズ 実用的な開始時のハードウェア 主なトレードオフ
1 Qwen3.5-9B 総合ベスト 6~8 GB 16 GB RAMまたは8~12 GB VRAM 長いコンテキストには大幅に多くのメモリが必要
2 Gemma 4 12B マルチモーダル作業 9~12 GB RAM 24 GBまたはVRAM 12~16 GB テキスト専用モデルよりも負荷が大きい
3 gpt-oss-20b ローカル推論 MXFP4で約16 GB ユニファイドメモリまたはVRAM 16 GB ハイエンドのコンシューマー向けハードウェアが必要
4 Ministral 3 14B Instruct エージェントおよびツール利用 9~12 GB RAM 24 GBまたはVRAM 12~16 GB 小型の8B~9Bモデルより遅い
5 Qwen3-Coder-30B-A3B ローカルコーディング 18~22 GB RAM 32 GBまたはVRAM 24 GB アクティブなパラメータは3.3Bでも、全体の重みは依然として大きい
6 DeepSeek-R1-Distill-Qwen-14B 低予算での推論 9~11 GB RAM 24 GBまたはVRAM 12~16 GB 推論の出力が冗長で遅くなる場合がある
7 Qwen3-VL-8B Instruct 画像とドキュメント ビジョンコンポーネントを含めて7~10 GB RAM 16~24 GBまたはVRAM 12 GB 画像の解像度によってメモリ使用量が変わる
8 Phi-4 Mini Instruct 小型デバイスでの推論 3~5 GB RAM 8~16 GBまたはVRAM 6 GB 大型モデルよりも知識の幅が狭い
9 Gemma 3n E4B モバイルおよび低リソース環境でのマルチモーダルAI 4~7 GB ユニファイドRAM 8~16 GB プラットフォームによってランタイムの対応状況が異なる
10 Llama 3.2 3B Instruct 幅広いエコシステムとの軽量な互換性 2~4 GB 8 GB RAMまたは4~6 GB VRAM 新しい小型モデルよりも古く、性能が低い

メモリ容量は計画用の目安であり、保証値ではありません。利用可能な場合は実用的な4ビットビルドと、適度なコンテキストウィンドウを前提としています。ランタイムのオーバーヘッド、KVキャッシュ、ビジョンエンコーダー、バッチサイズ、GPUオフロードによって、数GBの追加メモリが必要になる場合があります。

ローカル利用に最適なモデルの選び方

これはベンチマークだけによるランキングではありません。テストで優れた結果を出しても、あなたのマシンに収まらないモデルは、あなたにとって最適なローカルモデルとはいえません。重視したのは、実用的な出力品質、現実的なコンシューマー向けハードウェアへの適合性、ローカルランタイムまたは量子化ビルドの入手性、対応タスクの幅、ライセンスやアクセスのしやすさという5つの要素です。

「コンシューマー向けハードウェア」も幅広く捉え、WindowsおよびLinux PC、Appleシリコン搭載Mac、コンパクトなホームサーバー、NASを中心としたホームラボを対象にしました。先にパーツを選ぶ場合は、GPUメモリだけに注目するのではなく、システム全体の構成を見積もるために、当社のローカルAIサーバー向け予算別ハードウェアガイドをご利用ください。

1. Qwen3.5-9B — 総合的に最適なローカルAIモデル

Qwen3.5-9Bは、最新の16 GBコンピューター、または8~12 GBのGPUに最もバランスのよい選択肢です。実用的な量子化形式で動かせるほど小型でありながら、チャット、要約、検索拡張生成、多言語処理、軽いコーディングにも十分対応できます。

公式モデルカードにはネイティブで262,144トークンのコンテキストウィンドウが記載されていますが、この数値をローカル環境のデフォルト設定にすべきではありません。コンテキストが長くなるほどKVキャッシュも増加するため、まずは8K~16K程度から始め、ワークロード上必要な場合にのみ増やしてください。これにより、レイテンシーとメモリ使用量を抑えられます。

  • 選ぶべき場合: 日常的なローカル利用に使える汎用モデルを1つ求めている場合。
  • 選ばないほうがよい場合: 主な用途が高度なコード生成や音声・動画の理解である場合。
  • 最適な構成: 12 GB GPUでの4ビット量子化、または16~24 GBのシステムRAMを使ったCPU/GPUハイブリッド推論。

2. Gemma 4 12B — ローカルでのマルチモーダルAIに最適

Gemma 4 12Bは、「ローカルAI」がテキストだけにとどまらない場合に、より有力な選択肢です。Googleのモデルカードによると、テキスト、画像、音声、動画をネイティブに入力でき、最大256Kのコンテキストウィンドウ、多言語対応(140以上の言語)、そしてローカルで効率的に実行できるよう設計されたアーキテクチャを備えています。

Gemma 4 12Bの紹介

この汎用性には追加の負荷が伴います。量子化モデルを快適に実行するには、24 GBのシステムRAMまたは12~16 GBのVRAMを用意し、メディア入力用にさらに余裕を残してください。プライベートな写真分析、文書理解、会議メディアの処理、マルチモーダル検索に特に役立ちます。

  • 選ぶべき場合: テキストとメディアを理解できる単一のモデルが必要な場合。
  • 選ばないほうがよい場合: 8 GBのノートパソコンで高速なテキストチャットだけが必要な場合。
  • 最適な構成: 16 GBのVRAM、または32 GBのユニファイドメモリ。

3. gpt-oss-20b — 一般向けGPUで高品質な推論に最適

gpt-oss-20bは、一般消費者向けハードウェアの上位クラスを対象としています。OpenAIによると16 GBのメモリで実行できますが、小さいモデルについては公式Ollamaガイドで、少なくとも16 GBのVRAMまたはユニファイドメモリが推奨されています。

GPT-OSS 120B & 20B:OpenAIのオープンウェイト推論モデルを解説 | Servifyspheresolutions著 | Medium

ワークステーションクラスのGPUへ移行せずに、慎重な推論、構造化出力、ローカルでの実験を求めるユーザーに適しています。実用上の注意点は、16 GBは出発点にすぎず、十分な余裕があるわけではないことです。長いコンテキスト、並列リクエスト、またはMXFP4以外の形式を使用すると、必要なメモリがさらに増える可能性があります。

  • おすすめのケース:低レイテンシよりも推論品質を重視する場合。
  • おすすめしないケース:VRAMが8 GBしかない場合、またはCPUのみの推論に頼る場合。
  • 最適な環境:16〜24 GBのGPU、または少なくとも24 GBのユニファイドメモリを搭載したApple Siliconシステム。

4. Ministral 3 14B Instruct — ローカルエージェントとツール利用に最適

Ministral 3 14B Instructは、テキストとビジョンをネイティブな関数呼び出し、JSON出力、多言語対応、システムプロンプトへの高い準拠性と組み合わせています。Mistralはこのファミリーをエッジ展開向けに位置付けており、14BモデルはFP8で24 GBのVRAMに収まると説明しています。さらに量子化すれば、必要なメモリは少なくなります。

Ministral-3 3Bをローカルで実行:ビジョン機能を備えた効率的な小型モデル

検索、オートメーション、ファイル操作のツールを呼び出すプライベートなホームアシスタントでは、わずかなベンチマーク上の優位性よりも、こうした信頼性に関わる機能のほうが重要になる場合があります。4ビット版ならメモリの少ないハードウェアにも収まるはずですが、12〜16 GBのVRAMがあれば、より快適に運用できます。

  • おすすめのケース:ツールを使うエージェントや、構造化されたワークフローを構築する場合。
  • おすすめしないケース:エントリーレベルGPUで、1秒あたりの最大トークン数を最優先する場合。
  • 最適な環境:16 GBのVRAMと、適度なコンテキストウィンドウ。

5. Qwen3-Coder-30B-A3B Instruct — ローカルコーディングに最適なモデル

Qwen3-Coder-30B-A3B Instructは、エージェント型コーディング、リポジトリ規模の理解、関数呼び出しに特化して設計されています。このMixture-of-Expertsアーキテクチャは総計305億パラメータを備えていますが、トークンごとにアクティブになるのは約33億パラメータです。これにより計算効率が向上する一方、量子化済みの重み全体を保存する必要はあります。

Qwen/Qwen3-Coder-30B-A3B-Instruct · Hugging Face

この違いはハードウェア計画において重要です。4ビット版は通常、VRAM 24 GBのGPU、または少なくともシステムメモリ32 GBのマシンに適しています。ネイティブの256Kコンテキストは大規模なリポジトリに魅力的ですが、コードのコンテキストはKVキャッシュメモリをすぐに消費するため、ローカルユーザーは小さめの設定から始めるべきです。

  • 選ぶべき場合:主な用途がコーディングで、24 GBクラスのグラフィックスメモリがある場合。
  • 選ばないほうがよい場合:軽量な日常用アシスタントを求める場合。
  • 最適な環境:余裕を確保するためのVRAM 24 GB、高速なNVMeストレージ、システムRAM 64 GB。

6. DeepSeek-R1-Distill-Qwen-14B — 低予算向け推論モデルとして最適

DeepSeek-R1-Distill-Qwen-14Bは、DeepSeek-R1で学習された推論パターンを、Qwen2.5ベースの高密度14Bチェックポイントに凝縮したモデルです。完全版のDeepSeek-R1モデルをホストできないハードウェアでも、数学、論理、段階的な問題解決に実用的な選択肢であり続けます。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14B · Hugging Face

トレードオフは出力効率です。推論過程が長くなることがあり、回答までの時間と消費電力が増加します。適切なトークン上限を設定し、日常的なチャットではなく、じっくりした推論の恩恵を受ける問題に使いましょう。

  • 選ぶべき場合:広く入手できる量子化版を使って、手頃なローカル推論を行いたい場合。
  • 選ばないほうがよい場合:推論の深さよりも、簡潔ですぐに得られる回答を重視する場合。
  • 最適な環境:VRAM 12~16 GB、またはシステムRAM 24~32 GB。

7. Qwen3-VL-8B Instruct — 画像とドキュメント理解に最適

Qwen3-VL-8B Instructは、スクリーンショット、スキャンページ、図、グラフ、画像による質問応答に特化したビジョン・ランゲージモデルです。公式のGGUFビルドにはQ4_K_Mウェイトと個別のビジョン投影ファイルが含まれており、llama.cpp互換ツールでより簡単に導入できます。

Qwen/Qwen3-VL-8B-Instruct · Hugging Face

実際のメモリ使用量は画像の枚数と解像度によって異なるため、テキストのみの8Bモデルよりも余裕を持たせてください。プライベートなアーカイブでは、すべてのページをフル解像度のまま1つのプロンプトに投入するのではなく、OCRと検索をモデルと組み合わせて使用しましょう。当社の写真AIとドキュメントRAGのハードウェア比較で、異なるボトルネックについて詳しく説明しています。

  • 選ぶべき場合:画像、PDF、スクリーンショット、または視覚的な記録を扱う場合。
  • おすすめしない場合:ワークロードが完全にテキストのみの場合。
  • 最適な環境: VRAM 12 GB、または共有システムメモリ24 GB。

8. Phi-4 Mini Instruct — 低メモリでの推論に最適

Phi-4 Mini Instructは、計算リソースに制約があり、低レイテンシが求められる環境向けに設計されており、指示追従、数学、論理に重点を置いています。Microsoftは128Kのコンテキストウィンドウを記載していますが、同じローカルメモリに関する注意点が当てはまります。性能が高いからといって、小型マシンで最大コンテキストを割り当てるべきとは限りません。

新しいPhi-4モデル、Microsoft Phi-4-miniとPhi-4-multimodalへようこそ

コンパクトPC、旧型ノートパソコン、またはCPU重視のサーバーに最初に導入するモデルとして適しています。Microsoftは、デスクトップ環境とモバイル環境の両方でCPUおよびGPU展開に対応する最適化済みONNXバージョンも提供しています。

  • 選ぶべき場合: 少ないメモリ容量で推論が必要な場合。
  • おすすめしない場合: 幅広い事実の想起やクリエイティブライティングを最優先する場合。
  • 最適な環境: システムRAM 8~16 GB、または6 GBのGPU。

9. Gemma 3n E4B — モバイルおよび低リソースのマルチモーダル用途に最適

Gemma 3n E4Bは、低リソースデバイスで効率的に動作しながら、テキスト、画像、動画、音声の入力に対応するよう設計されています。最大限のデスクトップ性能よりも、統合GPUやユニファイドメモリ搭載ノートパソコンを重視する場合に便利な選択肢です。

gemma3n:e4b

ワークフローを決める前に、ランタイムの互換性を確認してください。マルチモーダル対応には、最新のライブラリやプラットフォーム固有のバックエンドが必要になる場合があります。また、モデルへのアクセスにGoogleのライセンス条項への同意が必要なこともあります。対応環境が整えば、コンパクトなサイズのため、プライベートな現場ツールやオフラインでのメディア分析に適しています。

  • 選ぶべき場合:効率的なノートPCやエッジデバイスでマルチモーダル機能を利用したい場合。
  • 避けたほうがよい場合:最も簡単なクロスプラットフォーム構成が必要な場合。
  • 最適な構成:最適化されたネイティブランタイムと16 GBのユニファイドメモリ。

10. Llama 3.2 3B Instruct — 最も軽量なエコシステム重視の選択肢

Llama 3.2 3B Instructは、もはや最新の小規模モデルではありませんが、幅広いランタイム、チュートリアル、コミュニティによるサポートがあるため、今でも役立ちます。Metaは、1Bおよび3Bのテキストモデルを、多言語対話、検索、要約、デバイス上での利用向けに設計しました。

meta-llama/Llama-3.2-3B-Instruct · Hugging Face

カテゴリ最高水準の知能ではなく、互換性を重視して選びましょう。控えめなシステムでも動作し、統合も簡単なので、より大きなモデルへ移行する前にアプリケーションをテストするための信頼できるベースラインになります。

  • 選ぶべき場合:成熟したツール環境と小さなダウンロード容量を重視する場合。
  • 避けたほうがよい場合:2026年時点で利用可能な最高品質の出力を求める場合。
  • 最適な構成:システムRAM 8 GB、必要に応じてGPUへの部分オフロード。

あなたのハードウェアに適したモデルは?

8 GB RAMまたは4~6 GB VRAM

4ビット量子化のPhi-4 MiniまたはLlama 3.2 3Bから始めましょう。コンテキストは4K~8Kに保ち、同時に処理するリクエストは1件にして、CPUでの生成は即時ではなく実用的な速度になると考えてください。小規模なシステムは、分類、要約、シンプルなRAG、ホームオートメーションに適しています。

16 GB RAMまたは8~12 GB VRAM

標準的な推奨はQwen3.5-9Bです。画像入力が必要な場合はQwen3-VL-8Bも適していますが、より大きな余裕が必要です。この層は、一般的なゲーミングPC、MacBook、コンパクトなローカルAI環境に最適なバランスを提供します。

24~32 GB RAMまたは16 GB VRAM

Gemma 4 12B、Ministral 3 14B、DeepSeek-R1-Distill-Qwen-14B、gpt-oss-20bが現実的な選択肢になります。16 GB GPUの層は、十分な容量を確保しながらCPUからGPUへの低速な転送を避けられるため、特に便利です。中程度のコンテキストにも対応できます。

64 GB RAMまたは24 GB VRAM

Qwen3-Coder-30B-A3Bは、この用途に実用的な選択肢です。小規模モデルの高品質な量子化版も適しています。この層は、本格的なコーディングアシスタント、複数のローカルサービス、大規模なRAGコレクション、より長いコンテキストの実験に向いています。

パフォーマンスに不満がある場合は、モデルを入れ替える前に、実際のボトルネックを特定してください。ローカルAIにおけるコンピューティング、メモリ、ストレージ、ネットワークのボトルネックに関するガイドでは、トークン生成の遅さと、モデルの読み込みや検索の遅さを切り分ける方法を解説しています。

これらのモデルをローカルで実行する方法

  1. ランタイムを選びましょう。OllamaはコマンドラインやAPIでの利用に便利で、LM Studioは使いやすいデスクトップインターフェースを提供し、llama.cppはGGUF推論とハードウェアオフロードを幅広く制御できます。
  2. 量子化ビルドをダウンロードしましょう。GGUFモデルでは、Q4_K_Mが汎用的な出発点として適しています。低ビット形式はメモリを節約できますが品質が低下する場合があり、高ビット形式は忠実度が向上する一方で、より多くのRAMを消費します。
  3. まずは短いコンテキストから始めましょう。最初は4K~8Kに設定し、メモリ使用量と速度を確認してから、徐々に増やしてください。128Kや256Kのコンテキストに対応しているからといって、最大コンテキストが無料になるわけではありません。
  4. 処理の一部をGPUにオフロードしましょう。モデル全体がVRAMに収まらない場合でも、一部をオフロードすることで推論を高速化できます。残りの部分はシステムRAMに保持されます。
  5. 自分のプロンプトをテストしましょう。実際に使用するタスクで、精度、レイテンシ、ツール呼び出し、フォーマット、ハルシネーションを評価してください。公開ベンチマークでは、あなたのドキュメントやワークフローを再現できません。

エンドツーエンドの導入計画については、ZimaSpaceのローカルAIサーバー構築ガイドをご覧ください。ローカル環境を選ぶ主な理由がデータプライバシーである場合は、セルフホスト型LLMのプライバシーガイドで、ストレージ、ネットワークへの公開、ログ、アクセス制御について解説しています。

Zimaハードウェアの適した用途

ローカルAIシステムでは、ストレージ、オーケストレーション、推論を1台のボックスに集約する必要はありません。ZimaBoard 2は、モデルAPI、軽量RAG、自動化、プライベートデータサービスを調整できます。Intel N150プロセッサ、最大16 GBのLPDDR5メモリ、デュアル2.5GbE、SATA、PCIe拡張を備えているため、高性能LLM推論よりも、小規模なCPUモデルやオーケストレーションに適しています。

大規模なデータセットや拡張可能なAIハードウェアには、ZimaCube 2が適しています。複数ドライブのストレージ、SSD拡張、Thunderbolt 4、PCIeオプションを備えています。プライベートなモデルファイルやRAGデータをホストし、GPU搭載システムで推論を処理したり、より統合されたAIホームラボの中心として利用したりできます。この分離により、すべてのサービスを最も消費電力の大きいマシンに集約することなく、重要なデータをローカルに保管できます。

よくある質問

2026年にローカルで実行するのに最適なAIモデルは何ですか?

Qwen3.5-9Bは、性能、速度、多言語対応、扱いやすい量子化後のサイズのバランスが取れているため、多くのユーザーにとって総合的に最適な出発点です。マルチモーダル用途にはGemma 4 12B、より高度な推論にはgpt-oss-20b、本格的なコーディングにはQwen3-Coder-30B-A3Bを選びましょう。

GPUなしでローカルAIモデルを実行できますか?

はい。CPU推論は小型の3B~4Bモデルで快適に動作し、十分なRAMがあれば8B~9Bモデルも実行できますが、生成速度は遅くなります。Apple Siliconや最新の内蔵GPUは共有メモリを利用でき、x86システムでは部分的なGPUオフロードが役立つことがよくあります。

ローカルLLMにはどれくらいのRAMが必要ですか?

8GBあれば小型の量子化モデルには十分で、16GBが実用的な主流の最低ラインです。32GBあれば、12B~20Bモデルを十分な余裕を持って利用できます。30Bクラスの量子化済み重みなら32GBでもモデルを実行できる場合がありますが、他のサービスや長いコンテキストも扱うなら64GBのほうが快適です。

4ビットモデルでは品質が低下しますか?

通常は少し重要ですが、優れた4ビット量子化モデルなら、チャット、RAG、コーディング支援、家庭での利用に十分な品質を保ちながら、メモリ使用量を大幅に削減できます。影響の程度はモデルと量子化方式によって異なるため、導入方式を標準化する前に、代表的なプロンプトをいくつか比較してください。

VRAMはシステムRAMより重要ですか?

通常、モデルのどれだけの部分をGPUのフル速度で実行できるかはVRAMによって決まります。収まりきらない重みをシステムRAMに保持することはできますが、CPUとGPU間でデータを移動すると性能が低下します。ユニファイドメモリ搭載システムではこの境界が曖昧になりますが、それでもメモリ帯域幅は重要です。

最終結論

まずは、実際のワークロードを確実に完了できる最小のモデルから始めましょう。多くの人にとってはQwen3.5-9Bが適しています。マルチモーダル入力にはGemma 4 12B、推論にはgpt-oss-20bまたはDeepSeek-R1-Distill-Qwen-14B、コーディングにはQwen3-Coder-30B-A3Bへ移行しましょう。利用可能なメモリに合わせて量子化方式とコンテキスト長を調整し、ボトルネックを測定してからハードウェアを強化してください。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.