オンデバイスAIとは?

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
2026年7月更新
オンデバイスAIとは、リクエストをリモートサーバーに送信する代わりに、スマートフォンやノートPC、組み込みチップといったローカルハードウェア上で直接動作する人工知能です。モデルの計算はデバイス自体の上で、NPUなどの内蔵チップを使って行われるため、インターネット接続なしでもシステムは応答でき、データが最初に存在していたハードウェアの外に出ることはありません。
計算をデータセンターに送る代わりにローカルにとどめるという、このたった一つの設計選択が、AI機能の経済性、プライバシーの性質、そして障害の発生パターンを変えます。これは、機内モードのままでもスマートフォンが音声メモを文字起こしし、メッセージのやり取りを要約し、メールを書き直せる理由でもあります。
オンデバイスAIが実際にローカルで動く仕組み
かつて、大規模なモデルをスマートフォン上で動かすことなど論外でした。フロンティア級のLarge Language Modelsは数千億単位のパラメータを持つこともあり、たった一つの問い合わせに答えるだけでもデータセンター規模のGPUを必要とします。コンシューマー向けハードウェアが持つメモリと電力の余裕は、その一部にすぎません。この差を埋めたのが、3つの技術的進展です。

Neural Processing Units(NPU)。 現在のスマートフォンやノートPCのチップには、CPUやGPUと並んで専用のAIアクセラレーターが搭載されています。NPUはNeural Networksが絶えず実行する行列演算専用に設計されており、速度とバッテリー消費の両面で、汎用プロセッサよりもはるかに効率よくその計算をこなします。2026年世代のスマートフォン向けに設計されたQualcommのSnapdragon 8 Elite Gen 5には、前世代より37パーセント高速だとQualcommが説明するHexagon NPUが搭載されており、より大きなモデルをバッテリーを消耗させずにローカルで動かすことを目的としています。
量子化。 専用チップを使っても、フル精度のモデルは通常スマートフォンのメモリに収まりきりません。量子化は、重みの数値精度を下げる(多くの場合32ビットから8ビットや4ビットへ)ことでモデルを縮小し、精度への影響をわずかに抑えながらメモリ使用量を4分の1から8分の1にまで削減します。これが、サーバーラック向けに作られたモデルをスマートフォンに収まるモデルへと変える工程です。
小規模言語モデル(SLM)。 圧縮と並行して、モデル開発者は最初から小さく作られるようモデルを訓練しています。小規模言語モデルは、典型的には10億から100億パラメータの範囲にあり、定義された一連のタスク(要約、書き直し、分類、画面上のコンテンツに関する質問への回答)には十分な能力を持ちながら、スマートフォンのNPU上で動くほど軽量に設計されています。小さな「生徒」モデルが大きな「教師」モデルを模倣するように学習する知識蒸留は、こうしたモデルを構築するための主要な手法の一つです。
この3つの要素が組み合わさることで、スマートフォンやノートPCは、訓練済みモデルが実際に回答を生成する工程である推論を、データをネットワーク経由で一切送信することなく、完全にローカルのシリコン上で実行できるようになります。
企業とユーザーがオンデバイスAIを求める理由: プライバシー、レイテンシ、オフライン、コスト
プライバシー。 推論がデバイス上で実行される場合、入力データがデバイスの外に出る必要は一切ありません。音声メモ、写真、メールの下書き、患者のカルテなどを、そのコンテンツを第三者のサーバーに送信することなく処理できます。規制産業や機密データを扱うあらゆるワークフローにとって、これがモデルの性能そのものよりも決定的な要因になることが少なくありません。

レイテンシ。 クラウドへのリクエストは、モデルが計算を始める前の段階で、すでにデータセンターまで往復しなければなりません。オンデバイス推論はこの往復を完全に省略するため、ローカルの機能(オートコンプリート、ライブ文字起こし、画面上の要約など)は瞬時に感じられる一方、クラウド経由の機能には目に見える遅延が生じます。
オフライン動作。 ローカルで動作するモデルは、飛行機の中、地下室、工場のフロア、通信が不安定な地方など、電波が届かない場所でも機能します。ライブのAPI呼び出しに依存する機能は、接続が切れた瞬間に動作を止めてしまいます。
コスト。 クラウド推論はトークン単位または呼び出し単位で課金され、利用量に直接連動してコストが膨らみます。つまり、人気が出るほど機能のコストも上がるということです。オンデバイス推論は、ユーザーや企業がすでに所有しているハードウェア上で動作するため、モデルが一度デバイスに搭載されれば、クエリごとの限界費用は発生しません。
現実的な限界: モデルサイズとバッテリー
オンデバイスAIはクラウドAIに対する無償のアップグレードではなく、そうではないかのように扱うと社内で誤った期待値を設定することになります。現時点で実際に何が可能かを決めているのは、2つの制約です。

モデルサイズが能力の上限を決める。 スマートフォンやノートPCのメモリは、データセンターのGPUクラスターが扱える数百ギガバイトではなく、一桁台か二桁台前半のギガバイトにとどまります。この上限があるため、オンデバイスモデルは必然的に、フロンティア級のクラウドモデルよりも小さく、対応範囲も狭くなります。狭く明確に定義されたタスクには強い一方、自由度の高い推論、長文の文書、非常に新しい知識を要する処理には弱くなります。
バッテリーと発熱の限界。 効率的なNPUを使っていても、継続的なAI推論は電力を消費し熱を発生させます。どちらもバッテリー駆動のデバイスでは限られた資源です。これは、バッテリーを目に見えて消耗させたりパフォーマンスを低下させたりすることなく、デバイスがどれだけ連続してオンデバイス処理を行えるかという現実的な制約であり、スマートフォンメーカーがすべてをローカルチップに任せるのではなく、負荷の大きいリクエストをクラウドに振り分ける理由の一つでもあります。
Deloitte自身による2026年予測は、この緊張関係をまさに言い当てています。スマートフォンやPC内蔵のAIアクセラレーターが増えているにもかかわらず、Deloitteは2026年もAI計算のほぼすべてが、オンデバイスではなく大規模データセンターやハイエンドのエンタープライズサーバー上で行われ続けると予測しています。現在のNPUは、短いメールの要約のような軽量で単発の推論タスクをこなせる程度の能力しかなく、持続的で複雑な推論には力不足だからです。
これが、今日のオンデバイスAIの実際の姿です。現実のものであり急速に成長していますが、クラウドAIを完全に置き換えるものではなく、それを補完する存在です。
重要なポイント
- オンデバイスでAIモデルを実行できるGenAI対応スマートフォンは、2026年に世界のスマートフォン出荷台数の45パーセントに達すると予測されており、2025年の36パーセントから上昇します。Counterpoint Researchによる。
- GenAI対応スマートフォンの世界累計出荷台数は、2025年第3四半期までに5億台を超えました。Counterpoint Researchによる。
- 生成AI機能を搭載して出荷されるスマートフォンの割合は、2025年末までに30パーセントを超える可能性があり、2025年に販売されるPCの半数近くがローカルでの生成AI処理能力を持つことになります。Deloitteの2025年TMT Predictionsによる。
- AI PCは、2025年末までに世界のPC市場の31パーセントを占めると予測されていました。Gartnerによる。
- オンデバイスAIアクセラレーターの台頭にもかかわらず、Deloitteの2026年TMT Predictionsは、2026年もAIコンピューティングのほぼすべてが、PCやスマートフォンではなくデータセンターやハイエンドのエンタープライズサーバー上で行われ続けると予測しています。現在のNPUは、持続的な重い処理ではなく、軽量で単発の推論向けに作られているためです。
- GPT-3.5相当の性能で推論を実行するコストは、2022年11月から2024年10月の間に100万トークンあたり**$20.00から$0.07**へと下落しました。これは280倍以上の下落幅であり、主に効率的な小型モデルによってもたらされたものです。Stanford AI Index 2025 reportによる。
- 2026年世代のスマートフォン向けに設計されたQualcommのSnapdragon 8 Elite Gen 5には、前世代より37パーセント高速だとQualcommが説明するHexagon NPUが搭載されており、より大きなモデルをローカルで動かすことを目的としています。
2026年のオンデバイスAI: 実際の事例
オンデバイスAIは、研究デモの段階から、主要なコンシューマー向けプラットフォーム全体の標準機能へと進化しました。
Apple Intelligence。 Appleは、標準でオンデバイス処理を中心にAIシステムを構築しました。Apple Intelligenceを支えるモデルの多くはiPhone、iPad、Mac上で完結して動作し、デバイスに収まらないより大きなモデルが必要なリクエストは、AppleのPrivate Cloud Computeに振り分けられます。Appleによれば、これは汎用的なクラウドではなく、デバイス自体と同じセキュリティモデルを持つ専用のApple silicon製サーバー上で動作します。
Gemini Nano。 GoogleのGemini Nanoは、Geminiモデルファミリーのコンパクト版で、AndroidのAICoreシステムを通じてPixelスマートフォン上でオンデバイス動作するよう特別に設計されています。ネットワーク呼び出しなしで、オンデバイス要約やスマートリプライといった機能を支えています。
Copilot+ PC。 2024年に登場し、今では主流のWindowsノートPCの一階層となったMicrosoftのCopilot+ PCというカテゴリーは、少なくとも毎秒40兆回の演算(TOPS)が可能なNPUを要件としており、これによりライブキャプションや画像生成といったオンデバイスAI機能を、クラウド経由ではなくローカルで実行できます。
オンデバイスのLlama。 Metaは、Llama 3.2の1Bおよび3Bモデルを、エッジおよびオンデバイスでの展開を目的として特別に構築しました。QualcommやMediaTekなどのパートナーを通じて、スマートフォンやノートPC上で動くほど小さく、サーバーとの往復なしでローカルな要約、書き直し、ツール呼び出しを求める開発者に向けたものです。
オンデバイスAI vs クラウドAI
| 要因 | オンデバイスAI | クラウドAI |
|---|---|---|
| どこで動くか | ローカル、スマートフォン、ノートPC、デバイスチップ上 | インターネット経由でアクセスするリモートサーバー |
| データプライバシー | データは既定でデバイス上にとどまる | データは第三者のサーバーに送信される |
| レイテンシ | ほぼ瞬時、ネットワークの往復なし | 呼び出しごとにネットワークと待機時間が加わる |
| オフライン対応 | インターネット接続なしで動作する | 有効な接続が必要 |
| モデルサイズ・能力 | 小型でタスクに特化したモデル | フロンティア級の汎用モデルも実行可能 |
| コスト構造 | ハードウェアの固定費、クエリごとの料金なし | 利用量ベースで、量に応じて増える |
| バッテリー・発熱への影響 | ローカルの電力を消費し、持続的な高負荷利用を制限する | ローカルの計算コストはないが、ネットワークに依存する |
| 最適な用途 | プライバシー重視、レイテンシ重視、オフラインでのタスク | 複雑な推論、大きなコンテキスト、最新の知識 |
どちらか一方が完全に優れているわけではありません。実運用されているAIシステムの大半、そして上に挙げたコンシューマー向けデバイスの大半は、ハイブリッドなアプローチを取っています。すなわち、日常的で明確に定義されたリクエストはオンデバイスで処理し、より高い能力、より広いコンテキスト、より新しい情報を必要とするものはクラウドに振り分けるという方法です。
ビジネスへの示唆
AI機能をどこで動かすかを検討する企業にとって、オンデバイスかクラウドかという判断は、本質的には「どちらが優れているか」という話ではありません。その特定のユースケースにとって最も重要な制約に、展開モデルを合わせるという話です。
ワークフローが医療記録、財務記録、人事情報といった規制対象や機密性の高いデータを扱う場合、オンデバイス処理は、他のプライバシー対策を適用するより前に、データ送信リスクという一つのカテゴリーを丸ごと取り除きます。ワークフローが、点検アプリ、配達ドライバー、遠隔地の拠点のように、通信が不安定な現場で機能する必要がある場合、オンデバイスが実際に機能する唯一の選択肢であることも少なくありません。そして、ある機能が非常に多くのユーザーによって大量に使われる場合、オンデバイス処理であれば、成功するほど膨らんでいくクエリごとのクラウド利用料を避けられます。
タスクが広範な推論、長いコンテキストウィンドウ、あるいは静的なオンデバイスモデルでは追いつけないほど頻繁に更新される知識を必要とする場合、このトレードオフは逆方向に働きます。契約書全体や長いサポートスレッドを分析できるほど大きなコンテキストウィンドウは、通常、スマートフォンチップ上で動く圧縮モデルではなく、クラウド規模の基盤モデルを依然として必要とします。
AI機能のスコープを検討するリーダーにとっての実務的な結論はこうです。まずレイテンシ、プライバシー、接続性の要件を定義し、そのうえで推論をどこで実行するかを決める。オンデバイスは、あらゆる場面でクラウドAIより安価な代替手段になるわけではなく、特定の、そして拡大しつつあるユースケース群にとっての正解であり、それ以外にとっては不正解になります。
関連するAIコンセプト
- エッジAI - 電話から産業用センサーまで、ローカルハードウェア上でAIを実行するより広いカテゴリー
- 推論 - クラウドかオンデバイスかを問わず、訓練済みモデルが実際に出力を生成する工程
- 小規模言語モデル - コンシューマー向けハードウェア上で動くよう特別に構築されたコンパクトなモデル
- 量子化 - モデルをオンデバイスに収まるサイズまで縮小する圧縮技術
- 知識蒸留 - より大きなモデルから、オンデバイス対応の小型モデルをどのように訓練するか
- モデル圧縮 - 量子化だけにとどまらない、モデルを縮小するためのより広範な技術群
- Large Language Models - 依然として一般的にクラウドインフラを必要とする、フロンティア級のモデル
- Neural Networks - NPUが高速化するために構築されている、基盤となるアーキテクチャ
外部リソース
- Deloitte 2026 TMT Predictions: More Compute for AI, Not Less - オンデバイスの成長にもかかわらず、AI推論の大半がなぜ依然としてデータセンターで行われているのか
- Stanford HAI AI Index Report 2025 - 小型で効率的なモデルによってもたらされた推論コスト低下に関するデータ
- Counterpoint Research: GenAI Smartphone Forecast - オンデバイスAI対応スマートフォンの出荷データと予測
オンデバイスAIに関するよくある質問
オンデバイスAIとは何ですか?
オンデバイスAIとは、リクエストをリモートサーバーに送信する代わりに、スマートフォンやノートPC、車といったローカルハードウェア上で直接動作する人工知能です。処理はNPUなどの内蔵チップを使って行われるため、インターネット接続がなくてもシステムは応答でき、データがデバイスの外に出ることはありません。
オンデバイスAIとエッジAIの違いは何ですか?
オンデバイスAIは、エッジAIの中の特定の一形態です。エッジAIは、集中型のクラウドデータセンターの外側でAIを実行することを指すより広いカテゴリーで、スマートフォン上のオンデバイス処理に加えて、ゲートウェイサーバー、工場設備、通信インフラなどを含みます。オンデバイスAIは特に、モデルがユーザーの目の前にある個人向け・コンシューマー向けハードウェア上で動作することを意味します。
オンデバイスAIを可能にしているハードウェアは何ですか?
鍵となる部品は、Neural Processing Unit(NPU)です。これは、Neural Networksが必要とする行列演算専用に構築されたチップです。現在のスマートフォンやノートPCのプロセッサはNPUをCPUやGPUと組み合わせて搭載しており、圧縮されたAIモデルを、汎用プロセッサのようにバッテリーを消耗させることなく効率的に動かせるようにしています。
オンデバイスAIはインターネット接続なしで動作しますか?
はい。それがオンデバイスAIを特徴づける利点の一つです。モデルと計算の両方がデバイス上に存在するため、オンデバイスAIの機能は、機内モードでも、電波の届かない場所でも、接続が不安定などこであっても動作し続けます。
オンデバイスAIはクラウドAIよりプライバシー面で優れていますか?
一般的には、はいと言えます。推論がローカルで行われるため、写真、音声メモ、メッセージといった入力データを、応答を得るために第三者のサーバーへ送信する必要がありません。これは、規制対象データや機密データにとって最も重要なポイントです。情報をデバイス上に留めておくことで、送信リスクというカテゴリー全体を取り除けるからです。
オンデバイスAIの主な限界は何ですか?
最も重要な制約は2つあります。モデルサイズとバッテリー寿命です。スマートフォンやノートPCは、データセンターのGPUクラスターよりもはるかに少ないメモリしか持たないため、オンデバイスモデルはフロンティア級のクラウドモデルより小さく、対応範囲も狭くなります。継続的なAI処理は電力を消費し熱も発生させるため、バッテリー駆動のデバイスが連続して処理できるローカル推論の量にも限界があります。
2026年時点でのオンデバイスAIの事例には何がありますか?
Apple Intelligenceは、モデルの多くをiPhone、iPad、Mac上で直接実行しています。GoogleのGemini NanoはPixelスマートフォン上でオンデバイス動作します。MicrosoftのCopilot+ PCは、AI機能をローカルで実行するために40 TOPS以上のNPUを要件としています。MetaのLlama 3.2 1Bおよび3Bモデルは、スマートフォンやノートPC上でのオンデバイス展開のために特別に構築されました。
企業はオンデバイスAIを構築すべきですか、それともクラウドAIを使うべきですか?
一律に決まるものではなく、ユースケース次第です。オンデバイスAIは、プライバシーに配慮が必要なワークフロー、オフラインや現場での利用、クエリごとのクラウド費用が積み上がってしまう大量利用の機能に適しています。クラウドAIは、広範な推論、大きなコンテキストウィンドウ、頻繁に変化する知識を必要とするタスクに適しています。ほとんどの実運用システムは両方を使い、単純なリクエストはローカルで処理し、複雑なリクエストはクラウドに振り分けています。
オンデバイスAIはクラウドAIを置き換えますか?
少なくとも近い将来では、その可能性は低いでしょう。Deloitteの2026年予測は、オンデバイスアクセラレーターが向上しても、AIコンピューティングの大半は依然としてデータセンターで実行され続けると見込んでいます。現在のNPUは、持続的で複雑な推論よりも、軽量で単発のタスクに適しているためです。オンデバイスとクラウドのAIは、一方が他方を置き換えるのではなく、ハイブリッドなモデルへと収束しつつあります。
