Was ist On-Device AI?

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Aktualisiert: Juli 2026
On-Device AI ist künstliche Intelligenz, die direkt auf lokaler Hardware läuft, einem Smartphone, Laptop oder eingebetteten Chip, statt Anfragen an einen entfernten Server zu senden. Die Berechnung des Modells findet auf dem Gerät selbst statt, über integrierte Chips wie NPUs, sodass das System ohne Internetverbindung antworten kann und die Daten die Hardware, auf der sie entstanden sind, nie verlassen müssen.
Diese eine Design-Entscheidung, die Berechnung lokal zu halten statt sie an ein Rechenzentrum weiterzuleiten, verändert die Wirtschaftlichkeit, das Datenschutzprofil und die Fehlermodi einer KI-Funktion. Sie ist auch der Grund, warum Ihr Smartphone heute eine Sprachnotiz transkribieren, einen Textverlauf zusammenfassen oder eine E-Mail umschreiben kann, während es im Flugmodus liegt.
Wie On-Device AI tatsächlich lokal läuft
Ein großes Modell auf einem Smartphone laufen zu lassen war früher schlicht ausgeschlossen. Ein Modell im Frontier-Maßstab, ein Large Language Model, kann Hunderte Milliarden Parameter haben und braucht Rechenzentrums-GPUs, nur um eine einzige Anfrage zu beantworten. Verbraucher-Hardware hat nur einen Bruchteil dieses Speicher- und Leistungsbudgets. Drei Entwicklungen haben die Lücke geschlossen.

Neural Processing Units (NPUs). Moderne Smartphone- und Laptop-Chips kommen inzwischen mit einem dedizierten KI-Beschleuniger neben CPU und GPU. Eine NPU ist eigens für die Matrixberechnungen gebaut, die Neural Networks ständig ausführen, und erledigt diese Berechnungen weit effizienter, sowohl bei der Geschwindigkeit als auch beim Batterieverbrauch, als es ein Allzweckprozessor könnte. Qualcomms Snapdragon 8 Elite Gen 5, gebaut für die Smartphone-Generation 2026, kommt mit einer Hexagon-NPU, die laut Qualcomm 37 Prozent schneller läuft als die der Vorgängergeneration, gezielt damit größere Modelle lokal laufen können, ohne den Akku zu leeren.
Quantisierung. Selbst mit einem dedizierten Chip ist ein Modell in voller Präzision meist zu groß für den Speicher eines Smartphones. Quantisierung verkleinert ein Modell, indem sie die numerische Präzision seiner Gewichte reduziert, oft von 32-Bit auf 8-Bit oder 4-Bit, was den Speicherbedarf um das 4- bis 8-Fache senkt, bei nur geringem Genauigkeitsverlust. Das ist der Schritt, der aus einem für ein Server-Rack gebauten Modell eines macht, das auf ein Smartphone passt.
Small Language Models (SLMs). Neben der Kompression trainieren Modellentwickler Modelle, die von Anfang an klein sind. Small Language Models, typischerweise im Bereich von 1 bis 10 Milliarden Parametern, sind so ausgelegt, dass sie für eine definierte Menge an Aufgaben leistungsfähig genug sind (Zusammenfassen, Umschreiben, Klassifizieren, Beantworten von Fragen zu Bildschirminhalten), aber leicht genug bleiben, um auf der NPU eines Smartphones zu laufen. Knowledge Distillation, bei der ein kleines "Schüler"-Modell lernt, ein größeres "Lehrer"-Modell nachzuahmen, ist eine der wichtigsten Techniken, mit denen sie gebaut werden.
Zusammengenommen ermöglichen diese drei Bausteine, dass ein Smartphone oder Laptop Inferenz, den Schritt, in dem ein trainiertes Modell tatsächlich eine Antwort erzeugt, vollständig auf lokalem Silizium ausführt, ohne dass jemals Daten über das Netzwerk verschickt werden.
Warum Unternehmen und Nutzer es wollen: Datenschutz, Latenz, Offline, Kosten
Datenschutz. Wenn Inferenz auf dem Gerät läuft, muss die Eingabe es nie verlassen. Eine Sprachnotiz, ein Foto, ein E-Mail-Entwurf oder eine Patientennotiz können verarbeitet werden, ohne diesen Inhalt an einen Server eines Drittanbieters zu übertragen. Für regulierte Branchen oder jeden Workflow, der sensible Daten berührt, ist das oft der entscheidende Faktor, wichtiger als die eigentliche Modellqualität.

Latenz. Eine Cloud-Anfrage muss erst zu einem Rechenzentrum und zurück reisen, noch bevor das Modell überhaupt zu rechnen beginnt. On-Device-Inferenz überspringt diesen Umweg vollständig, weshalb sich lokale Funktionen (Autovervollständigung, Live-Transkription, Zusammenfassung von Bildschirminhalten) sofort anfühlen, während über die Cloud geleitete Funktionen eine spürbare Verzögerung haben.
Offline-Betrieb. Ein lokal laufendes Modell funktioniert ohne Signal, im Flugzeug, im Keller, auf einer Fabrikhalle oder in einer ländlichen Gegend mit unzuverlässiger Verbindung. Alles, was von einem Live-API-Aufruf abhängt, funktioniert nicht mehr, sobald die Verbindung abbricht.
Kosten. Cloud-Inferenz wird pro Token oder pro Aufruf abgerechnet und skaliert direkt mit der Nutzung; eine Funktion, die beliebt wird, wird teuer. On-Device-Inferenz läuft auf Hardware, die der Nutzer oder das Unternehmen bereits besitzt, sodass es keine Grenzkosten pro Anfrage gibt, sobald das Modell auf dem Gerät ist.
Die tatsächlichen Grenzen: Modellgröße und Akku
On-Device AI ist kein kostenloses Upgrade gegenüber Cloud AI, und so zu tun, als wäre es das, weckt intern falsche Erwartungen. Zwei Einschränkungen bestimmen, was heute tatsächlich möglich ist.

Die Modellgröße begrenzt die Leistungsfähigkeit. Der Speicher von Smartphones und Laptops liegt im einstelligen oder niedrigen zweistelligen Gigabyte-Bereich, nicht bei den Hunderten Gigabyte, auf die ein GPU-Cluster im Rechenzentrum zugreifen kann. Diese Obergrenze bedeutet, dass On-Device-Modelle zwangsläufig kleiner und weniger breit leistungsfähig sind als Frontier-Cloud-Modelle. Sie sind stark bei eng umrissenen, klar definierten Aufgaben und schwächer bei offenem Reasoning, langen Dokumenten oder allem, was sehr aktuelles Wissen erfordert.
Akku- und Wärmegrenzen. Selbst mit einer effizienten NPU verbraucht anhaltende KI-Inferenz Strom und erzeugt Wärme, beides knappe Ressourcen bei einem akkubetriebenen Gerät. Das ist eine echte Grenze dafür, wie viel On-Device-Verarbeitung ein Gerät dauerhaft leisten kann, ohne den Akku sichtbar zu leeren oder die Leistung zu drosseln, weshalb Smartphone-Hersteller schwerere Anfragen teilweise in die Cloud leiten, statt alles durch den lokalen Chip zu zwingen.
Deloittes eigene Prognose für 2026 bringt diese Spannung direkt auf den Punkt: Trotz des Wachstums integrierter KI-Beschleuniger in Smartphones und PCs sagt Deloitte voraus, dass fast das gesamte KI-Computing 2026 weiterhin in großen Rechenzentren oder auf High-End-Enterprise-Servern stattfinden wird statt on-device, weil heutige NPUs nur für leichtere, einmalige Inferenzaufgaben wie das Zusammenfassen einer kurzen E-Mail stark genug sind, nicht für anhaltendes, komplexes Reasoning.
Das ist die praktische Realität von On-Device AI heute: real und schnell wachsend, aber eine Ergänzung zu Cloud AI statt ein vollständiger Ersatz dafür.
Wichtige Fakten
- GenAI-fähige Smartphones, Geräte, die KI-Modelle on-device ausführen, sollen laut Counterpoint Research 2026 einen Anteil von 45 Prozent an den weltweiten Smartphone-Auslieferungen erreichen, gegenüber 36 Prozent im Jahr 2025.
- Die kumulierten weltweiten Auslieferungen GenAI-fähiger Smartphones überschritten laut Counterpoint Research bis zum dritten Quartal 2025 die Marke von 500 Millionen Einheiten.
- Der Anteil der Smartphones mit generativer KI-Fähigkeit könnte laut Deloittes TMT-Prognosen 2025 bis Ende 2025 über 30 Prozent liegen, und fast die Hälfte aller 2025 verkauften PCs wird über lokale Verarbeitungskapazität für generative KI verfügen.
- AI-PCs sollten laut Gartner bis Ende 2025 einen Anteil von 31 Prozent am weltweiten PC-Markt erreichen.
- Trotz der Zunahme von On-Device-KI-Beschleunigern sagen Deloittes TMT-Prognosen für 2026 voraus, dass fast das gesamte KI-Computing 2026 weiterhin in Rechenzentren oder auf High-End-Enterprise-Servern laufen wird statt auf PCs und Smartphones, da heutige NPUs für leichtere, einmalige Inferenz statt anhaltende, schwere Workloads gebaut sind.
- Die Kosten für Inferenz auf GPT-3.5-Leistungsniveau fielen laut dem Stanford AI Index Report 2025 zwischen November 2022 und Oktober 2024 von 20,00 \(auf 0,07\) pro Million Token, ein mehr als 280-facher Rückgang, der maßgeblich durch effiziente kleine Modelle getrieben wurde.
- Qualcomms Snapdragon 8 Elite Gen 5, gebaut für die Smartphone-Generation 2026, kommt mit einer Hexagon-NPU, die laut Qualcomm 37 Prozent schneller läuft als ihr Vorgänger, gezielt um größere Modelle lokal auszuführen.
On-Device AI 2026: Konkrete Beispiele
On-Device AI hat sich von einer Forschungsdemo zu einer Standardfunktion auf den großen Verbraucherplattformen entwickelt.
Apple Intelligence. Apple hat sein KI-System standardmäßig um On-Device-Verarbeitung herum aufgebaut. Viele der Modelle hinter Apple Intelligence laufen vollständig auf dem iPhone, iPad oder Mac; braucht eine Anfrage ein größeres Modell, als auf das Gerät passt, wird sie an Apples Private Cloud Compute weitergeleitet, die laut Apple auf dedizierten Apple-Silicon-Servern mit demselben Sicherheitsmodell wie das Gerät selbst läuft, statt auf einer Allzweck-Cloud.
Gemini Nano. Googles Gemini Nano ist eine kompakte Version seiner Gemini-Modellfamilie, gezielt dafür gebaut, über Androids AICore-System on-device auf Pixel-Smartphones zu laufen, und treibt Funktionen wie On-Device-Zusammenfassung und intelligente Antwortvorschläge ohne Netzwerkaufruf an.
Copilot+ PCs. Microsofts Copilot+-PC-Kategorie, 2024 eingeführt und inzwischen eine Mainstream-Stufe bei Windows-Laptops, erfordert eine NPU mit mindestens 40 Billionen Operationen pro Sekunde (TOPS), damit das Gerät On-Device-KI-Funktionen wie Live-Untertitelung und Bildgenerierung lokal statt über die Cloud ausführen kann.
Llama on-device. Meta hat seine Llama-3.2-1B- und -3B-Modelle gezielt für Edge- und On-Device-Einsatz gebaut, klein genug, um über Partner wie Qualcomm und MediaTek auf Smartphones und Laptops zu laufen, gedacht für Entwickler, die lokale Zusammenfassung, Umschreibung oder Tool-Calling ohne Umweg über einen Server wollen.
On-Device AI vs. Cloud AI
| Faktor | On-Device AI | Cloud AI |
|---|---|---|
| Wo es läuft | Lokal, auf dem Smartphone, Laptop oder Gerätechip | Entfernte Server, erreichbar über das Internet |
| Datenschutz | Daten bleiben standardmäßig auf dem Gerät | Daten werden an einen Server eines Drittanbieters übertragen |
| Latenz | Nahezu sofort, kein Netzwerk-Umweg | Fügt bei jedem Aufruf Netzwerk- und Warteschlangenzeit hinzu |
| Offline-Fähigkeit | Funktioniert ohne Internetverbindung | Benötigt eine aktive Verbindung |
| Modellgröße/-fähigkeit | Kleinere, aufgabenfokussierte Modelle | Kann Modelle im Frontier-Maßstab für den Allzweckeinsatz ausführen |
| Kostenstruktur | Fixkosten der Hardware, keine Gebühr pro Anfrage | Nutzungsbasiert, skaliert mit dem Volumen |
| Auswirkung auf Akku/Wärme | Verbraucht lokal Strom, begrenzt anhaltend intensive Nutzung | Keine lokalen Rechenkosten, aber abhängig vom Netzwerk |
| Am besten geeignet für | Datenschutzsensible, latenzsensible, Offline-Aufgaben | Komplexes Reasoning, großen Kontext, aktuelles Wissen |
Keine der beiden Spalten gewinnt eindeutig. Die meisten produktiven KI-Systeme, und die meisten der oben genannten Verbrauchergeräte, nutzen einen hybriden Ansatz: Routine-Anfragen mit klarer Definition werden on-device erledigt, alles, was mehr Leistungsfähigkeit, mehr Kontext oder aktuellere Informationen braucht, wird in die Cloud geleitet.
Auswirkungen für Unternehmen
Für ein Unternehmen, das bewertet, wo eine KI-Funktion laufen soll, geht es bei der Entscheidung zwischen on-device und Cloud nicht wirklich darum, was "besser" ist. Es geht darum, das Bereitstellungsmodell an die Einschränkung anzupassen, die für diesen konkreten Anwendungsfall am wichtigsten ist.
Berührt der Workflow regulierte oder sensible Daten, Gesundheitsnotizen, Finanzdaten, HR-Informationen, entfernt On-Device-Verarbeitung eine ganze Kategorie von Übertragungsrisiko, noch bevor irgendeine andere Datenschutzkontrolle greift. Muss der Workflow im Feld mit unzuverlässiger Verbindung funktionieren, Inspektions-Apps, Zusteller, entlegene Standorte, ist on-device oft die einzige Option, die tatsächlich funktioniert. Und wird eine Funktion von einer großen Nutzerbasis sehr häufig genutzt, vermeidet On-Device-Verarbeitung eine Cloud-Rechnung pro Anfrage, die mit dem Erfolg mitwächst.
Der Kompromiss kehrt sich um, wenn eine Aufgabe breites Reasoning, ein langes Kontextfenster oder Wissen braucht, das sich so oft ändert, dass ein statisches On-Device-Modell nicht mithalten kann. Ein Context Window, das groß genug ist, um einen vollständigen Vertrag oder einen langen Support-Thread zu analysieren, braucht in der Regel weiterhin ein Foundation Model im Cloud-Maßstab, kein komprimiertes Modell auf einem Smartphone-Chip.
Die praktische Erkenntnis für eine Führungskraft, die eine KI-Funktion plant: zuerst die Anforderungen an Latenz, Datenschutz und Konnektivität definieren, dann entscheiden, wo die Inferenz laufen soll. On-Device ist kein pauschal günstigerer Ersatz für Cloud AI; es ist die richtige Antwort für eine bestimmte, wachsende Gruppe von Anwendungsfällen und die falsche für andere.
Verwandte KI-Konzepte
- Edge AI - Die übergeordnete Kategorie für KI auf lokaler Hardware, von Smartphones bis zu Industriesensoren
- Inferenz - Der Schritt, in dem ein trainiertes Modell tatsächlich eine Ausgabe erzeugt, ob in der Cloud oder on-device
- Small Language Models - Die kompakten Modelle, die gezielt für den Betrieb auf Verbraucher-Hardware gebaut sind
- Quantisierung - Die Kompressionstechnik, die Modelle verkleinert, damit sie on-device passen
- Knowledge Distillation - Wie kleine, on-device-taugliche Modelle aus größeren trainiert werden
- Model Compression - Die größere Gruppe von Techniken, um Modelle über reine Quantisierung hinaus zu verkleinern
- Large Language Models - Die Modelle im Frontier-Maßstab, die typischerweise weiterhin Cloud-Infrastruktur brauchen
- Neural Networks - Die zugrunde liegende Architektur, die NPUs beschleunigen sollen
Externe Ressourcen
- Deloitte 2026 TMT Predictions: More Compute for AI, Not Less - Warum die meiste KI-Inferenz trotz des On-Device-Wachstums weiterhin in Rechenzentren läuft
- Stanford HAI AI Index Report 2025 - Daten zum Rückgang der Inferenzkosten, getrieben durch kleine, effiziente Modelle
- Counterpoint Research: GenAI Smartphone Forecast - Auslieferungsdaten und Prognosen für On-Device-KI-fähige Smartphones
Häufig gestellte Fragen zu On-Device AI
Was ist On-Device AI?
On-Device AI ist künstliche Intelligenz, die direkt auf lokaler Hardware läuft, etwa einem Smartphone, Laptop oder Auto, statt Anfragen an einen entfernten Server zu senden. Die Verarbeitung erfolgt über integrierte Chips wie NPUs, sodass das System ohne Internetverbindung antworten kann und die Daten das Gerät nie verlassen.
Was ist der Unterschied zwischen On-Device AI und Edge AI?
On-Device AI ist eine bestimmte Ausprägung von Edge AI. Edge AI ist die übergeordnete Kategorie für KI, die überall außerhalb eines zentralisierten Cloud-Rechenzentrums läuft, was sowohl On-Device-Verarbeitung auf einem Smartphone als auch Gateway-Server, Fabrikanlagen und Telekommunikationsinfrastruktur umfasst. On-Device AI bedeutet konkret, dass das Modell auf der persönlichen oder Verbraucher-Hardware direkt vor dem Nutzer läuft.
Welche Hardware macht On-Device AI möglich?
Die Schlüsselkomponente ist eine Neural Processing Unit (NPU), ein Chip, der eigens für die Matrixberechnungen gebaut ist, die neuronale Netze benötigen. Moderne Smartphone- und Laptop-Prozessoren kombinieren eine NPU mit CPU und GPU, sodass komprimierte KI-Modelle effizient laufen können, ohne den Akku so zu belasten, wie es ein Allzweckprozessor tun würde.
Funktioniert On-Device AI ohne Internetverbindung?
Ja, das ist einer ihrer wichtigsten Vorteile. Da Modell und Berechnung beide auf dem Gerät liegen, funktionieren On-Device-KI-Funktionen weiterhin im Flugmodus, in Bereichen ohne Signal oder überall dort, wo die Verbindung unzuverlässig ist.
Ist On-Device AI datenschutzfreundlicher als Cloud AI?
Im Allgemeinen ja. Da die Inferenz lokal erfolgt, muss die Eingabe, etwa ein Foto, eine Sprachnotiz oder eine Nachricht, nicht an einen Server eines Drittanbieters übertragen werden, um eine Antwort zu erhalten. Das ist besonders bei regulierten oder sensiblen Daten wichtig, wo das Belassen von Informationen auf dem Gerät eine ganze Kategorie von Übertragungsrisiko entfernt.
Was sind die wichtigsten Grenzen von On-Device AI?
Zwei Einschränkungen sind am wichtigsten: Modellgröße und Akkulaufzeit. Smartphones und Laptops haben weit weniger Speicher als GPU-Cluster in Rechenzentren, sodass On-Device-Modelle kleiner und weniger breit leistungsfähig sind als Frontier-Cloud-Modelle. Anhaltende KI-Verarbeitung verbraucht zudem Strom und erzeugt Wärme, was begrenzt, wie viel lokale Inferenz ein akkubetriebenes Gerät dauerhaft leisten kann.
Was sind Beispiele für On-Device AI im Jahr 2026?
Apple Intelligence führt viele seiner Modelle direkt auf iPhone, iPad und Mac aus. Googles Gemini Nano läuft on-device auf Pixel-Smartphones. Microsofts Copilot+-PCs erfordern eine NPU mit mindestens 40 TOPS, gezielt um KI-Funktionen lokal auszuführen. Metas Llama-3.2-1B- und -3B-Modelle wurden gezielt für den On-Device-Einsatz auf Smartphones und Laptops gebaut.
Sollte ein Unternehmen On-Device AI bauen oder Cloud AI nutzen?
Das hängt vom Anwendungsfall ab, nicht von einer pauschalen Präferenz. On-Device AI eignet sich für datenschutzsensible Workflows, Offline- oder Feldeinsatz und stark genutzte Funktionen, bei denen sich Cloud-Kosten pro Anfrage summieren würden. Cloud AI eignet sich für Aufgaben, die breites Reasoning, große Kontextfenster oder sich häufig änderndes Wissen brauchen. Die meisten produktiven Systeme nutzen beides und leiten einfache Anfragen lokal, komplexe in die Cloud.
Wird On-Device AI Cloud AI ersetzen?
Eher unwahrscheinlich, zumindest kurzfristig. Deloittes Prognose für 2026 geht davon aus, dass das meiste KI-Computing weiterhin in Rechenzentren laufen wird, auch wenn sich On-Device-Beschleuniger verbessern, weil heutige NPUs eher für leichtere, einmalige Aufgaben geeignet sind als für anhaltendes, komplexes Reasoning. On-Device und Cloud AI wachsen zu einem hybriden Modell zusammen, nicht zu einer Ablösung des einen durch das andere.

Co-Founder, Rework.com
On this page
- Wie On-Device AI tatsächlich lokal läuft
- Warum Unternehmen und Nutzer es wollen: Datenschutz, Latenz, Offline, Kosten
- Die tatsächlichen Grenzen: Modellgröße und Akku
- Wichtige Fakten
- On-Device AI 2026: Konkrete Beispiele
- On-Device AI vs. Cloud AI
- Auswirkungen für Unternehmen
- Verwandte KI-Konzepte
- Externe Ressourcen