Was ist DeepSeek?

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Aktualisiert im Juli 2026
DeepSeek ist ein chinesisches KI-Forschungslabor, gegründet 2023 vom Hedgefonds-Manager Liang Wenfeng, bekannt für den Bau kostengünstiger, offener Large Language Models. Sein Reasoning-Modell DeepSeek-R1, veröffentlicht im Januar 2025, erreichte bei Mathematik- und Coding-Benchmarks das Niveau westlicher Spitzenmodelle, und das bei einem Bruchteil der angegebenen Trainingskosten, was eine weltweite Neubewertung der Ausgaben für KI-Infrastruktur auslöste.
Die meisten Menschen hörten in der Woche zum ersten Mal von DeepSeek, in der die App an die Spitze des Apple App Store schoss und Nvidia an einem einzigen Tag mehr Marktwert verlor als fast jedes andere Unternehmen in der Geschichte. Doch DeepSeek ist mehr als eine Schlagzeile: Es ist ein aktiver Modellentwickler, der bis 2026 laufend neue Releases veröffentlicht, eine Open-Weight-Alternative zu geschlossenen Laboren wie OpenAI und Anthropic, und ein lebendiges Fallbeispiel für die Fragen zu Datenschutz und Geopolitik, die mit der Nutzung von in China entwickelten KI-Tools einhergehen. Dieser Artikel behandelt, was DeepSeek ist, wie es dazu kam, das Modell-Portfolio, die Effizienzgeschichte dahinter und was Unternehmen vor der Einführung abwägen sollten.
Der "DeepSeek-Moment": Hintergrund und der Schock vom Januar 2025
DeepSeek wurde 2023 als Forschungsableger von High-Flyer gegründet, einem quantitativen Hedgefonds mit Sitz in Hangzhou, den Liang Wenfeng 2015 mitbegründet hatte. High-Flyer setzte bereits KI zur Steuerung seiner Handelsmodelle ein und verschaffte dem neuen Labor Zugang zu einem großen Bestand an Nvidia-GPUs, den es sich vor der Verschärfung der US-Exportkontrollen angeeignet hatte, Ressourcen, die es DeepSeek ermöglichten, konkurrenzfähige Modelle ohne die Multi-Milliarden-Dollar-Budgets seiner US-Rivalen zu trainieren.

Das Labor baute sich im Laufe von 2024 stetig auf, doch der Moment, der es zu einem bekannten Namen machte, kam am 20. Januar 2025, als DeepSeek R1 veröffentlichte, ein offenes Reasoning-Modell, das bei Mathematik-, Coding- und Wissenschafts-Benchmarks mit OpenAIs o1 gleichzog. Die DeepSeek-App, gestartet am 10. Januar, kletterte bis zum 27. Januar auf Platz eins im US-iOS-App-Store und überholte damit ChatGPT. Am selben Tag fiel die Nvidia-Aktie um fast 17% und vernichtete damit $589 Milliarden an Marktwert, der größte Ein-Tages-Verlust eines Unternehmens in der Geschichte des Aktienmarkts, da Investoren infrage stellten, ob die Branche tatsächlich so viel GPU-Ausgaben benötigte wie bisher angenommen.
Im Zentrum der Panik standen die Kosten. DeepSeeks eigener technischer Bericht zum zugrunde liegenden Basismodell V3 gab Trainingskosten von rund $5,6 Millionen an, ein Bruchteil dessen, was US-Labore Berichten zufolge für vergleichbare Spitzenmodelle ausgaben. Diese Zahl geriet fast sofort in die Kritik (mehr dazu weiter unten), doch das größere Signal blieb bestehen: Ein Labor, das unter US-Chip-Beschränkungen arbeitete, hatte ein Modell hervorgebracht, das mit den besten der Welt konkurrieren konnte, und gab die Gewichte kostenlos zum Download und zur Nutzung frei.
Das Modell-Portfolio von DeepSeek: Von V3 über R1 zu V4
DeepSeek veröffentlicht Modelle in einem schnellen, öffentlichen Release-Rhythmus statt eines einzelnen Flaggschiffprodukts.
DeepSeek-V3 (Dezember 2024) ist das Foundation Model, mit dem die Geschichte begann. Es nutzt eine Mixture-of-Experts-Architektur, die für jede einzelne Anfrage nur einen Bruchteil der Gesamtparameter aktiviert, was ein wesentlicher Grund dafür ist, warum es günstiger trainiert und betrieben wird als ein dichtes Modell ähnlicher Größe.
DeepSeek-R1 (Januar 2025) ist das Reasoning-Modell, das auf V3 aufbaut. Es nutzt erweiterte Chain-of-Thought-Berechnung, arbeitet sich also Schritt für Schritt durch ein Problem, bevor es antwortet, dieselbe Technikkategorie, die auch hinter Test-Time Compute steht. DeepSeek veröffentlichte außerdem eine Familie kleinerer, "destillierter" R1-Varianten, bei denen mittels Knowledge Distillation die Reasoning-Fähigkeit von R1 in Modelle komprimiert wird, die klein genug sind, um auf einer einzelnen GPU oder einem High-End-Laptop zu laufen.
DeepSeek-V3.2 (Dezember 2025) integrierte Tool-Nutzung direkt in den Denkprozess des Modells, sodass es ein Problem durchdenken und in demselben Durchgang externe Tools aufrufen kann. DeepSeek berichtete, dass es bei den Benchmark-Sets der Internationalen Mathematikolympiade 2025 und der Internationalen Olympiade in Informatik Ergebnisse auf Goldmedaillen-Niveau erzielte.
DeepSeek-V4 (Preview am 24. April 2026, mit einem stabilen Release im Juli 2026) ist die aktuelle Generation und erscheint in zwei Varianten: V4-Pro, ein großes Mixture-of-Experts-Modell, und V4-Flash, eine kleinere, schnellere Variante. Beide unterstützen ein Kontextfenster von 1 Million Token und erscheinen, wie jedes bisherige DeepSeek-Release, unter einer offenen Lizenz.
Die Geschichte von Effizienz und Kosten
DeepSeeks Ruf beruht darauf, mit weniger mehr zu erreichen, und die Zahlen, so umstritten sie auch sind, sind real genug, um von Bedeutung zu sein.

DeepSeeks eigener technischer Bericht zu V3 beziffert den gesamten Trainings-Compute auf 2,788 Millionen H800-GPU-Stunden, also rund $5,576 Millionen bei etwa $2 pro GPU-Stunde. Im September 2025 veröffentlichte DeepSeek in einem Peer-Review-Paper in Nature eine separate Zahl von $294.000, speziell für das zusätzliche Reasoning-Training von R1 auf Basis von V3. Unabhängige Analysten, darunter Forscher bei Epoch AI, argumentieren, dass die tatsächlichen Gesamtkosten (unter Einbeziehung des zugrunde liegenden V3-Basistrainings, der Hardware sowie der F&E-Gemeinkosten, die DeepSeeks Zahlen ausklammern) eher beim 20-Fachen der Schlagzeilenzahl liegen. Selbst bei dieser höheren Schätzung liegen DeepSeeks Trainingskosten immer noch deutlich unter dem, was OpenAI und Anthropic für vergleichbare Spitzenmodell-Trainingsläufe berichtet haben.
Der Kostenvorteil zeigt sich am deutlichsten in dem, was DeepSeek für die Nutzung seiner Modelle verlangt. Stand Mitte 2026 bepreist die DeepSeek-V4-Flash-API Output-Token mit $0,28 pro Million, verglichen mit $15 pro Million bei OpenAIs GPT-5.4 und Anthropics Claude Sonnet 4.6, eine rund 50-fache Differenz. Diese Preisgestaltung, nicht nur die ursprüngliche Schlagzeile zu den Trainingskosten, ist es, was DeepSeek für kostenbewusste Entwickler relevant hält, weit nachdem der Nachrichtenzyklus vom Januar 2025 abgeklungen ist.
Offene Gewichte und Lizenzierung
Anders als GPT und Claude sind DeepSeeks Modelle Open-Weight: Jeder kann die tatsächlichen trainierten Modelldateien herunterladen, auf der eigenen Infrastruktur betreiben, per Fine-Tuning anpassen und darauf aufbauend kommerzielle Produkte entwickeln, ohne DeepSeek eine Lizenzgebühr zu zahlen.
DeepSeek-R1 und die V-Serie-Modelle erscheinen unter der freizügigen MIT license, die kommerzielle Nutzung, Modifikation und Distillation in andere Modelle erlaubt und lediglich verlangt, dass der Lizenztext bei Weiterverbreitungen erhalten bleibt. Das ist eine deutlich offenere Haltung als das Label "offen", das manche Wettbewerber locker verwenden; DeepSeek erlaubt es einem Unternehmen tatsächlich, das Modell selbst zu hosten und niemals eine einzige Anfrage an DeepSeeks eigene Server zu senden.
Das hat praktisch zwei Auswirkungen. Erstens können kostensensible Teams eine destillierte R1-Variante lokal betreiben, statt überhaupt nutzungsbasierte API-Gebühren zu zahlen. Zweitens umgeht Self-Hosting die meisten der im nächsten Abschnitt behandelten Bedenken zur Datenverarbeitung, da nichts die eigene Infrastruktur des Unternehmens verlässt. Der Kompromiss besteht darin, dass Self-Hosting die GPU-Kapazität und die MLOps-Expertise erfordert, um das Modell zuverlässig zu betreiben, genau die Art von Infrastrukturarbeit, für deren Vermeidung die meisten Business-Teams OpenAI oder Anthropic bezahlen.
DeepSeek im Unternehmen einsetzen: Was Sie zuerst wissen sollten
DeepSeeks niedrige Kosten und offene Lizenzierung machen es für Engineering-Teams attraktiv, doch es bringt Einschränkungen mit sich, die ein typischer Anbieter geschlossener Modelle nicht hat.
Die gehostete DeepSeek-App und -API leiten Daten über in China ansässige Server, die dem chinesischen Daten- und nationalen Sicherheitsrecht unterliegen und nicht Rahmenwerken wie der GDPR oder dem CCPA, denen US- und EU-Anbieter unterliegen. Italiens Datenschutzbehörde ordnete im Januar 2025 eine sofortige Sperre der Verarbeitung von Daten italienischer Nutzer durch DeepSeek an, eine der ersten formellen behördlichen Maßnahmen gegen das Unternehmen, und weitere Regierungen und Unternehmen haben DeepSeek seither aus denselben Bedenken auf offiziellen Geräten eingeschränkt. Nichts davon ist unter chinesischen KI-Anbietern spezifisch für DeepSeek, aber es handelt sich um ein wesentlich anderes Risikoprofil als bei einem US-basierten Anbieter, und es gehört in jede KI-Anbieterbewertung, bevor ein Team es für irgendetwas einsetzt, das Kunden- oder Mitarbeiterdaten berührt.
Self-Hosting des Open-Weight-Modells, über einen inländischen Cloud-Anbieter oder On-Premises-Hardware, löst das Bedenken zur Datenweiterleitung weitgehend, da Anfragen DeepSeeks Infrastruktur überhaupt nie erreichen. Das ist die Option, für die sich die meisten Enterprise-Security-Teams entscheiden, wenn sie DeepSeeks Kosten- und Reasoning-Qualität wollen, ohne die Risiken des gehosteten Dienstes einzugehen. Die größere Frage, ob man Modellen vertrauen sollte, die unter der Jurisdiktion einer ausländischen Regierung gebaut und trainiert wurden, ist Teil der größeren Debatte, die unter souveräner KI erfasst wird, und es lohnt sich, dies zu lesen, bevor man einen Workflow auf DeepSeek standardisiert.
DeepSeek im Vergleich zu OpenAI und Claude
So schneidet DeepSeek im Vergleich zu den beiden Laboren ab, auf die sich die meisten unternehmerischen KI-Kaufentscheidungen standardmäßig stützen.
| DeepSeek | OpenAI | Anthropic (Claude) | |
|---|---|---|---|
| Gegründet | 2023, Hangzhou, China (Ausgründung des Hedgefonds High-Flyer) | 2015, San Francisco | 2021, San Francisco |
| Flaggschiffmodelle | V4-Pro, V4-Flash, R1 (Reasoning) | GPT-5.x-Serie | Claude (Opus-, Sonnet-, Haiku-Stufen) |
| Offene Gewichte | Ja, MIT license bei den R1- und V-Serien-Linien | Nein, geschlossene Gewichte | Nein, geschlossene Gewichte |
| Self-Hosting | Ja, Download und Betrieb auf eigener Infrastruktur | Nein, nur API oder ChatGPT | Nein, nur API oder Claude |
| Ungefähre Output-Preise (pro 1 Mio. Token) | $0,28 (V4-Flash) | $15 (GPT-5.4) | $15 (Sonnet 4.6) |
| Kontextfenster | Bis zu 1 Mio. Token (V4) | Variiert je nach Modellstufe | Variiert je nach Modellstufe |
| Datenverarbeitung | Gehostete App leitet Daten über China-basierte Server; Self-Hosting hält Daten lokal | US-basiert, Enterprise-Datenkontrollen (SOC 2, Admin-Konsolen) | US-basiert, starke Enterprise-Trust-and-Safety-Haltung |
| Bekannt für | Günstigste Open-Weight-Modelle auf Spitzenklasse-Niveau | Größte Verbraucherreichweite, schnellster Release-Rhythmus | Enterprise-Grade-Sicherheitsforschung und Zuverlässigkeit |
Das praktische Fazit: DeepSeek gewinnt beim reinen Preis pro Token und bietet die Option zum Self-Hosting, die OpenAI und Claude überhaupt nicht anbieten. OpenAI und Anthropic gewinnen bei Data Governance, Enterprise-Support und der Sicherheit, unter US-Jurisdiktion zu operieren, was für regulierte Branchen unabhängig von Benchmark-Werten oft der entscheidende Faktor ist.
Grenzen von DeepSeek
Über die oben behandelte Frage des Datenschutzes hinaus sind noch einige weitere Einschränkungen relevant. DeepSeeks Modelle wenden, wie die meisten in China trainierten Systeme, Inhaltsbeschränkungen bei politisch sensiblen Themen im Zusammenhang mit der chinesischen Regierung an, und Forscher haben dokumentiert, dass die gehostete Chat-App bestimmte Fragen, die geschlossene westliche Modelle direkt beantworten, verweigert oder umleitet. DeepSeek fehlt zudem die Enterprise-Support-Infrastruktur, die OpenAI und Anthropic aufgebaut haben, darunter formale SLAs, dedizierte Account-Teams und ausgereifte Compliance-Zertifizierungen, was für größere Organisationen mehr ins Gewicht fällt als für einzelne Entwickler. Und die ursprünglichen Trainingskosten-Zahlen, die DeepSeek berühmt gemacht haben, bleiben tatsächlich umstritten; behandeln Sie die Zahlen "$5,6 Millionen" und "$294.000" als DeepSeeks eigene offengelegte Angaben und nicht als unabhängig geprüfte Gesamtsumme.

Wichtige Fakten zu DeepSeek
- DeepSeeks Basismodell V3 kostete schätzungsweise $5,576 Millionen im Training, bei 2,788 Millionen H800-GPU-Stunden zu rund $2 pro GPU-Stunde, laut DeepSeeks eigenem technischem Bericht. Quelle
- DeepSeek legte separat Trainingskosten von $294.000 für R1 offen, in einem Peer-Review-Paper, das im September 2025 in Nature veröffentlicht wurde, wobei unabhängige Schätzungen die tatsächlichen Gesamt-Compute-Kosten eher beim 20-Fachen dieser Zahl ansetzen, sobald das Basistraining von V3 einbezogen wird. Quelle
- Nvidia verlor am 27. Januar 2025 $589 Milliarden an Marktwert, der größte Ein-Tages-Verlust eines Unternehmens in der Geschichte des Aktienmarkts, nachdem DeepSeeks Release Zweifel an den Ausgaben für KI-Infrastruktur geweckt hatte. Quelle
- Die DeepSeek-App wurde am 27. Januar 2025 zur meistgeladenen kostenlosen App im US-iOS-App-Store, und überholte ChatGPT innerhalb weniger Wochen nach ihrem Start am 10. Januar. Quelle
- Italiens Datenschutzbehörde ordnete am 30. Januar 2025 eine sofortige Sperre der Verarbeitung von Daten italienischer Nutzer durch DeepSeek an, eine der ersten formellen behördlichen Maßnahmen gegen das Unternehmen wegen des Umgangs mit Daten. Quelle
- DeepSeek-R1 erschien am 20. Januar 2025 unter der MIT license, die kommerzielle Nutzung, Modifikation und Distillation in andere Modelle ohne Lizenzgebühren erlaubt. Quelle
- DeepSeek-V4 startete am 24. April 2026 als Preview, wobei sowohl V4-Pro als auch V4-Flash unter derselben offenen Lizenz ein Kontextfenster von 1 Million Token unterstützen. Quelle
- DeepSeeks V4-Flash-API bepreist Output-Token mit $0,28 pro Million, gegenüber $15 pro Million bei OpenAIs GPT-5.4, eine rund 50-fache Differenz, die DeepSeeks Ruf als günstige Option begründet. Quelle
Häufig gestellte Fragen zu DeepSeek
Was ist DeepSeek AI einfach erklärt?
DeepSeek ist ein chinesisches KI-Labor, gegründet 2023, das offene Large Language Models baut, die Sie selbst herunterladen und betreiben können. Am bekanntesten ist es für R1, ein im Januar 2025 veröffentlichtes Reasoning-Modell, das bei Mathematik- und Coding-Benchmarks das Niveau führender westlicher Modelle erreichte, und das bei deutlich niedrigeren angegebenen Trainingskosten.
Ist DeepSeek kostenlos nutzbar?
Die DeepSeek-Chat-App und ein begrenztes API-Kontingent sind kostenlos. Intensivere API-Nutzung wird pro Token berechnet, wobei DeepSeeks Preisgestaltung (rund $0,28 pro Million Output-Token bei V4-Flash) weit günstiger ist als vergleichbare Modelle von OpenAI oder Anthropic. Die Open-Weight-Modelle selbst können zudem kostenlos heruntergeladen und unter der MIT license selbst gehostet werden.
Wem gehört DeepSeek?
DeepSeek wurde von Liang Wenfeng gegründet, der 2015 auch den chinesischen quantitativen Hedgefonds High-Flyer mitbegründete. High-Flyer finanzierte DeepSeeks frühe GPU-Infrastruktur und bleibt eng mit dem Labor verbunden, obwohl DeepSeek als eigenständige Forschungs- und Produktorganisation operiert.
Warum verursachte DeepSeek den Kurssturz der Nvidia-Aktie?
DeepSeeks Veröffentlichung von R1 im Januar 2025 weckte zusammen mit den offengelegten niedrigen Trainingskosten bei Investoren Zweifel daran, ob die KI-Branche tatsächlich so viel GPU-Ausgaben benötigte wie bisher angenommen. Nvidia verlor am 27. Januar 2025 $589 Milliarden an Marktwert, der größte Ein-Tages-Verlust eines Unternehmens in der Geschichte des Aktienmarkts.
Ist DeepSeek Open Source?
DeepSeeks Modellgewichte sind unter der MIT license offen, das heißt, jeder kann sie herunterladen, ausführen, modifizieren und kommerziell einsetzen. Das unterscheidet sich von vollständigem Open Source im traditionellen Software-Sinn, da DeepSeek weder die Trainingsdaten noch den vollständigen Trainingscode veröffentlicht hat, sondern nur die resultierenden Modellgewichte und den Inferenz-Code.
Ist es für Unternehmen sicher, DeepSeek zu nutzen?
Das hängt von der Bereitstellung ab. Die gehostete DeepSeek-App und -API leiten Daten über China-basierte Server, die chinesischem Recht unterliegen, was Regulierungsbehörden wie Italiens Datenschutzbehörde dazu veranlasst hat, sie einzuschränken, und einige Regierungen dazu, sie auf offiziellen Geräten zu verbieten. Self-Hosting des Open-Weight-Modells auf der eigenen Infrastruktur vermeidet dieses spezifische Risiko, da keine Daten die eigenen Systeme verlassen.
Wie schneidet DeepSeek im Vergleich zu ChatGPT und Claude ab?
DeepSeek ist pro Token drastisch günstiger und erlaubt es Ihnen, anders als bei ChatGPT oder Claude, das Modell herunterzuladen und selbst zu hosten. OpenAI und Anthropic bieten ausgereifteren Enterprise-Support, US-basierte Datenverarbeitung und Compliance-Zertifizierungen, was für regulierte Branchen mehr zählt als reine Benchmark-Werte oder der Preis.
Wofür wird DeepSeek-R1 eingesetzt?
R1 ist ein Reasoning-Modell, das für mehrstufige Probleme wie Coding, mathematische Analysen und komplexe Logikaufgaben geeignet ist, ähnlich wie OpenAIs o1 oder Claudes Extended-Thinking-Modus. Seine destillierten Varianten sind zudem beliebt, um leistungsfähige KI lokal auf bescheidener Hardware zu betreiben, da sie überhaupt keinen Aufruf einer externen API benötigen.
Mehr erfahren
- Large Language Models - Die zugrunde liegende Technologie hinter DeepSeeks V-Serie und jedem anderen großen Chat-Assistenten
- Reasoning-Modelle - Die technische Kategorie, zu der R1 gehört, und wie sie sich zu OpenAIs o1 verhält
- Was ist Test-Time Compute? - Die Extended-Thinking-Technik hinter R1s Reasoning-Fähigkeit
- Mixture of Experts - Die Architektur hinter der Effizienz von DeepSeek-V3 und V4
- Knowledge Distillation - Wie DeepSeek R1 in kleinere, lokal lauffähige Modelle komprimierte
- Was ist OpenAI? - Das Labor hinter ChatGPT und GPT, DeepSeeks direktester Vergleichspunkt
- Was ist Claude AI? - Anthropics Modellfamilie und die auf Unternehmen ausgerichtete Alternative
- KI-Anbieterbewertung - Das Framework zum Abwägen von Kosten gegen Data-Governance-Risiken vor der Einführung eines Modells wie DeepSeek
- Was ist souveräne KI? - Die größere Debatte über KI-Modelle, die unter verschiedenen nationalen Jurisdiktionen gebaut und geregelt werden
Externe Ressourcen
- DeepSeek-V3 Technical Report (arXiv) - DeepSeeks eigene Offenlegung von V3s Trainings-Compute und -Kosten
- CNN: DeepSeek Reveals Training Cost of Its AI Model - Berichterstattung über das in Nature veröffentlichte Paper zu den $294.000 Trainingskosten von R1
- CNBC: Nvidia Sheds Almost $600 Billion in Market Cap - Berichterstattung über den Kurssturz vom 27. Januar 2025
- Bird & Bird: Italy's Garante Blocks DeepSeek Data Processing - Rechtliche Zusammenfassung der italienischen Anordnung vom Januar 2025
- Hugging Face: DeepSeek-R1 Model Card - Offizielle Modellgewichte und Bedingungen der MIT license
- DeepSeek API Docs: V4 Preview Release - Offizielle Ankündigung von DeepSeek-V4-Pro und V4-Flash
- DeepSeek API Docs: Pricing - Aktuelle Preise pro Token für DeepSeeks gehostete Modelle
Teil der KI-Begriffe-Sammlung. Zuletzt aktualisiert: 2026-07-20

Co-Founder, Rework.com
On this page
- Der "DeepSeek-Moment": Hintergrund und der Schock vom Januar 2025
- Das Modell-Portfolio von DeepSeek: Von V3 über R1 zu V4
- Die Geschichte von Effizienz und Kosten
- Offene Gewichte und Lizenzierung
- DeepSeek im Unternehmen einsetzen: Was Sie zuerst wissen sollten
- DeepSeek im Vergleich zu OpenAI und Claude
- Grenzen von DeepSeek
- Wichtige Fakten zu DeepSeek
- Mehr erfahren
- Externe Ressourcen