DeepSeek oder ChatGPT: Welches Modell löst deutsche Alltagsaufgaben besser? Wir haben DeepSeek-V4.1-Flash und DeepSeek-V4-Pro (beide mit Thinking-Modus) gegen OpenAIs GPT-5.6 Sol antreten lassen, mit fünf identischen Aufgaben: Rechenfalle, Geschäfts-E-Mail, Python-Funktion, Faktenfrage mit Datumsbezug und Zusammenfassung. Sie bekommen die echten Antworten (gekürzt), eine nachvollziehbare Bewertung, gemessene Antwortzeiten und den Rahmenvergleich: offene Gewichte, Serverstandort, Bilder, Kontextfenster, Apps. Claude und Gemini ordnen wir kurz ein, ohne eigene Tests.
Inhalt
Kurzfassung
- Alle drei Modelle lösten die fünf deutschen Aufgaben inhaltlich korrekt; die Sprachqualität ist gleichwertig.
- Der einzige sachliche Fehler: V4-Pro lässt im Python-Test Umlaute in einer IBAN durch (
isalnum()ohne ASCII-Prüfung). - Alle drei nannten „Juni 2024″ als Wissensstand; OpenAI dokumentiert für GPT-5.6 Sol den 16. Februar 2026. Selbstauskünfte zum Wissensstand sind unbrauchbar.
- V4.1-Flash war bei drei von fünf Aufgaben am schnellsten, denkt bei offenen Fragen aber lang (einmal fast 5.000 Token); dann lag GPT-5.6 Sol vorn. V4-Pro war nirgends besser, überall langsamer.
- Die echten Unterschiede liegen im Rahmen: DeepSeek ist offen (MIT-Lizenz), verarbeitet aber in China; ChatGPT ist geschlossen, erzeugt Bilder und bietet Geschäftskunden EU-Datenhaltung.
Testaufbau: Modelle, Modus, Bewertung
Getestet am 17. September 2026 über die Schnittstellen der Anbieter, ohne Systemprompt, jede Aufgabe einmal pro Modell:
| Modell | Stand | Modus im Test | Ausprobieren |
|---|---|---|---|
DeepSeek-V4.1-Flash (deepseek-flash) |
veröffentlicht 10.09.2026 | Thinking an, Effort „high“ (Standard) | Chat auf der Startseite (dort ohne Thinking, Antworten kommen sofort) |
DeepSeek-V4-Pro (deepseek-v4-pro) |
allgemein verfügbar seit 13.08.2026 | Thinking an, Effort „high“ (Standard) | Chat mit V4-Pro |
| GPT-5.6 Sol | Flaggschiff der GPT-5.6-Familie | Responses API, Reasoning-Effort „low“ | ChatGPT, OpenAI-API |
Bewertet wurden Richtigkeit, Einhaltung der Vorgaben (Ton, Länge, Format), Antwortzeit und Ausgabe-Token inklusive Nachdenken. Einschränkung: Der Reasoning-Effort ist nicht identisch („low“ bei GPT-5.6 Sol, Standard „high“ bei DeepSeek); das begünstigt OpenAI beim Tempo, DeepSeek bei schwierigen Aufgaben. Hintergrund: DeepSeek V4: die neue Modellgeneration.
Stolperstein beim Thinking-Modus: Im ersten Durchlauf lag das Ausgabelimit bei 1.500 Token. Bei drei Aufgaben verbrauchten V4.1-Flash und V4-Pro es komplett fürs Nachdenken und lieferten eine leere Antwort, denn die DeepSeek-API zählt reasoning_content zu den Ausgabe-Token. Setzen Sie max_tokens im Thinking-Modus großzügig. Wir haben diese sechs Aufrufe mit 8.000 Token wiederholt; die Zitate stammen aus der Wiederholung.
Die fünf Aufgaben mit echten Antworten
Aufgabe 1: Rechenaufgabe mit Falle
Prompt: „Eine Bäckerei verkauft Brötchen für 0,45 € pro Stück. Ab 10 Stück gibt es 10 % Rabatt auf den gesamten Einkauf. Frau Meier kauft 9 Brötchen, Herr Schulz kauft 10 Brötchen. Wer zahlt weniger, und wie groß ist der Unterschied in Cent? Antworte kurz mit Rechenweg.“ Die Falle: Beide zahlen 4,05 €.
V4-Pro, Thinking an: „Frau Meier: 9 × 0,45 € = 4,05 € = 405 Cent / Herr Schulz: 10 × 0,45 € = 4,50 € − 10 % Rabatt = 4,05 € = 405 Cent / Beide zahlen gleich viel. Unterschied: 0 Cent.“
Bewertung: Alle drei richtig und knapp; V4.1-Flash („Beide zahlen 4,05 €. Der Unterschied ist 0 Cent.“) und GPT-5.6 Sol rechneten identisch, formatierten aber als LaTeX, was in reinem Text stört. V4-Pro schrieb schlichten Text und rechnete wie gefragt in Cent um. Zeiten: V4.1-Flash 1,3 Sekunden, GPT-5.6 Sol 5,2, V4-Pro 5,3.
Aufgabe 2: Geschäfts-E-Mail mit Tonvorgabe
Prompt (gekürzt): Zweite Zahlungserinnerung mit Betreff, Absender Müller Bürotechnik GmbH, Empfänger Herr Krause, Rechnung Nr. 2026-0417 über 1.240,00 €, fällig seit 15. August 2026, erste Erinnerung vom 1. September unbeantwortet, neue Frist 24. September 2026. „Ton: höflich, aber verbindlich, ohne Drohungen; Sie-Anrede; deutsche Rechtschreibung mit ß; maximal 120 Wörter.“
V4.1-Flash, Thinking an: „Betreff: Zweite Zahlungserinnerung – Rechnung Nr. 2026-0417 / Sehr geehrter Herr Krause, leider haben wir auf unsere erste Zahlungserinnerung vom 1. September 2026 keine Rückmeldung erhalten. Daher erinnern wir Sie erneut an die offene Rechnung Nr. 2026-0417 über 1.240,00 €. Diese ist seit dem 15. August 2026 fällig. Bitte überweisen Sie den Betrag bis spätestens 24. September 2026 auf unser bekanntes Konto. Sollten Sie die Zahlung bereits veranlasst haben, betrachten Sie diese E-Mail bitte als gegenstandslos. […] Mit freundlichen Grüßen, Müller Bürotechnik GmbH“
Bewertung: Alle drei Texte sind fehlerfrei, schreiben „Grüßen“ mit ß, übernehmen jede Zahl korrekt, drohen nicht und bleiben unter der Grenze: GPT-5.6 Sol 91 Wörter, V4.1-Flash 89, V4-Pro 79. GPT-5.6 Sol trifft den Jargon des Mahnwesens am genauesten („leider konnten wir […] noch keinen Zahlungseingang feststellen“), V4.1-Flash liegt gleichauf, V4-Pro ist am knappsten und mit „wir erinnern höflich an unsere Rechnung“ leicht ungelenk. Mehr zu deutschen Prompts: DeepSeek auf Deutsch nutzen.
Aufgabe 3: Python-Funktion mit Randfällen
Prompt (gekürzt): Funktion iban_formatieren(iban: str) -> str, die eine IBAN in Vierergruppen formatiert, Leerzeichen entfernt, Kleinbuchstaben in Großbuchstaben wandelt; leerer String oder nur Leerzeichen ergibt leeren String; andere Zeichen als Buchstaben und Ziffern lösen einen ValueError aus. Nur Code mit Docstring und zwei Beispielaufrufen.
Die Antwort von V4.1-Flash (Thinking an), vollständig:
def iban_formatieren(iban: str) -> str:
"""Formatiert eine IBAN in Vierergruppen; entfernt Leerzeichen und prüft Zeichen."""
iban = iban.replace(" ", "").upper()
if not iban:
return ""
if not all(c.isascii() and c.isalnum() for c in iban):
raise ValueError("IBAN darf nur Buchstaben und Ziffern enthalten")
return " ".join(iban[i:i + 4] for i in range(0, len(iban), 4))
print(iban_formatieren("de89 3704 0044 0532 0130 00"))
print(iban_formatieren(" "))
Wir haben alle drei Funktionen mit sieben Eingaben ausgeführt; Normalfälle, leere Eingabe und Bindestrich behandelten alle korrekt. Bei "DE89ä370" lieferte V4-Pro „DE89 Ä370″ statt eines Fehlers: str.isalnum() zählt in Python auch Umlaute als Buchstaben. V4.1-Flash und GPT-5.6 Sol prüfen zusätzlich auf ASCII und lehnen ab. V4.1-Flash wählte als zweites Beispiel bewusst den Randfall „nur Leerzeichen“, die anderen beiden nur Normalfälle. Tempo: GPT-5.6 Sol 4,7 Sekunden, V4.1-Flash 10,5 (2.219 Token Nachdenken), V4-Pro 26,7.
Aufgabe 4: Faktenfrage mit Datumsbezug
Prompt (gekürzt): Drei Fragen: Welches Datum ist heute bzw. bis wann reicht dein Wissensstand? Wer ist Bundeskanzler von Deutschland? Welches ist das neueste dir bekannte KI-Modell von OpenAI und von DeepSeek? Jeweils mit Angabe der Sicherheit, maximal 120 Wörter.
V4.1-Flash, Thinking an: „1. Heute ist der 9. Mai 2026 (Systemdatum; hohe Sicherheit). Mein Wissensstand reicht bis Juni 2024 (hoch). 2. Bundeskanzler: Nach aktuellem Stand Friedrich Merz; mein sicherer Wissensstand bis Juni 2024 nennt Olaf Scholz. Daher mittlere Sicherheit. 3. OpenAI: GPT-4o (Mai 2024; hohe Sicherheit). DeepSeek: DeepSeek-V2 bzw. DeepSeek-Coder-V2 […].“
GPT-5.6 Sol, Effort low: „1. Das heutige Datum kann ich ohne Systemzeit nicht zuverlässig nennen. Mein Wissensstand reicht bis Juni 2024. Sicherheit: hoch. 2. Nach diesem Wissensstand ist Olaf Scholz Bundeskanzler Deutschlands. […] 3. […] GPT-4o von OpenAI (Mai 2024) und DeepSeek-Coder-V2 von DeepSeek (Juni 2024 […]).“
Bewertung: V4-Pro antwortete wie GPT-5.6 Sol (Olaf Scholz, GPT-4o, DeepSeek-V2). Keines der drei kennt die eigene Generation, und alle nennen „Juni 2024″, obwohl OpenAI für GPT-5.6 Sol den 16. Februar 2026 dokumentiert: Selbstauskünfte sind antrainierte Standardsätze, keine Information. Immerhin nannte V4.1-Flash mit Friedrich Merz (Kanzler seit Mai 2025) den richtigen Regierungschef und markierte den Widerspruch selbst; die anderen beiden wiesen korrekt auf ihre Unsicherheit hin. Das „Systemdatum 9. Mai 2026″ stammt nicht aus unserem Prompt; die Herkunft konnten wir nicht klären. Folge: Für alles nach 2025 brauchen alle drei eine Websuche oder Informationen im Prompt. Chronik der DeepSeek-Modelle: Ein Jahr DeepSeek.
Aufgabe 5: Zusammenfassung in drei Stichpunkten
Prompt (gekürzt): Ein Absatz der Stadtwerke über eine sechswöchige Vollsperrung der Bahnhofstraße ab 1. Oktober 2026 (Fernwärme, Umleitung der Buslinien 3 und 7, Bürgertelefon, Wettervorbehalt) soll in genau drei Stichpunkten mit je höchstens 15 Wörtern zusammengefasst werden.
V4.1-Flash, Thinking an: „– Ab 1. Oktober 2026: Bahnhofstraße zwischen Marktplatz und Ringstraße sechs Wochen wegen Fernwärme gesperrt. – Anlieger via Gartenstraße; Busse 3/7 via Ringstraße, Ersatzhaltestelle Rathaus; Geschäfte zu Fuß erreichbar. – Bürgertelefon 0800 123456 werktags 8–16 Uhr; Zeitplan kann sich bei schlechtem Wetter verschieben.“
Bewertung: V4-Pro und GPT-5.6 Sol antworteten praktisch deckungsgleich. Alle drei halten die Vorgaben exakt ein: drei Punkte, 12 bis 14 Wörter, alle Kerninformationen. Tempo: V4.1-Flash 3,7 Sekunden, GPT-5.6 Sol 11,7, V4-Pro 14,0.
Antwortzeit und Token-Verbrauch
Gesamtdauer des Aufrufs bis zur vollständigen Antwort; „Ausgabe-Token“ enthält die Token fürs Nachdenken.
| Aufgabe | V4.1-Flash (Sekunden / Ausgabe-Token) | V4-Pro | GPT-5.6 Sol |
|---|---|---|---|
| 1 Rechenfalle | 1,3 s / 205 | 5,3 s / 309 | 5,2 s / 80 |
| 2 E-Mail | 4,5 s / 1.031 | 21,8 s / 1.403 | 10,1 s / 203 |
| 3 Python | 10,5 s / 2.381 | 26,7 s / 1.684 | 4,7 s / 152 |
| 4 Faktenfrage | 23,0 s / 5.104 | 22,2 s / 1.268 | 11,7 s / 451 |
| 5 Zusammenfassung | 3,7 s / 815 | 14,0 s / 903 | 11,7 s / 337 |
V4.1-Flash ist bei kurzen, klaren Aufgaben deutlich am schnellsten, denkt bei offenen Fragen aber lang: Bei der Faktenfrage waren es 4.958 Reasoning-Token für 120 Wörter Antwort. Wer das nicht braucht, setzt den Effort auf „low“ oder schaltet das Thinking ab (Anleitung: DeepSeek-API: Einstieg). V4-Pro war überall langsamer und nirgends besser. Das deckt sich mit DeepSeeks Aussage, V4.1-Flash überhole das Vorgängermodell in Leistung, Kosten und Tempo, und erklärt, warum V4-Pro nur noch auf Nutzerwunsch weiterläuft.
Rahmenvergleich: Lizenz, Datenschutz, Bilder, Kontext, Apps
| Kriterium | DeepSeek (V4.1-Flash, V4-Pro) | ChatGPT (GPT-5.6 Sol) |
|---|---|---|
| Modellgewichte | offen, MIT-Lizenz (Hugging Face); selbst betreibbar, auch bei Dritten in der EU | geschlossen; offen sind nur die kleinen gpt-oss-Modelle (120b, 20b) |
| Serverstandort der API | China (api.deepseek.com) | USA; für API-Kunden mit Zusatzvereinbarung Europa (eu.api.openai.com) |
| Bilder erzeugen | nein | ja, über die separaten GPT-Image-Modelle in ChatGPT |
| Kontextfenster | 1 Million Token | 1.050.000 Token |
| Maximale Ausgabe | 384.000 Token | 128.000 Token |
| Dokumentierter Wissensstand | nicht angegeben | 16. Februar 2026 |
| Zugang ohne API | DeepSeek-App und Web (V4-Pro als „Expert Mode“); Chat auf dieser Seite | ChatGPT-Apps und Web |
Offene Gewichte und Datenschutz: DeepSeek stellt V4.1-Flash und V4-Pro unter MIT-Lizenz auf Hugging Face bereit, mit technischem Bericht und Inferenz-Code; OpenAI hält GPT-5.6 Sol geschlossen. Für Privatnutzer ist das unerheblich, für Unternehmen mit Datenschutzauflagen das zentrale Argument: Über die offizielle API oder App gehen Eingaben an DeepSeek-Server in China, aber ein europäischer Anbieter kann das offene Modell selbst hosten, und dann gelten dessen Bedingungen. OpenAI verarbeitet in den USA und bietet API-Kunden nach Genehmigung und Vertragszusatz Verarbeitung und Speicherung in der Region „Europe (EEA + Switzerland)“ an.
Hinweis zu deepseek.de: Ihre Anfragen im Chat mit V4.1-Flash und im Chat mit V4-Pro gehen per API an DeepSeek, also an Server in China. Geben Sie dort keine sensiblen Daten ein. Einzelheiten in der Datenschutzerklärung.
Bilder und Kontext: Bilder erzeugen kann kein DeepSeek-Modell; ChatGPT erzeugt sie über die integrierten GPT-Image-Modelle. Beim Kontext dokumentieren beide rund eine Million Token, bei der Ausgabe liegt DeepSeek mit 384.000 Token vor GPT-5.6 Sol mit 128.000.
Apps und Verfügbarkeit: Beide haben Apps und Web-Chat; bei DeepSeek ist V4-Pro dort als „Expert Mode“ wählbar (DeepSeek-App). Entwicklern bietet DeepSeek ein OpenAI- und ein Anthropic-kompatibles Format, sodass Werkzeuge wie Claude Code, Codex oder OpenCode DeepSeek nutzen können. Abgerechnet wird nach Token, mit günstigeren Nebenzeiten und Cache-Treffern (offizielle Preisseite).
Wo Claude und Gemini stehen
Ohne eigene Tests, nach den offiziellen Dokumentationen (Stand 17. September 2026):
- Claude (Anthropic): Aktuell Claude Fable 5.1, Opus 5, Sonnet 5 und Haiku 4.5. Die drei großen haben 1 Million Token Kontext und 128.000 Token Ausgabe, verstehen Bilder, erzeugen keine und denken „adaptiv“. Dokumentierter Wissensstand: Juni 2026 (Fable 5.1), Mai 2026 (Opus 5), Januar 2026 (Sonnet 5). Gewichte geschlossen; verfügbar auch über Amazon Bedrock, Google Cloud und Microsoft Foundry. In DeepSeeks eigener Benchmark-Tabelle schlägt Claude Opus 5 V4.1-Flash bei den schwersten Agentenaufgaben am deutlichsten.
- Gemini (Google): Flaggschiff Gemini 3.1 Pro (Vorschau), neuestes Flash-Modell Gemini 3.8 Flash. Beide nehmen 1.048.576 Token Eingabe und geben 65.536 Token aus, deutlich weniger als DeepSeek. Alleinstellungsmerkmal ist die Eingabebreite: Text, Bild, Video, Audio und PDF. Bildgenerierung über separate Modelle (Nano Banana 2, Nano Banana Pro). Einen Wissensstand nennt Google auf den Modellseiten nicht; Gewichte geschlossen.
Fazit: Für wen sich was eignet
- Deutsche Alltagsaufgaben: Qualität gleichwertig; entscheiden Sie nach Tempo, Kosten und Datenschutz. V4.1-Flash ist meist die schnellste Wahl, zu testen im Chat auf der Startseite.
- Programmieren: V4.1-Flash und GPT-5.6 Sol lieferten robusteren Code als V4-Pro. DeepSeeks Benchmarks sehen V4.1-Flash bei Agentenaufgaben vor GPT-5.6 Sol und hinter Claude Opus 5; Herstellerangaben, die unser Test nicht prüfen kann.
- Bilder erzeugen, ein Ökosystem aus einer Hand: ChatGPT oder Gemini. DeepSeek generiert keine Bilder.
- Datenschutz mit eigener Kontrolle: DeepSeek selbst gehostet oder über einen europäischen Anbieter; OpenAI in der EU für API-Kunden mit Vertragszusatz.
- Aktuelles Wissen: Kein Modell ersetzt die Websuche.
- V4-Pro: Nirgends besser als V4.1-Flash, aber langsamer; Übersicht unter Modelle.
Häufige Fragen
Ist DeepSeek auf Deutsch so gut wie ChatGPT?
In unseren fünf Aufgaben ja: Rechtschreibung, ß, Sie-Anrede, Ton und Längenvorgaben hielten V4.1-Flash und V4-Pro genauso ein wie GPT-5.6 Sol.
Warum nennt GPT-5.6 Sol Juni 2024 als Wissensstand, wenn OpenAI Februar 2026 dokumentiert?
Weil Modelle ihren Wissensstand nicht „wissen“, sondern Sätze aus den Trainingsdaten reproduzieren. Verlassen Sie sich auf die Dokumentation des Anbieters; bei DeepSeek gibt es keine.
Kann ich DeepSeek nutzen, ohne dass Daten nach China gehen?
Nur, wenn Sie das offene Modell selbst betreiben oder einen Anbieter wählen, der es in der EU hostet. API, App und der Chat auf deepseek.de senden an DeepSeek.
Lohnt sich V4-Pro noch gegenüber V4.1-Flash?
Nach unseren Tests und DeepSeeks eigenen Angaben nicht: V4.1-Flash war schneller, gleich gut oder besser. DeepSeek betreibt V4-Pro auf Nutzerwunsch weiter, bis V4.1-Pro erscheint.
Quellen und Änderungen
- DeepSeek: DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient (10.09.2026), DeepSeek-V4-Pro GA Release (13.08.2026), DeepSeek V4 Preview Release (24.04.2026)
- DeepSeek: Models & Pricing, Thinking Mode
- Hugging Face: DeepSeek-V4.1-Flash (MIT-Lizenz, Architektur, Benchmark-Tabelle)
- OpenAI: Modellübersicht, GPT-5.6 Sol, Data residency
- Anthropic: Models overview
- Google: Gemini models mit den Seiten zu Gemini 3.1 Pro und Gemini 3.8 Flash
- Eigene Tests vom 17.09.2026: 15 ausgewertete Aufrufe (5 Aufgaben × 3 Modelle); Rohantworten, Token und Zeiten im Testprotokoll
07-deepseek-vs-chatgpt-tests.txt
Änderungen: 17.09.2026 – Beitrag neu erstellt, kein Vorgängertext. Alle Aufgaben, Antworten, Messungen und die Code-Nachprüfung wurden eigens für diese Fassung durchgeführt; der Rahmenvergleich beruht auf den am selben Tag abgerufenen Dokumentationen von DeepSeek, OpenAI, Anthropic und Google.

