Ein KI-Agent verbindet ein Sprachmodell mit Werkzeugen wie Kalender, Suche und Code und arbeitet eine Aufgabe in mehreren Schritten ab

KI-Agenten mit DeepSeek: V4.1-Flash und V4-Pro im Praxistest

Update (September 2026): DeepSeek hat V4-Pro eingestellt. Seit dem 14. September 2026 werden Anfragen an V4-Pro vorübergehend von V4.1-Flash beantwortet; ein Nachfolger V4.1-Pro ist angekündigt. Aktuelles Modell auf deepseek.de ist V4.1-Flash. Die Tests und Vergleiche in diesem Beitrag beziehen sich auf den Stand vor der Einstellung.

Ein KI-Agent beantwortet nicht nur eine Frage, er erledigt eine Aufgabe in mehreren Schritten und ruft dafür Werkzeuge auf. DeepSeek hat die Modelle V4.1-Flash und V4-Pro gezielt darauf trainiert und bietet in der API Tool Calls, Thinking mit Werkzeugen und Schnittstellen für Codex und Claude Code. Dieser Beitrag erklärt den Unterschied zwischen Chat und Agent, zeigt mit einem eigenen Python-Skript, wie ein Tool Call bei DeepSeek tatsächlich abläuft, und vergleicht in echten Tests, wie beide Modelle eine mehrstufige Aufgabe planen. Dazu: Einsatzfelder, Grenzen und der Einstieg. Stand: 17. September 2026.

Chat oder Agent: Was ist der Unterschied?

Im Chat schicken Sie eine Nachricht, das Modell antwortet, fertig. Es kennt nur das, was in seinen Trainingsdaten steckt oder was Sie ihm ins Gespräch schreiben. Ein Agent bekommt zusätzlich Werkzeuge: eine Funktion, die das Datum liefert, eine Websuche, einen Dateizugriff, eine Python-Umgebung. Das Modell entscheidet selbst, ob und welches Werkzeug es aufruft, bekommt das Ergebnis zurück, denkt weiter und ruft bei Bedarf das nächste auf. Erst wenn es genug weiß, formuliert es die Antwort.

Drei Dinge machen den Unterschied aus:

  • Tool Calls: Das Modell antwortet nicht mit Text, sondern mit einer strukturierten Anweisung „rufe Funktion X mit den Parametern Y auf“. Ihr Programm führt die Funktion aus und meldet das Ergebnis zurück.
  • Mehrstufiges Arbeiten: Ein Agent plant, prüft Zwischenergebnisse und korrigiert sich. Ein Coding-Agent ändert etwa Code, lässt Tests laufen und liest die Fehlermeldung, bevor er weitermacht.
  • Großer Kontext: Alles, was der Agent gelesen und getan hat, bleibt im Kontextfenster. Bei DeepSeek sind das bis zu 1 Million Token, grob 600.000 deutsche Wörter; Systemanweisung, Werkzeugbeschreibungen, Dateien und Testausgaben passen so ohne ständiges Kürzen hinein.

Wie deutlich die Grenze des reinen Chats ist, zeigt ein kleiner Test. Wir haben V4.1-Flash ohne Werkzeuge gebeten, einen Serverordner aufzulisten:

V4.1-Flash, Thinking an (Standard): „Ich kann nicht direkt auf dein Dateisystem zugreifen, daher kann ich den Inhalt von /var/www/html nicht selbst auflisten. Du kannst das aber mit folgenden Befehlen machen: […] ls -lah /var/www/html […] Wenn du mir die Ausgabe […] hier postest, kann ich sie dir übersichtlich auflisten.“

Die Antwort ist korrekt und ehrlich, aber der Nutzer muss den Befehl selbst ausführen. Genau diesen Schritt übernimmt ein Agent.

Was DeepSeek für Agenten mitbringt

Beide aktuellen API-Modelle sind auf Agentenarbeit ausgelegt. Die Modellkarte von V4.1-Flash beschreibt das Nachtraining als groß angelegte, automatisierte Erzeugung von Agentenaufgaben und -umgebungen; die Architektur mit nur 8 Milliarden aktiven Parametern bei der Eingabe zielt auf Abläufe, bei denen viel gelesen und wenig geschrieben wird. Die Modellübersicht finden Sie unter /modelle/ und im Beitrag DeepSeek V4: die neue Modellgeneration.

Merkmal DeepSeek-V4.1-Flash (deepseek-flash) DeepSeek-V4-Pro (deepseek-v4-pro)
Parameter gesamt / aktiv 552 Mrd. / 8 Mrd. (Eingabe), 16 Mrd. (Ausgabe) 1,6 Bio. / 49 Mrd.
Kontext / max. Ausgabe 1 Mio. / 384.000 Token 1 Mio. / 384.000 Token
Tool Calls, JSON-Ausgabe, Thinking mit Werkzeugen ja ja
Responses API (Codex), Anthropic-Format (Claude Code) ja ja
Offene Gewichte ja, MIT-Lizenz ja, MIT-Lizenz
Auf deepseek.de Chat auf der Startseite Chat unter /pro/

Die Bausteine im Einzelnen:

  • Tool Calls: Sie übergeben eine Liste von Funktionen mit Namen, Beschreibung und JSON-Schema der Parameter. Das Modell liefert bei Bedarf tool_calls zurück, Ihr Code führt sie aus. Das Format entspricht dem von OpenAI, bestehende Bibliotheken funktionieren ohne Anpassung.
  • Thinking mit Werkzeugen: Im Thinking-Modus (standardmäßig an, Aufwand low, high oder max) kann das Modell vor der Antwort mehrere Runden aus Überlegen und Werkzeugaufruf durchlaufen. Wichtig: Bei Anfragen mit tools muss der Gedankengang (reasoning_content) aller vorherigen Runden mitgeschickt werden, sonst antwortet die API mit Fehler 400.
  • Responses API: Seit dem 13. August 2026 unterstützt DeepSeek das Responses-Format von OpenAI nativ. Damit läuft OpenAIs Coding-Agent Codex mit DeepSeek-Modellen; ein Einrichtungsskript von DeepSeek passt die Konfiguration von Codex CLI, ChatGPT-Desktop-App und VS-Code-Erweiterung an.
  • Anthropic-Format: Unter https://api.deepseek.com/anthropic nimmt die API Anfragen im Format der Anthropic-API an. So lässt sich Claude Code auf DeepSeek umstellen: Modellnamen mit claude-opus werden auf V4-Pro abgebildet, claude-sonnet und claude-haiku auf V4.1-Flash.

Daneben gibt es Anleitungen für OpenCode, OpenClaw und Hermes. Wie gut das klappt, misst DeepSeek mit Agenten-Benchmarks: Nach der Modellkarte von V4.1-Flash (maximaler Reasoning-Aufwand, eigene Messung des Herstellers) erreicht das kleinere Modell auf Terminal-Bench 2.1 90,6 Prozent gegenüber 87,9 Prozent bei V4-Pro und auf DeepSWE v1.1 74,2 gegenüber 62,7 Prozent. Auf den schwereren Terminal-Bench-Versionen 3.0 und 4.0 liegen beide DeepSeek-Modelle laut derselben Tabelle klar hinter den besten geschlossenen Modellen. Herstellerbenchmarks sind ein Anhaltspunkt, deshalb haben wir selbst getestet.

Test 1: Ein Tool Call per API, Schritt für Schritt

Für den Test haben wir nach dem Muster aus der DeepSeek-Dokumentation ein kleines Python-Skript geschrieben, ohne SDK, nur mit der Standardbibliothek. Es definiert zwei Attrappen: get_date liefert das heutige Datum, get_weather gibt für jeden Ort denselben Dummy-Wert zurück. Das Modell weiß nicht, dass es Attrappen sind. Der gekürzte Kern:

tools = [
  {"type": "function", "function": {"name": "get_date", "description": "Liefert das heutige Datum.",
     "parameters": {"type": "object", "properties": {}}}},
  {"type": "function", "function": {"name": "get_weather", "description": "Liefert das Wetter fuer einen Ort an einem Datum.",
     "parameters": {"type": "object", "properties": {"location": {"type": "string"}, "date": {"type": "string"}},
                    "required": ["location", "date"]}}}]

messages = [{"role": "user", "content": "Wie wird das Wetter morgen in Hamburg?"}]
while True:
    body = {"model": "deepseek-flash", "messages": messages, "tools": tools,
            "thinking": {"type": "enabled"}, "reasoning_effort": "high"}
    msg = post("https://api.deepseek.com/chat/completions", body)
    # komplette Assistant-Nachricht inkl. reasoning_content zurueckgeben
    messages.append({"role": "assistant", "content": msg["content"],
        "reasoning_content": msg.get("reasoning_content"),
        "tool_calls": msg.get("tool_calls")})
    if not msg.get("tool_calls"):
        break
    for tc in msg["tool_calls"]:
        result = TOOLS[tc["function"]["name"]](**json.loads(tc["function"]["arguments"]))
        messages.append({"role": "tool", "tool_call_id": tc["id"], "content": result})

So lief der Durchgang mit V4.1-Flash (Thinking an, Effort high), alle Angaben aus der echten Ausgabe:

Schritt Was das Modell zurückgibt Zeit
1 content: „I’ll check the weather for Hamburg tomorrow. Let me first get today’s date.“ – tool_calls: get_date mit {} 1,1 s
Skript meldet 2026-09-17 zurück
2 reasoning_content: „Today is 2026-09-17, so tomorrow is 2026-09-18.“ – tool_calls: get_weather mit {"location": "Hamburg", "date": "2026-09-18"} 0,9 s
Skript meldet „Bewoelkt, 12 bis 18 Grad“ zurück
3 tool_calls: null, dafür die fertige Antwort (unten) 0,9 s

V4.1-Flash, Thinking an, Schritt 3: „Das Wetter morgen (18.09.2026) in Hamburg: Bewölkt, 12 bis 18 Grad. Also ein eher trüber, aber milder Herbsttag – eine Jacke für den Morgen ist bei 12 Grad durchaus sinnvoll.“

Drei Details fallen auf. Das Modell hat erkannt, dass „morgen“ ohne Datum nicht auflösbar ist, und unaufgefordert zuerst get_date aufgerufen. Es hat das Datum selbst um einen Tag weitergerechnet und korrekt an get_weather übergeben. Und der Zwischentext im ersten Schritt ist englisch, die Endantwort deutsch; wer das vermeiden will, gibt die Sprache in der Systemanweisung vor. Der ganze Ablauf mit drei API-Aufrufen dauerte unter drei Sekunden.

Gegenprobe mit denselben Werkzeugen und der Frage „Wie heißt die Hauptstadt von Portugal?“: Das Modell notierte „The user asks a simple question. No tools needed.“ und antwortete direkt mit „Lissabon“, tool_calls: null. Werkzeuge nur nutzen, wenn sie etwas bringen: Das hat funktioniert.

Test 2: Mehrstufige Planung mit V4.1-Flash und V4-Pro

Bevor ein Agent handelt, muss er planen. Wir haben beiden Modellen dieselbe Aufgabe gestellt: Als Agent mit den Werkzeugen web_search, read_file und run_python aus einer CSV-Datei mit Umsätzen den Gesamtumsatz je Filiale und die drei stärksten Monate ermitteln und als Balkendiagramm speichern, in höchstens sechs Schritten, mit Werkzeug und Prüfschritt je Schritt. Beide liefen im Thinking-Modus.

V4.1-Flash, Thinking an V4-Pro, Thinking an
Antwortzeit 9,9 s 37,4 s
Ausgabe-Token (davon Reasoning) 1.931 (1.550) 2.316 (1.974)
Schritt 1 (von 6) „read_file("umsatz_2025.csv") – Datei öffnen und Kopf/Struktur ansehen. Prüfung: Spalten datum, filiale, betrag vorhanden; Trennzeichen/Encoding plausibel.“ „read_file – Datei umsatz_2025.csv öffnen und Inhalt sichten. Prüfung: Spalten datum, filiale, betrag vorhanden, Datumsformat erkennbar.“
Schritt 5 „Balkendiagramm mit zwei Subplots erstellen […]; speichern als umsatz_2025_balken.png. Prüfung: Datei existiert, Größe > 0, Achsen/Titel beschriftet.“ „Balkendiagramm mit zwei Subplots […] erstellen und als PNG speichern. Prüfung: Bilddatei existiert und ist nicht leer.“
Zusatz „web_search wird nicht benötigt.“ –

Beide Pläne sind brauchbar und nahezu deckungsgleich: lesen, Datentypen prüfen, aggregieren (Schritte 3 und 4), zeichnen, kontrollieren. V4.1-Flash war präziser bei den Prüfungen (Encoding, Jahr 2025, Achsenbeschriftung) und hat explizit festgestellt, dass die Websuche überflüssig ist. V4-Pro brauchte fast viermal so lange und mehr Reasoning-Token, ohne einen erkennbar besseren Plan zu liefern. Das deckt sich mit DeepSeeks eigener Aussage vom 10. September 2026, dass V4.1-Flash bei Leistung, Geschwindigkeit und Kosten vor V4-Pro liegt. Ein Einzeltest beweist das nicht, aber er gibt keinen Grund, für Planungsaufgaben dieser Art zum größeren Modell zu greifen.

Hinweis zur Methode: Alle Antworten stammen aus echten API-Aufrufen am 17. September 2026 und sind wörtlich übernommen, Kürzungen sind mit […] markiert. Ein erster Versuch mit V4.1-Flash scheiterte, weil das Ausgabelimit von 1.500 Token komplett vom Reasoning verbraucht wurde; wir haben das Limit danach auf 8.000 Token gesetzt. Merken Sie sich das für eigene Agenten: Im Thinking-Modus muss max_tokens das Nachdenken mit einschließen.

Einsatzfelder: Coding, Recherche, Automatisierung

Coding-Agent

Das ist der Bereich, für den DeepSeek die Modelle am sichtbarsten optimiert. Über die Responses API läuft Codex, über das Anthropic-Format Claude Code, dazu OpenCode und die Partnerprodukte WorkBuddy und CodeBuddy. Der Agent liest Ihr Repository, ändert Dateien, führt Tests aus und iteriert, bis sie durchlaufen. Genau so hat DeepSeek die Agenten-Benchmarks der Modellkarte gemessen: mit Claude-Code-, Codex- oder DeepSeek-Harness-Scaffolds, bis zu 500 Schritten pro Aufgabe und 1 Million Token Kontext.

Recherche

Ein Recherche-Agent bekommt Websuche und Seitenleser als Werkzeuge, formuliert selbst Suchanfragen, liest Treffer, vergleicht und fasst zusammen. Der Chat auf deepseek.de hat keine Websuche; über die API lässt sich ein solcher Agent nach dem Muster von Test 1 bauen.

Automatisierung

Wiederkehrende Abläufe eignen sich besonders: Anfragen klassifizieren, Tabellen bereinigen, Berichte aus Datenbankabfragen erstellen, Tickets vorsortieren. Für einfache, klar strukturierte Schritte empfiehlt DeepSeek den Reasoning-Aufwand low, für den Agentenalltag high, für schwierige Fälle max. Frameworks wie OpenClaw oder Hermes binden DeepSeek über den OpenAI-kompatiblen Endpunkt ein, meist durch Ändern von Basis-URL, Schlüssel und Modellname.

So fangen Sie an

  1. Ohne Programmierung ausprobieren: Der Chat auf der Startseite läuft mit V4.1-Flash, der Chat unter /pro/ mit V4-Pro. Beide haben keine Werkzeuge, aber Planungsaufgaben wie in Test 2 zeigen, wie das Modell zerlegt und priorisiert. Wie sich die Modelle gegen OpenAI schlagen, steht im Beitrag DeepSeek vs. ChatGPT, weitere Antworten in den FAQ.
  2. Ersten Tool Call bauen: API-Schlüssel anlegen, das Skript aus Test 1 nachbauen, eigene Funktion definieren; die Grundlagen stehen im Beitrag DeepSeek-API: der Einstieg. Denken Sie an das Zurückgeben von reasoning_content und an ein ausreichend hohes max_tokens.
  3. Fertigen Agenten anschließen: Für Codex das Einrichtungsskript von DeepSeek nutzen, für Claude Code die Umgebungsvariablen ANTHROPIC_BASE_URL und ANTHROPIC_API_KEY setzen. Beginnen Sie mit deepseek-flash; V4-Pro lohnt sich erst, wenn Flash an einer konkreten Aufgabe scheitert.

Grenzen und Risiken

  • Halluzination wird zu Handlung. Im Chat ist eine erfundene Angabe ein Fehler im Text, beim Agenten kann sie eine Datei löschen oder eine falsche E-Mail verschicken. Deshalb: Werkzeuge mit minimalen Rechten ausstatten, schreibende Aktionen bestätigen lassen, Ergebnisse prüfen. Das Modell vertraut seinen Werkzeugen; mit einem falschen Datum aus get_date wäre es in Test 1 klaglos weitergelaufen.
  • Kosten wachsen mit dem Kontext. Abgerechnet wird nach Token, und ein Agent schickt bei jedem Schritt den gesamten bisherigen Verlauf erneut mit; bei langen Sitzungen dominiert die Eingabe. DeepSeek begegnet dem mit Context Caching (Cache-Treffer sind deutlich günstiger), günstigeren Nebenzeiten und bei V4.1-Flash mit einem stark verkleinerten KV-Cache; laut DeepSeek machen Cache-Treffer oft einen großen Teil der Agentenkosten aus. Aktuelle Konditionen: offizielle Preisseite.
  • Reasoning frisst Budget. Wie unser Fehlversuch zeigt, kann das Nachdenken allein ein knappes max_tokens aufbrauchen. Für einfache Schritte den Effort auf low setzen oder Thinking abschalten.
  • Datenschutz. Anfragen im Chat auf deepseek.de gehen per API an DeepSeek, die Server stehen in China. Geben Sie keine personenbezogenen oder vertraulichen Daten ein; für eigene Agenten gilt das erst recht, weil sie Dateien und Datenbanken lesen (Details unter /datenschutz/). Wer Daten im Haus behalten muss, kann die offenen Gewichte selbst betreiben, braucht dafür aber passende Hardware.
  • Modellwechsel einplanen. V4-Flash ist bereits abgelöst, V4-Pro bleibt nach einer zunächst angekündigten Abschaltung „bis auf Weiteres“ in der API, V4.1-Pro ist ohne Datum angekündigt. Hinterlegen Sie den Modellnamen in Ihrer Konfiguration an einer einzigen Stelle.

Häufige Fragen

Kann ich Agenten direkt im Chat auf deepseek.de nutzen?

Nein. Der Chat auf deepseek.de hat keine Werkzeuge, kein Internet und keinen Dateizugriff. Dort testen Sie Planung und Reasoning; für echte Agenten brauchen Sie die API oder Codex, Claude Code oder OpenCode mit DeepSeek als Modell.

Flash oder Pro für Agenten?

Starten Sie mit V4.1-Flash. Im Planungstest war es fast viermal schneller als V4-Pro bei gleichwertigem Ergebnis, in DeepSeeks Agenten-Benchmarks liegt es vorn. V4-Pro bleibt eine Option für Aufgaben, an denen Flash nachweislich scheitert.

Warum bekomme ich bei Tool Calls einen Fehler 400?

Meist fehlt reasoning_content in den zurückgeschickten Assistant-Nachrichten. Im Thinking-Modus mit tools verlangt die API den Gedankengang aller vorherigen Runden, auch aus Runden ohne Werkzeugaufruf. Am einfachsten hängen Sie die komplette Antwortnachricht unverändert an den Verlauf.

Funktionieren parallele Tool Calls?

Laut der Codex-Konfiguration von DeepSeek ja (supports_parallel_tool_calls: true). In unseren Tests rief das Modell nacheinander auf, weil der zweite Aufruf vom ersten abhing. Ihr Code sollte in jedem Fall mehrere Einträge in tool_calls verarbeiten können.

Quellen und Änderungen

Änderungen: 17.09.2026 – Beitrag vollständig neu geschrieben und drei ältere Artikel zusammengeführt: „DeepSeek V4 stärkt offene KI-Agenten“ (Mai 2026), „DeepSeek V4 Pro startet mit stärkerer Agent-Leistung“ (August 2026) und „DeepSeek baut KI-Suche und Agenten aus“ (Februar 2026). Aktualisiert auf V4.1-Flash, Responses API und Anthropic-Format; Preview-Benchmarks und Preisabschnitt der alten Fassungen entfernt. Tool-Call-Skript, Planungstest und Chat-Beispiele wurden eigens für diese Fassung erstellt und ausgeführt.


Avatar von Matthias Gull

Autor

Matthias Gull betreibt deepseek.de als unabhängige Informationsseite zu DeepSeek. Alle Beiträge werden vor der Veröffentlichung von ihm geprüft. So entstehen unsere Inhalte