Ein KI-Agent beantwortet nicht nur eine Frage, er erledigt eine Aufgabe in mehreren Schritten und ruft dafür Werkzeuge auf. DeepSeek hat die Modelle V4.1-Flash und V4-Pro gezielt darauf trainiert und bietet in der API Tool Calls, Thinking mit Werkzeugen und Schnittstellen für Codex und Claude Code. Dieser Beitrag erklärt den Unterschied zwischen Chat und Agent, zeigt mit einem eigenen Python-Skript, wie ein Tool Call bei DeepSeek tatsächlich abläuft, und vergleicht in echten Tests, wie beide Modelle eine mehrstufige Aufgabe planen. Dazu: Einsatzfelder, Grenzen und der Einstieg. Stand: 17. September 2026.
Inhalt
- Chat oder Agent: Was ist der Unterschied?
- Was DeepSeek für Agenten mitbringt
- Test 1: Ein Tool Call per API, Schritt für Schritt
- Test 2: Mehrstufige Planung mit V4.1-Flash und V4-Pro
- Einsatzfelder: Coding, Recherche, Automatisierung
- So fangen Sie an
- Grenzen und Risiken
- Häufige Fragen
- Quellen und Änderungen
Chat oder Agent: Was ist der Unterschied?
Im Chat schicken Sie eine Nachricht, das Modell antwortet, fertig. Es kennt nur das, was in seinen Trainingsdaten steckt oder was Sie ihm ins Gespräch schreiben. Ein Agent bekommt zusätzlich Werkzeuge: eine Funktion, die das Datum liefert, eine Websuche, einen Dateizugriff, eine Python-Umgebung. Das Modell entscheidet selbst, ob und welches Werkzeug es aufruft, bekommt das Ergebnis zurück, denkt weiter und ruft bei Bedarf das nächste auf. Erst wenn es genug weiß, formuliert es die Antwort.
Drei Dinge machen den Unterschied aus:
- Tool Calls: Das Modell antwortet nicht mit Text, sondern mit einer strukturierten Anweisung „rufe Funktion X mit den Parametern Y auf“. Ihr Programm führt die Funktion aus und meldet das Ergebnis zurück.
- Mehrstufiges Arbeiten: Ein Agent plant, prüft Zwischenergebnisse und korrigiert sich. Ein Coding-Agent ändert etwa Code, lässt Tests laufen und liest die Fehlermeldung, bevor er weitermacht.
- Großer Kontext: Alles, was der Agent gelesen und getan hat, bleibt im Kontextfenster. Bei DeepSeek sind das bis zu 1 Million Token, grob 600.000 deutsche Wörter; Systemanweisung, Werkzeugbeschreibungen, Dateien und Testausgaben passen so ohne ständiges Kürzen hinein.
Wie deutlich die Grenze des reinen Chats ist, zeigt ein kleiner Test. Wir haben V4.1-Flash ohne Werkzeuge gebeten, einen Serverordner aufzulisten:
V4.1-Flash, Thinking an (Standard): „Ich kann nicht direkt auf dein Dateisystem zugreifen, daher kann ich den Inhalt von
/var/www/htmlnicht selbst auflisten. Du kannst das aber mit folgenden Befehlen machen: […]ls -lah /var/www/html[…] Wenn du mir die Ausgabe […] hier postest, kann ich sie dir übersichtlich auflisten.“
Die Antwort ist korrekt und ehrlich, aber der Nutzer muss den Befehl selbst ausführen. Genau diesen Schritt übernimmt ein Agent.
Was DeepSeek für Agenten mitbringt
Beide aktuellen API-Modelle sind auf Agentenarbeit ausgelegt. Die Modellkarte von V4.1-Flash beschreibt das Nachtraining als groß angelegte, automatisierte Erzeugung von Agentenaufgaben und -umgebungen; die Architektur mit nur 8 Milliarden aktiven Parametern bei der Eingabe zielt auf Abläufe, bei denen viel gelesen und wenig geschrieben wird. Die Modellübersicht finden Sie unter /modelle/ und im Beitrag DeepSeek V4: die neue Modellgeneration.
| Merkmal | DeepSeek-V4.1-Flash (deepseek-flash) |
DeepSeek-V4-Pro (deepseek-v4-pro) |
|---|---|---|
| Parameter gesamt / aktiv | 552 Mrd. / 8 Mrd. (Eingabe), 16 Mrd. (Ausgabe) | 1,6 Bio. / 49 Mrd. |
| Kontext / max. Ausgabe | 1 Mio. / 384.000 Token | 1 Mio. / 384.000 Token |
| Tool Calls, JSON-Ausgabe, Thinking mit Werkzeugen | ja | ja |
| Responses API (Codex), Anthropic-Format (Claude Code) | ja | ja |
| Offene Gewichte | ja, MIT-Lizenz | ja, MIT-Lizenz |
| Auf deepseek.de | Chat auf der Startseite | Chat unter /pro/ |
Die Bausteine im Einzelnen:
- Tool Calls: Sie übergeben eine Liste von Funktionen mit Namen, Beschreibung und JSON-Schema der Parameter. Das Modell liefert bei Bedarf
tool_callszurück, Ihr Code führt sie aus. Das Format entspricht dem von OpenAI, bestehende Bibliotheken funktionieren ohne Anpassung. - Thinking mit Werkzeugen: Im Thinking-Modus (standardmäßig an, Aufwand
low,highodermax) kann das Modell vor der Antwort mehrere Runden aus Überlegen und Werkzeugaufruf durchlaufen. Wichtig: Bei Anfragen mittoolsmuss der Gedankengang (reasoning_content) aller vorherigen Runden mitgeschickt werden, sonst antwortet die API mit Fehler 400. - Responses API: Seit dem 13. August 2026 unterstützt DeepSeek das Responses-Format von OpenAI nativ. Damit läuft OpenAIs Coding-Agent Codex mit DeepSeek-Modellen; ein Einrichtungsskript von DeepSeek passt die Konfiguration von Codex CLI, ChatGPT-Desktop-App und VS-Code-Erweiterung an.
- Anthropic-Format: Unter
https://api.deepseek.com/anthropicnimmt die API Anfragen im Format der Anthropic-API an. So lässt sich Claude Code auf DeepSeek umstellen: Modellnamen mitclaude-opuswerden auf V4-Pro abgebildet,claude-sonnetundclaude-haikuauf V4.1-Flash.
Daneben gibt es Anleitungen für OpenCode, OpenClaw und Hermes. Wie gut das klappt, misst DeepSeek mit Agenten-Benchmarks: Nach der Modellkarte von V4.1-Flash (maximaler Reasoning-Aufwand, eigene Messung des Herstellers) erreicht das kleinere Modell auf Terminal-Bench 2.1 90,6 Prozent gegenüber 87,9 Prozent bei V4-Pro und auf DeepSWE v1.1 74,2 gegenüber 62,7 Prozent. Auf den schwereren Terminal-Bench-Versionen 3.0 und 4.0 liegen beide DeepSeek-Modelle laut derselben Tabelle klar hinter den besten geschlossenen Modellen. Herstellerbenchmarks sind ein Anhaltspunkt, deshalb haben wir selbst getestet.
Test 1: Ein Tool Call per API, Schritt für Schritt
Für den Test haben wir nach dem Muster aus der DeepSeek-Dokumentation ein kleines Python-Skript geschrieben, ohne SDK, nur mit der Standardbibliothek. Es definiert zwei Attrappen: get_date liefert das heutige Datum, get_weather gibt für jeden Ort denselben Dummy-Wert zurück. Das Modell weiß nicht, dass es Attrappen sind. Der gekürzte Kern:
tools = [
{"type": "function", "function": {"name": "get_date", "description": "Liefert das heutige Datum.",
"parameters": {"type": "object", "properties": {}}}},
{"type": "function", "function": {"name": "get_weather", "description": "Liefert das Wetter fuer einen Ort an einem Datum.",
"parameters": {"type": "object", "properties": {"location": {"type": "string"}, "date": {"type": "string"}},
"required": ["location", "date"]}}}]
messages = [{"role": "user", "content": "Wie wird das Wetter morgen in Hamburg?"}]
while True:
body = {"model": "deepseek-flash", "messages": messages, "tools": tools,
"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
msg = post("https://api.deepseek.com/chat/completions", body)
# komplette Assistant-Nachricht inkl. reasoning_content zurueckgeben
messages.append({"role": "assistant", "content": msg["content"],
"reasoning_content": msg.get("reasoning_content"),
"tool_calls": msg.get("tool_calls")})
if not msg.get("tool_calls"):
break
for tc in msg["tool_calls"]:
result = TOOLS[tc["function"]["name"]](**json.loads(tc["function"]["arguments"]))
messages.append({"role": "tool", "tool_call_id": tc["id"], "content": result})
So lief der Durchgang mit V4.1-Flash (Thinking an, Effort high), alle Angaben aus der echten Ausgabe:
| Schritt | Was das Modell zurückgibt | Zeit |
|---|---|---|
| 1 | content: „I’ll check the weather for Hamburg tomorrow. Let me first get today’s date.“ – tool_calls: get_date mit {} |
1,1 s |
| Skript | meldet 2026-09-17 zurück |
|
| 2 | reasoning_content: „Today is 2026-09-17, so tomorrow is 2026-09-18.“ – tool_calls: get_weather mit {"location": "Hamburg", "date": "2026-09-18"} |
0,9 s |
| Skript | meldet „Bewoelkt, 12 bis 18 Grad“ zurück | |
| 3 | tool_calls: null, dafür die fertige Antwort (unten) |
0,9 s |
V4.1-Flash, Thinking an, Schritt 3: „Das Wetter morgen (18.09.2026) in Hamburg: Bewölkt, 12 bis 18 Grad. Also ein eher trüber, aber milder Herbsttag – eine Jacke für den Morgen ist bei 12 Grad durchaus sinnvoll.“
Drei Details fallen auf. Das Modell hat erkannt, dass „morgen“ ohne Datum nicht auflösbar ist, und unaufgefordert zuerst get_date aufgerufen. Es hat das Datum selbst um einen Tag weitergerechnet und korrekt an get_weather übergeben. Und der Zwischentext im ersten Schritt ist englisch, die Endantwort deutsch; wer das vermeiden will, gibt die Sprache in der Systemanweisung vor. Der ganze Ablauf mit drei API-Aufrufen dauerte unter drei Sekunden.
Gegenprobe mit denselben Werkzeugen und der Frage „Wie heißt die Hauptstadt von Portugal?“: Das Modell notierte „The user asks a simple question. No tools needed.“ und antwortete direkt mit „Lissabon“, tool_calls: null. Werkzeuge nur nutzen, wenn sie etwas bringen: Das hat funktioniert.
Test 2: Mehrstufige Planung mit V4.1-Flash und V4-Pro
Bevor ein Agent handelt, muss er planen. Wir haben beiden Modellen dieselbe Aufgabe gestellt: Als Agent mit den Werkzeugen web_search, read_file und run_python aus einer CSV-Datei mit Umsätzen den Gesamtumsatz je Filiale und die drei stärksten Monate ermitteln und als Balkendiagramm speichern, in höchstens sechs Schritten, mit Werkzeug und Prüfschritt je Schritt. Beide liefen im Thinking-Modus.
| V4.1-Flash, Thinking an | V4-Pro, Thinking an | |
|---|---|---|
| Antwortzeit | 9,9 s | 37,4 s |
| Ausgabe-Token (davon Reasoning) | 1.931 (1.550) | 2.316 (1.974) |
| Schritt 1 (von 6) | „read_file("umsatz_2025.csv") – Datei öffnen und Kopf/Struktur ansehen. Prüfung: Spalten datum, filiale, betrag vorhanden; Trennzeichen/Encoding plausibel.“ |
„read_file – Datei umsatz_2025.csv öffnen und Inhalt sichten. Prüfung: Spalten datum, filiale, betrag vorhanden, Datumsformat erkennbar.“ |
| Schritt 5 | „Balkendiagramm mit zwei Subplots erstellen […]; speichern als umsatz_2025_balken.png. Prüfung: Datei existiert, Größe > 0, Achsen/Titel beschriftet.“ |
„Balkendiagramm mit zwei Subplots […] erstellen und als PNG speichern. Prüfung: Bilddatei existiert und ist nicht leer.“ |
| Zusatz | „web_search wird nicht benötigt.“ |
– |
Beide Pläne sind brauchbar und nahezu deckungsgleich: lesen, Datentypen prüfen, aggregieren (Schritte 3 und 4), zeichnen, kontrollieren. V4.1-Flash war präziser bei den Prüfungen (Encoding, Jahr 2025, Achsenbeschriftung) und hat explizit festgestellt, dass die Websuche überflüssig ist. V4-Pro brauchte fast viermal so lange und mehr Reasoning-Token, ohne einen erkennbar besseren Plan zu liefern. Das deckt sich mit DeepSeeks eigener Aussage vom 10. September 2026, dass V4.1-Flash bei Leistung, Geschwindigkeit und Kosten vor V4-Pro liegt. Ein Einzeltest beweist das nicht, aber er gibt keinen Grund, für Planungsaufgaben dieser Art zum größeren Modell zu greifen.
max_tokens das Nachdenken mit einschließen.Einsatzfelder: Coding, Recherche, Automatisierung
Coding-Agent
Das ist der Bereich, für den DeepSeek die Modelle am sichtbarsten optimiert. Über die Responses API läuft Codex, über das Anthropic-Format Claude Code, dazu OpenCode und die Partnerprodukte WorkBuddy und CodeBuddy. Der Agent liest Ihr Repository, ändert Dateien, führt Tests aus und iteriert, bis sie durchlaufen. Genau so hat DeepSeek die Agenten-Benchmarks der Modellkarte gemessen: mit Claude-Code-, Codex- oder DeepSeek-Harness-Scaffolds, bis zu 500 Schritten pro Aufgabe und 1 Million Token Kontext.
Recherche
Ein Recherche-Agent bekommt Websuche und Seitenleser als Werkzeuge, formuliert selbst Suchanfragen, liest Treffer, vergleicht und fasst zusammen. Der Chat auf deepseek.de hat keine Websuche; über die API lässt sich ein solcher Agent nach dem Muster von Test 1 bauen.
Automatisierung
Wiederkehrende Abläufe eignen sich besonders: Anfragen klassifizieren, Tabellen bereinigen, Berichte aus Datenbankabfragen erstellen, Tickets vorsortieren. Für einfache, klar strukturierte Schritte empfiehlt DeepSeek den Reasoning-Aufwand low, für den Agentenalltag high, für schwierige Fälle max. Frameworks wie OpenClaw oder Hermes binden DeepSeek über den OpenAI-kompatiblen Endpunkt ein, meist durch Ändern von Basis-URL, Schlüssel und Modellname.
So fangen Sie an
- Ohne Programmierung ausprobieren: Der Chat auf der Startseite läuft mit V4.1-Flash, der Chat unter /pro/ mit V4-Pro. Beide haben keine Werkzeuge, aber Planungsaufgaben wie in Test 2 zeigen, wie das Modell zerlegt und priorisiert. Wie sich die Modelle gegen OpenAI schlagen, steht im Beitrag DeepSeek vs. ChatGPT, weitere Antworten in den FAQ.
- Ersten Tool Call bauen: API-Schlüssel anlegen, das Skript aus Test 1 nachbauen, eigene Funktion definieren; die Grundlagen stehen im Beitrag DeepSeek-API: der Einstieg. Denken Sie an das Zurückgeben von
reasoning_contentund an ein ausreichend hohesmax_tokens. - Fertigen Agenten anschließen: Für Codex das Einrichtungsskript von DeepSeek nutzen, für Claude Code die Umgebungsvariablen
ANTHROPIC_BASE_URLundANTHROPIC_API_KEYsetzen. Beginnen Sie mitdeepseek-flash; V4-Pro lohnt sich erst, wenn Flash an einer konkreten Aufgabe scheitert.
Grenzen und Risiken
- Halluzination wird zu Handlung. Im Chat ist eine erfundene Angabe ein Fehler im Text, beim Agenten kann sie eine Datei löschen oder eine falsche E-Mail verschicken. Deshalb: Werkzeuge mit minimalen Rechten ausstatten, schreibende Aktionen bestätigen lassen, Ergebnisse prüfen. Das Modell vertraut seinen Werkzeugen; mit einem falschen Datum aus
get_datewäre es in Test 1 klaglos weitergelaufen. - Kosten wachsen mit dem Kontext. Abgerechnet wird nach Token, und ein Agent schickt bei jedem Schritt den gesamten bisherigen Verlauf erneut mit; bei langen Sitzungen dominiert die Eingabe. DeepSeek begegnet dem mit Context Caching (Cache-Treffer sind deutlich günstiger), günstigeren Nebenzeiten und bei V4.1-Flash mit einem stark verkleinerten KV-Cache; laut DeepSeek machen Cache-Treffer oft einen großen Teil der Agentenkosten aus. Aktuelle Konditionen: offizielle Preisseite.
- Reasoning frisst Budget. Wie unser Fehlversuch zeigt, kann das Nachdenken allein ein knappes
max_tokensaufbrauchen. Für einfache Schritte den Effort auflowsetzen oder Thinking abschalten. - Datenschutz. Anfragen im Chat auf deepseek.de gehen per API an DeepSeek, die Server stehen in China. Geben Sie keine personenbezogenen oder vertraulichen Daten ein; für eigene Agenten gilt das erst recht, weil sie Dateien und Datenbanken lesen (Details unter /datenschutz/). Wer Daten im Haus behalten muss, kann die offenen Gewichte selbst betreiben, braucht dafür aber passende Hardware.
- Modellwechsel einplanen. V4-Flash ist bereits abgelöst, V4-Pro bleibt nach einer zunächst angekündigten Abschaltung „bis auf Weiteres“ in der API, V4.1-Pro ist ohne Datum angekündigt. Hinterlegen Sie den Modellnamen in Ihrer Konfiguration an einer einzigen Stelle.
Häufige Fragen
Kann ich Agenten direkt im Chat auf deepseek.de nutzen?
Nein. Der Chat auf deepseek.de hat keine Werkzeuge, kein Internet und keinen Dateizugriff. Dort testen Sie Planung und Reasoning; für echte Agenten brauchen Sie die API oder Codex, Claude Code oder OpenCode mit DeepSeek als Modell.
Flash oder Pro für Agenten?
Starten Sie mit V4.1-Flash. Im Planungstest war es fast viermal schneller als V4-Pro bei gleichwertigem Ergebnis, in DeepSeeks Agenten-Benchmarks liegt es vorn. V4-Pro bleibt eine Option für Aufgaben, an denen Flash nachweislich scheitert.
Warum bekomme ich bei Tool Calls einen Fehler 400?
Meist fehlt reasoning_content in den zurückgeschickten Assistant-Nachrichten. Im Thinking-Modus mit tools verlangt die API den Gedankengang aller vorherigen Runden, auch aus Runden ohne Werkzeugaufruf. Am einfachsten hängen Sie die komplette Antwortnachricht unverändert an den Verlauf.
Funktionieren parallele Tool Calls?
Laut der Codex-Konfiguration von DeepSeek ja (supports_parallel_tool_calls: true). In unseren Tests rief das Modell nacheinander auf, weil der zweite Aufruf vom ersten abhing. Ihr Code sollte in jedem Fall mehrere Einträge in tool_calls verarbeiten können.
Quellen und Änderungen
- DeepSeek: Modellkarte DeepSeek-V4.1-Flash (Architektur, Nachtraining, Agenten-Benchmarks, Scaffolds)
- DeepSeek API-Dokumentation: Thinking Mode und Tool Calls, Anthropic-API, Integration mit Codex, Modelle und Preise
- DeepSeek News: V4-Pro GA (13.08.2026), V4.1-Flash (10.09.2026), Change Log
- Eigene Tests am 17.09.2026 über die DeepSeek-API (Tool-Call-Skript, Planungsaufgabe mit V4.1-Flash und V4-Pro, Dateisystem-Frage)
Änderungen: 17.09.2026 – Beitrag vollständig neu geschrieben und drei ältere Artikel zusammengeführt: „DeepSeek V4 stärkt offene KI-Agenten“ (Mai 2026), „DeepSeek V4 Pro startet mit stärkerer Agent-Leistung“ (August 2026) und „DeepSeek baut KI-Suche und Agenten aus“ (Februar 2026). Aktualisiert auf V4.1-Flash, Responses API und Anthropic-Format; Preview-Benchmarks und Preisabschnitt der alten Fassungen entfernt. Tool-Call-Skript, Planungstest und Chat-Beispiele wurden eigens für diese Fassung erstellt und ausgeführt.

