DeepSeek-V4-Pro ist allgemein verfügbar und richtet sich stärker an produktive Agent-Anwendungen. Das Modell bietet steuerbaren Denkaufwand, eine Codex-Anbindung über die OpenAI-kompatible Responses API und ein neues API-Preismodell mit Peak- und Off-Peak-Tarifen.
Verfügbarkeit und Einsatzschwerpunkt
DeepSeek-V4-Pro ist in der App und im Web über den Expert Mode nutzbar. Zusätzlich steht das Modell über die API bereit. Die Modellnamen bleiben dabei unverändert, was bestehende Integrationen vereinfachen kann.
Der Schwerpunkt liegt auf Agent-Workflows. Damit sind Anwendungen gemeint, die Aufgaben in mehreren Schritten bearbeiten, Zwischenergebnisse prüfen und bei Bedarf externe Werkzeuge oder Funktionen aufrufen.
- Zugang: V4-Pro ist über App, Web und API verfügbar.
- Kompatibilität: Bestehende Modellnamen sollen unverändert bleiben.
- Einsatzfeld: DeepSeek positioniert V4-Pro vor allem für Agent-Anwendungen mit höheren Anforderungen an Planung und Ausführung.
Steuerbarer Denkaufwand und API-Anbindung
DeepSeek führt für V4-Pro und V4-Flash einen steuerbaren Reasoning Effort ein. Entwickler können damit festlegen, wie viel Rechenaufwand das Modell für die interne Problemlösung verwenden soll.
Die Stufe low eignet sich für einfache Aufgaben. High ist für alltägliche Agent-Workflows vorgesehen. Max richtet sich an komplexere Aufgaben, bei denen gründlichere Zwischenschritte wichtiger sind als eine möglichst schnelle Antwort.
Zusätzlich unterstützt DeepSeek die OpenAI-kompatible Responses API nativ. Für Codex gibt es eine optimierte Einrichtung, die Integrationen mit geringem Konfigurationsaufwand ermöglichen soll.
Benchmark-Werte im Vergleich
Die Benchmark-Daten zeigen deutliche Zuwächse gegenüber den Preview-Versionen. Besonders stark fällt der Abstand bei Aufgaben aus, die Agenten, Softwareentwicklung oder mehrstufige Problemlösung prüfen.
| Benchmark | V4-Pro 0813 | V4-Pro Preview | V4-Flash 0813 | V4-Flash Preview |
|---|---|---|---|---|
| HLE ohne und mit Tools | 42,7 / 60,0 | 37,7 / 48,2 | 37,8 / 51,5 | 34,8 / 45,1 |
| Terminal Bench 2.1 | 87,9 | 72,1 | 82,7 | 61,8 |
| NL2Repo | 61,5 | 38,5 | 54,2 | 39,4 |
| Cybergym | 83,3 | 52,7 | 76,7 | 38,7 |
| DeepSWE | 62,7 | 12,8 | 54,4 | 7,3 |
| Toolathlon-Verified | 74,1 | 55,9 | 70,3 | 49,7 |
| Agents‘ Last Exam | 25,7 | 16,5 | 25,2 | 15,8 |
| AutomationBench Public | 31,8 | 12,8 | 25,1 | 10,8 |
| DSBench-FullStack | 71,1 | 41,8 | 68,7 | 37,0 |
| DSBench-Hard | 67,2 | 31,1 | 59,6 | 25,8 |
Die größten Sprünge zeigen sich bei DeepSWE, AutomationBench Public und DSBench-Hard. Diese Werte deuten darauf hin, dass DeepSeek vor allem die praktische Nutzung in Entwickler- und Agent-Szenarien verbessern will.

