Abstrakte Darstellung eines KI-Modells mit API

DeepSeek V4 Pro startet mit stärkerer Agent-Leistung

DeepSeek-V4-Pro ist allgemein verfügbar und richtet sich stärker an produktive Agent-Anwendungen. Das Modell bietet steuerbaren Denkaufwand, eine Codex-Anbindung über die OpenAI-kompatible Responses API und ein neues API-Preismodell mit Peak- und Off-Peak-Tarifen.

Verfügbarkeit und Einsatzschwerpunkt

DeepSeek-V4-Pro ist in der App und im Web über den Expert Mode nutzbar. Zusätzlich steht das Modell über die API bereit. Die Modellnamen bleiben dabei unverändert, was bestehende Integrationen vereinfachen kann.

Der Schwerpunkt liegt auf Agent-Workflows. Damit sind Anwendungen gemeint, die Aufgaben in mehreren Schritten bearbeiten, Zwischenergebnisse prüfen und bei Bedarf externe Werkzeuge oder Funktionen aufrufen.

  • Zugang: V4-Pro ist über App, Web und API verfügbar.
  • Kompatibilität: Bestehende Modellnamen sollen unverändert bleiben.
  • Einsatzfeld: DeepSeek positioniert V4-Pro vor allem für Agent-Anwendungen mit höheren Anforderungen an Planung und Ausführung.

Steuerbarer Denkaufwand und API-Anbindung

DeepSeek führt für V4-Pro und V4-Flash einen steuerbaren Reasoning Effort ein. Entwickler können damit festlegen, wie viel Rechenaufwand das Modell für die interne Problemlösung verwenden soll.

Die Stufe low eignet sich für einfache Aufgaben. High ist für alltägliche Agent-Workflows vorgesehen. Max richtet sich an komplexere Aufgaben, bei denen gründlichere Zwischenschritte wichtiger sind als eine möglichst schnelle Antwort.

Zusätzlich unterstützt DeepSeek die OpenAI-kompatible Responses API nativ. Für Codex gibt es eine optimierte Einrichtung, die Integrationen mit geringem Konfigurationsaufwand ermöglichen soll.

Benchmark-Werte im Vergleich

Die Benchmark-Daten zeigen deutliche Zuwächse gegenüber den Preview-Versionen. Besonders stark fällt der Abstand bei Aufgaben aus, die Agenten, Softwareentwicklung oder mehrstufige Problemlösung prüfen.

Benchmark V4-Pro 0813 V4-Pro Preview V4-Flash 0813 V4-Flash Preview
HLE ohne und mit Tools 42,7 / 60,0 37,7 / 48,2 37,8 / 51,5 34,8 / 45,1
Terminal Bench 2.1 87,9 72,1 82,7 61,8
NL2Repo 61,5 38,5 54,2 39,4
Cybergym 83,3 52,7 76,7 38,7
DeepSWE 62,7 12,8 54,4 7,3
Toolathlon-Verified 74,1 55,9 70,3 49,7
Agents‘ Last Exam 25,7 16,5 25,2 15,8
AutomationBench Public 31,8 12,8 25,1 10,8
DSBench-FullStack 71,1 41,8 68,7 37,0
DSBench-Hard 67,2 31,1 59,6 25,8

Die größten Sprünge zeigen sich bei DeepSWE, AutomationBench Public und DSBench-Hard. Diese Werte deuten darauf hin, dass DeepSeek vor allem die praktische Nutzung in Entwickler- und Agent-Szenarien verbessern will.


Veröffentlicht

in

von

Schlagwörter: