AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#91

DeepSeek V4 Pro

DeepSeek Veröffentlichung: 2026-04-24 Getestet am: 2026-08-14 03:17 deepseek/deepseek-v4-pro::high
1.6T insgesamt (49B aktiv)MoEOpen Source
(high) (none)

Zusammenfassung

DeepSeek V4 Pro erreicht 7.7 bei AI BENCHY und liegt auf #91. Das Modell hat 10.0 Zuverlässigkeit, 63.6% Erfolgsrate, $0.454 Gesamtkosten und 92.50s durchschnittliche Antwortzeit.

Modelldaten

Recherchiert am 2026-08-12

Angegeben
Parameter
1.6T insgesamt (49B aktiv)
Architektur
MoE
Verfügbarkeit
Open Source
Lizenz
MIT

Punktzahl

7.7

Konsistenz

7.7

Gesamtkosten (aktueller Preis)

$0.454 ↑ +101.7%

Getestet zu: $0.226

Gesamte Ausgabe-Token

209,444

Gesamte Eingabe-Token

90,757

Eingabepreis

$0.956 / 1M

Ausgabepreis

$1.911 / 1M

Korrekte Tests

Falsche Tests: 12

Erfolgsquote pro Versuch: 63.6%

Instabile Tests

6

Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).

Antwortzeit (Durchschnitt)

92.50s

Antwortzeit (Maximum): 416.76s

Antwortzeit (Gesamt): 2035.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#91 DeepSeek V4 Pro

high
Kosten
$0.023
Zeit
257.6s
Token
14,870 tok

Testverlauf

Getestet am Punktzahl Zuverlässigkeit Korrekte Tests Gesamtkosten Vergleichen
2026-08-14 03:17 Erneuter Test 7.7 10.0 $0.454 Aktueller Lauf
2026-07-16 23:19 Neuer Test hinzugefügt 7.7 10.0 $0.200 Vergleichen
2026-06-16 15:31 Erneuter Test 7.6 9.3 $0.157 Vergleichen
2026-06-16 14:47 Suite geändert 8.1 9.6 $0.098 Vergleichen
2026-06-04 14:38 Neuer Test hinzugefügt 6.0 8.9 $0.079 Vergleichen
2026-05-22 00:54 Suite geändert 6.6 9.0 $0.212 Vergleichen
2026-04-29 14:47 Erneuter Test 7.5 9.3 $0.209 Vergleichen
2026-04-26 10:50 Erneuter Test 7.5 8.4 $0.201 Vergleichen
2026-04-25 21:53 Erster Lauf 8.2 k. A. $0.329 Vergleichen

Dieser Lauf nutzte eine andere Benchmark-Suite. Berücksichtige Suite-Änderungen bei der historischen Einordnung.

Laufvergleich

LaufBenchmark-AbdeckungPunktzahlKonsistenzZuverlässigkeitKorrekte TestsInstabile TestsGesamte Ausgabe-TokenGesamte Eingabe-TokenGesamtkostenAntwortzeit (Durchschnitt)
2026-08-14 03:17 · Aktueller Lauf66/66 Versuche7.77.710.010/226209,44490,757$0.45492.50s
2026-06-04 14:38 · Neuer Test hinzugefügt63/63 Versuche6.07.38.98/21784,50732,240$0.07965.21s
Differenz+1.6+0.4+1.1+2-1+124937+58517+$0.376+27291ms

Die Benchmark-Abdeckung unterscheidet sich: 66/66 Versuche (Ziel: 3 Wiederholungen pro Test) gegenüber 63/63 Versuche (Ziel: 3 Wiederholungen pro Test). Summen und wiederholungsabhängige Metriken sind nicht direkt vergleichbar.

Diese beiden Läufe nutzten unterschiedliche Benchmark-Suiten, daher spiegeln die Deltas sowohl Modell- als auch Suite-Änderungen wider.

Preisverlauf

Historische Preisdaten für dieses Modell von OpenRouter.

Datum Eingabepreis Ausgabepreis
2026-06-16 14:59 $0.435 / 1M $0.870 / 1M
2026-08-11 09:41 $0.632 / 1M $1.264 / 1M
2026-08-14 12:51 $1.169 / 1M $2.337 / 1M
2026-09-07 14:42 $0.956 / 1M $1.911 / 1M

Diagramme

Wähle zuerst das erste Modell und klicke dann ein zweites Modell, um eine Seite im direkten Vergleich zu öffnen.

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Schnellvergleich

Kategorieaufschlüsselung

Kategorie Punktzahl Konsistenz Korrekte Tests
Anti-KI-Tricks 5.7 5.9
Programmierung 6.3 8.7
Kombiniert 10.0 10.0
Datenanalyse und -extraktion 10.0 10.0
Domänenspezifisch 3.6 7.2
Allgemeine Intelligenz 10.0 10.0
Befolgung von Anweisungen 7.8 6.6
Rätsellösen 6.9 4.9
Werkzeugaufrufe 9.8 10.0
Allgemeinwissen 3.0 10.0

Verglichene Modelle