Navigation
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Sonnet 5 vs DeepSeek: DeepSeek V4 Flash

Zusammenfassung

Claude Sonnet 5 vs DeepSeek V4 Flash Benchmark-Vergleich: DeepSeek V4 Flash führt beim Durchschnittsscore mit 8.3 vs 7.9. DeepSeek V4 Flash hat die niedrigeren Benchmark-Kosten mit $0.029 vs $0.550. Claude Sonnet 5 ist schneller mit 9.94s vs 45.85s, mit Erfolgsraten von 79.4% vs 74.6%.

Empfohlenes Modell: DeepSeek V4 Flash - Es hat hier die beste Punktzahl (8.3) und kostet etwa 19.3x weniger als Claude Sonnet 5.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-30

Metrik Claude Sonnet 5 Claude Sonnet 5 medium Veröffentlichung: 2026-06-30 DeepSeek V4 Flash DeepSeek V4 Flash high Veröffentlichung: 2026-04-24
Punktzahl 7.9 8.3
Rang #30 #23
Zuverlässigkeit 10.0 10.0
Konsistenz 9.0 8.5
Korrekte Tests
Erfolgsquote pro Versuch 79.4% 74.6%
Instabile Tests 3 4
Gesamtläufe 63 63
Kosten pro Ergebnis 3.662 0.299
Gesamtkosten $0.550 $0.029
Eingabepreis $2.000 / 1M $0.098 / 1M
Ausgabepreis $10.000 / 1M $0.196 / 1M
Gesamte Eingabe-Token 67,416 39,745
Ausgabe-Token 34,012 10,310
Denk-Token 7,673 123,501
Antwortzeit (Durchschnitt) 9.94s 45.85s
Antwortzeit (Maximum) 56.94s 218.13s
Antwortzeit (Gesamt) 208.71s 962.79s

Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#30 Claude Sonnet 5

medium
Kosten
$0.007
Zeit
6.4s
Token
832 tok

#23 DeepSeek V4 Flash

high
Kosten
$0.003
Zeit
93.1s
Token
7,926 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 10.0 10.0 100.0% 0 3.80s 834 1,220 446
DeepSeek V4 Flash 8.3 10.0 75.0% 0 28.51s 540 140 7,770
Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 9.0 7.9 88.9% 1 17.28s 10,590 13,153 2,379
DeepSeek V4 Flash 7.8 10.0 66.7% 0 50.60s 7,279 395 34,862
Kombiniert Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 4.5 2.1 66.7% 1 37.01s 29,394 4,848 2,170
DeepSeek V4 Flash 10.0 10.0 100.0% 0 76.57s 14,016 465 7,347
Datenanalyse und -extraktion Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 10.0 10.0 100.0% 0 3.16s 10,503 312 0
DeepSeek V4 Flash 10.0 10.0 100.0% 0 28.03s 7,290 201 1,179
Domänenspezifisch Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 7.7 10.0 66.7% 0 20.38s 975 12,140 1,994
DeepSeek V4 Flash 4.1 4.4 44.5% 2 100.31s 666 27 59,249
Allgemeine Intelligenz Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 4.8 3.2 33.3% 1 4.32s 708 264 0
DeepSeek V4 Flash 6.1 3.1 66.7% 1 25.15s 471 79 632
Befolgung von Anweisungen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 9.9 10.0 100.0% 0 3.10s 909 318 269
DeepSeek V4 Flash 10.0 10.0 100.0% 0 15.36s 627 63 1,622
Rätsellösen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 7.7 10.0 66.7% 0 2.98s 894 407 121
DeepSeek V4 Flash 8.2 7.2 88.9% 1 26.11s 594 196 1,767
Werkzeugaufrufe Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 10.0 10.0 100.0% 0 10.70s 12,351 433 90
DeepSeek V4 Flash 10.0 10.0 100.0% 0 74.73s 8,079 228 542
Allgemeinwissen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 5 3.0 10.0 0.0% 0 7.06s 258 917 204
DeepSeek V4 Flash 3.0 10.0 0.0% 0 54.46s 183 8,516 8,531

Schnellvergleich

Vergleichspaar wechseln