- Rang
- #80
- Gesamte Ausgabe-Token
- 67,842
- Antwortzeit (Durchschnitt)
- 16.72s
- Gesamtkosten
- $3.490
Claude Opus 4.8 (medium) vs DeepSeek V4 Flash 0731 (high)
DeepSeek V4 Flash 0731 (high) führt beim Durchschnittsscore mit 8.4 vs 8.3. DeepSeek V4 Flash 0731 (high) hat die niedrigeren Benchmark-Kosten mit $0.578 vs $3.490. Claude Opus 4.8 (medium) ist schneller mit 16.72s vs 118.83s, mit Erfolgsraten von 82.6% vs 76.8%.
Verglichene Modelle
- Rang
- #74
- Gesamte Ausgabe-Token
- 532,511
- Antwortzeit (Durchschnitt)
- 118.83s
- Gesamtkosten
- $0.578
Empfohlenes Modell
DeepSeek V4 Flash 0731 (high)
Es hat hier die beste Punktzahl (8.4) und kostet etwa 6.0x weniger als Claude Opus 4.8 (medium).
Detaillierter Vergleich
| Metrik | Claude Opus 4.8 Claude Opus 4.8 medium | DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 high |
|---|---|---|
| Punktzahl | 8.3 | 8.4 |
| Rang | #80 | #74 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.0 | 8.1 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 82.6% | 76.8% |
| Instabile Tests | 3 | 5 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 20.527 | 1.069 |
| Gesamtkosten | $3.490 | $0.578 |
| Eingabepreis | $5.000 / 1M | $0.010 / 1M |
| Ausgabepreis | $25.000 / 1M | $1.280 / 1M |
| Gesamte Eingabe-Token | 360,294 | 281,863 |
| Ausgabe-Token | 43,441 | 24,535 |
| Denk-Token | 24,401 | 507,976 |
| Antwortzeit (Durchschnitt) | 16.72s | 118.83s |
| Antwortzeit (Maximum) | 99.37s | 600.61s |
| Antwortzeit (Gesamt) | 384.66s | 2733.01s |
| Parameter | ~5T insgesamt (~500B aktiv) | 284B insgesamt (13B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#80 Claude Opus 4.8
medium- Kosten
- $0.057
- Zeit
- 23.1s
- Token
- 2,412 tok
#74 DeepSeek V4 Flash 0731
high
No output was saved. The original provider response or failure reason is unavailable.
- Kosten
- $0.000
- Zeit
- 187.3s
- Token
- 19,048 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.1 | 3.1 | 66.7% | 1 | 99.37s | 221,846 | 2,676 | 13,239 | |
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 204.36s | 185,161 | 7,569 | 11,635 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.95s | 834 | 1,179 | 478 | |
| DeepSeek V4 Flash 0731 | 8.7 | 7.9 | 91.7% | 1 | 13.62s | 1,488 | 542 | 10,576 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 15.33s | 10,590 | 9,945 | 1,381 | |
| DeepSeek V4 Flash 0731 | 6.3 | 6.3 | 55.6% | 1 | 252.67s | 7,044 | 2,160 | 191,210 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.9 | 10.0 | 100.0% | 0 | 54.29s | 101,005 | 19,531 | 4,762 | |
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 87.10s | 67,283 | 11,903 | 41,397 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 7.1 | 5.6 | 83.3% | 1 | 12.29s | 10,503 | 481 | 312 | |
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 3.65s | 7,764 | 336 | 1,259 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.6 | 7.2 | 22.2% | 1 | 18.11s | 972 | 7,476 | 2,987 | |
| DeepSeek V4 Flash 0731 | 3.5 | 4.4 | 33.3% | 2 | 458.65s | 700 | 104 | 215,629 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 2.46s | 708 | 237 | 0 | |
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 5.64s | 708 | 72 | 533 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.32s | 909 | 373 | 320 | |
| DeepSeek V4 Flash 0731 | 9.8 | 10.0 | 100.0% | 0 | 4.46s | 1,101 | 119 | 939 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.95s | 894 | 791 | 483 | |
| DeepSeek V4 Flash 0731 | 8.2 | 7.7 | 77.8% | 1 | 9.36s | 1,305 | 397 | 6,801 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 8.96s | 11,775 | 301 | 225 | |
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 5.42s | 8,889 | 357 | 451 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 6.14s | 258 | 451 | 214 | |
| DeepSeek V4 Flash 0731 | 3.0 | 10.0 | 0.0% | 0 | 110.63s | 420 | 976 | 27,546 |
Schnellvergleich
Vergleichspaar wechseln
Claude Opus 4.8mediumvsGrok 4.5highClaude Opus 4.8mediumvsKimi K3maxDeepSeek V4 Flash 0731highvsGemini 3.1 Pro PreviewmediumClaude Opus 4.8mediumvsGemini 3.5 FlashhighDeepSeek V4 Flash 0731highvsMuse Glimmer 30BxhighDeepSeek V4 Flash 0731highvsGPT-5 MinimediumClaude Opus 4.8mediumvsGPT-5.6 TerrahighDeepSeek V4 Flash 0731highvsQwen3.8 2.4T A95BlowDeepSeek V4 Flash 0731highvsKimi K3maxClaude Opus 4.8mediumvsGLM 5.2highDeepSeek V4 Flash 0731highvsGPT-6 LunamediumDeepSeek V4 Flash 0731highvsQwen3.7 Plusmedium