Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Claude Opus 5 (medium) vs Gemini 3.7 Flash (high)

Gemini 3.7 Flash (high) führt beim Durchschnittsscore mit 9.8 vs 9.2. Gemini 3.7 Flash (high) hat die niedrigeren Benchmark-Kosten mit $0.313 vs $1.486. Claude Opus 5 (medium) ist schneller mit 9.38s vs 11.74s, mit Erfolgsraten von 83.3% vs 93.9%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-08-14

Rang
#14
Gesamte Ausgabe-Token
32,603
Antwortzeit (Durchschnitt)
9.38s
Gesamtkosten
$1.486
Rang
#3
Gesamte Ausgabe-Token
149,130
Antwortzeit (Durchschnitt)
11.74s
Gesamtkosten
$0.313
Empfohlenes Modell Gemini 3.7 Flash (high)

Es hat hier die beste Punktzahl (9.8) und kostet etwa 4.8x weniger als Claude Opus 5 (medium).

Detaillierter Vergleich

Metrik Claude Opus 5 Claude Opus 5 medium Veröffentlichung: 2026-07-25 Gemini 3.7 Flash Gemini 3.7 Flash high Veröffentlichung: 2026-08-14
Punktzahl 9.2 9.8
Rang #14 #3
Zuverlässigkeit 10.0 10.0
Konsistenz 9.6 9.6
Versuche 66/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 83.3% 93.9%
Instabile Tests 1 1
Gesamtläufe 66 66
Kosten pro Ergebnis 8.253 1.561
Gesamtkosten $1.486 $0.313
Eingabepreis $5.000 / 1M $0.375 / 1M
Ausgabepreis $25.000 / 1M $1.875 / 1M
Gesamte Eingabe-Token 135,607 86,703
Ausgabe-Token 25,673 6,017
Denk-Token 6,930 143,113
Antwortzeit (Durchschnitt) 9.38s 11.74s
Antwortzeit (Maximum) 35.05s 91.63s
Antwortzeit (Gesamt) 206.26s 258.24s
Parameter ~5T insgesamt (~500B aktiv) ~500B insgesamt (~20B aktiv)
Verfügbarkeit Geschlossen Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#14 Claude Opus 5

medium
Kosten
$0.125
Zeit
69.3s
Token
5,134 tok

#3 Gemini 3.7 Flash

high
Ungültiges SVG
Kosten
$0.039
Zeit
100.5s
Token
20,824 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Opus 5 10.0 10.0 100.0% 0 9.56s 10,590 5,224 1,162
Gemini 3.7 Flash 10.0 10.0 100.0% 0 13.55s 8,118 460 26,859

Schnellvergleich

Vergleichspaar wechseln