Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Verglichene Modelle

Benchmark-Vergleich Claude Sonnet 4.6 (medium) vs Claude Sonnet 5 (medium) vs Claude Opus 4.8 (medium) vs GLM 5.2 (medium): Claude Opus 4.8 (medium) führt bei Punktzahl mit 8.8. Claude Sonnet 4.6 (medium) führt bei Zuverlässigkeit mit 10.0. GLM 5.2 (medium) hat den niedrigsten Gesamtkosten mit $0.146. Claude Sonnet 5 (medium) ist mit 12.54s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-08-14

Rang
#65
Gesamte Ausgabe-Token
120,427
Antwortzeit (Durchschnitt)
28.08s
Gesamtkosten
$2.126
Rang
#46
Gesamte Ausgabe-Token
63,204
Antwortzeit (Durchschnitt)
12.54s
Gesamtkosten
$0.922
Rang
#26
Gesamte Ausgabe-Token
51,927
Antwortzeit (Durchschnitt)
12.97s
Gesamtkosten
$1.983
Rang
#63
Gesamte Ausgabe-Token
61,761
Antwortzeit (Durchschnitt)
23.28s
Gesamtkosten
$0.146
Empfohlenes Modell GLM 5.2 (medium)

Es bietet den besten Gesamtkompromiss: wettbewerbsfähige Punktzahl (7.8), niedrigere Kosten als die anderen Modelle in diesem Vergleich und ausgewogene Antwortzeit.

Detaillierter Vergleich

Metrik Claude Sonnet 4.6 Claude Sonnet 4.6 medium Veröffentlichung: 2026-02-17 Claude Sonnet 5 Claude Sonnet 5 medium Veröffentlichung: 2026-06-30 Claude Opus 4.8 Claude Opus 4.8 medium Veröffentlichung: 2026-05-28 GLM 5.2 GLM 5.2 medium Veröffentlichung: 2026-06-17
Punktzahl 7.8 8.2 8.8 7.8
Rang #65 #46 #26 #63
Zuverlässigkeit 10.0 10.0 10.0 9.5
Konsistenz 9.5 9.0 9.2 8.0
Versuche 66/66 66/66 66/66 63/66
Korrekte Tests
Erfolgsquote pro Versuch 65.2% 75.8% 83.3% 80.3%
Instabile Tests 1 3 2 4
Gesamtläufe 66 66 66 63
Kosten pro Ergebnis 15.182 6.144 11.662 2.159
Gesamtkosten $2.126 $0.922 $1.983 $0.146
Eingabepreis $3.000 / 1M $2.000 / 1M $5.000 / 1M $0.630 / 1M
Ausgabepreis $15.000 / 1M $10.000 / 1M $25.000 / 1M $1.981 / 1M
Gesamte Eingabe-Token 106,316 145,953 138,448 37,199
Ausgabe-Token 79,338 52,330 40,765 12,261
Denk-Token 41,089 10,874 11,162 49,500
Antwortzeit (Durchschnitt) 28.08s 12.54s 12.97s 23.28s
Antwortzeit (Maximum) 140.96s 66.71s 70.54s 101.36s
Antwortzeit (Gesamt) 421.15s 275.90s 285.29s 488.94s
Parameter ~1T insgesamt (~100B aktiv) ~1T insgesamt (~100B aktiv) ~5T insgesamt (~500B aktiv) 744B insgesamt (40B aktiv)
Verfügbarkeit Geschlossen Geschlossen Geschlossen Open Source

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#65 Claude Sonnet 4.6

medium
Ungültiges SVG
Kosten
$0.000
Zeit
300.0s
Token
0 tok

#46 Claude Sonnet 5

medium
Kosten
$0.007
Zeit
6.4s
Token
832 tok

#26 Claude Opus 4.8

medium
Kosten
$0.057
Zeit
23.1s
Token
2,412 tok

#63 GLM 5.2

medium
Kosten
$0.041
Zeit
195.8s
Token
9,287 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
Claude Sonnet 5 9.0 7.9 88.9% 1 17.28s 10,590 13,153 2,379
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
GLM 5.2 8.2 7.2 88.9% 1 40.96s 7,317 1,475 17,123

Schnellvergleich

Vergleichspaar wechseln