Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Verglichene Modelle

Benchmark-Vergleich Kimi K2.6 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Claude Opus 4.7 (medium): Claude Opus 4.7 (medium) führt bei Punktzahl mit 8.7. Kimi K2.5 (medium) führt bei Zuverlässigkeit mit 10.0. GLM 5 (medium) hat den niedrigsten Gesamtkosten mit $0.307. Claude Opus 4.7 (medium) ist mit 7.61s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-07-28

Rang
#78
Gesamte Ausgabe-Token
391,540
Antwortzeit (Durchschnitt)
109.98s
Gesamtkosten
$0.831
Rang
#87
Gesamte Ausgabe-Token
227,367
Antwortzeit (Durchschnitt)
99.00s
Gesamtkosten
$0.600
Rang
#50
Gesamte Ausgabe-Token
124,566
Antwortzeit (Durchschnitt)
33.54s
Gesamtkosten
$0.307
Rang
#20
Gesamte Ausgabe-Token
29,990
Antwortzeit (Durchschnitt)
7.61s
Gesamtkosten
$1.477
Empfohlenes Modell Claude Opus 4.7 (medium)

Es hat hier die beste Punktzahl (8.7) und antwortet etwa 10.6x schneller als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik Kimi K2.6 Kimi K2.6 medium Veröffentlichung: 2026-04-20 Kimi K2.5 Kimi K2.5 medium Veröffentlichung: 2026-01-27 GLM 5 GLM 5 medium Veröffentlichung: 2026-02-12 Claude Opus 4.7 Claude Opus 4.7 medium Veröffentlichung: 2026-04-16
Punktzahl 7.2 7.0 7.7 8.7
Rang #78 #87 #50 #20
Zuverlässigkeit 9.4 10.0 10.0 10.0
Konsistenz 8.3 7.0 8.1 9.6
Korrekte Tests
Erfolgsquote pro Versuch 63.6% 65.2% 78.8% 83.3%
Instabile Tests 4 8 4 1
Gesamtläufe 66 66 63 66
Kosten pro Ergebnis 9.821 4.789 1.668 8.201
Gesamtkosten $0.831 $0.600 $0.307 $1.477
Eingabepreis $0.646 / 1M $0.571 / 1M $0.950 / 1M $5.000 / 1M
Ausgabepreis $2.720 / 1M $2.850 / 1M $2.551 / 1M $25.000 / 1M
Gesamte Eingabe-Token 68,902 118,448 35,224 145,252
Ausgabe-Token 111,680 62,124 21,570 24,948
Denk-Token 279,860 165,243 102,996 5,042
Antwortzeit (Durchschnitt) 109.98s 99.00s 33.54s 7.61s
Antwortzeit (Maximum) 876.20s 281.00s 99.85s 65.40s
Antwortzeit (Gesamt) 2309.56s 1485.04s 435.99s 159.91s

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 MoonshotAI: Kimi K2.6

medium
Kosten
$0.013
Zeit
103.4s
Token
3,620 tok

#87 MoonshotAI: Kimi K2.5

medium
Kosten
$0.030
Zeit
58.6s
Token
8,683 tok

#50 GLM 5

medium
Kosten
$0.005
Zeit
20.7s
Token
2,068 tok

#20 Claude Opus 4.7

medium
Kosten
$0.059
Zeit
26.8s
Token
2,475 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Schnellvergleich

Vergleichspaar wechseln