Navigation
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Verglichene Modelle

Benchmark-Vergleich Kimi K2.6 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Claude Opus 4.7 (medium): Claude Opus 4.7 (medium) führt bei Punktzahl mit 8.7. Kimi K2.6 (medium) führt bei Zuverlässigkeit mit 10.0. GLM 5 (medium) hat den niedrigsten Gesamtkosten mit $0.228. Claude Opus 4.7 (medium) ist mit 7.62s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-09-10

Verglichene Modelle

Rang
#128
Gesamte Ausgabe-Token
347,519
Antwortzeit (Durchschnitt)
115.89s
Gesamtkosten
$1.247
Rang
#147
Gesamte Ausgabe-Token
220,942
Antwortzeit (Durchschnitt)
98.19s
Gesamtkosten
$0.479
Rang
#92
Gesamte Ausgabe-Token
124,566
Antwortzeit (Durchschnitt)
33.54s
Gesamtkosten
$0.228
Rang
#43
Gesamte Ausgabe-Token
29,990
Antwortzeit (Durchschnitt)
7.62s
Gesamtkosten
$1.476
Empfohlenes Modell Claude Opus 4.7 (medium)

Es hat hier die beste Punktzahl (8.7) und antwortet etwa 10.8x schneller als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik Kimi K2.6 Kimi K2.6 medium Veröffentlichung: 2026-04-20 Kimi K2.5 Kimi K2.5 medium Veröffentlichung: 2026-01-27 GLM 5 GLM 5 medium Veröffentlichung: 2026-02-12 Claude Opus 4.7 Claude Opus 4.7 medium Veröffentlichung: 2026-04-16
Punktzahl 7.2 7.0 7.7 8.7
Rang #128 #147 #92 #43
Zuverlässigkeit 10.0 10.0 10.0 10.0
Konsistenz 8.3 7.0 8.1 9.6
Versuche 66/66 66/66 63/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 63.6% 63.6% 78.8% 83.3%
Instabile Tests 4 8 4 1
Gesamtläufe 66 66 63 66
Kosten pro Ergebnis 10.029 4.849 1.668 8.200
Gesamtkosten $1.247 $0.479 $0.228 $1.476
Eingabepreis $0.950 / 1M $0.450 / 1M $0.600 / 1M $5.000 / 1M
Ausgabepreis $4.000 / 1M $2.250 / 1M $1.920 / 1M $25.000 / 1M
Gesamte Eingabe-Token 68,913 118,496 35,224 145,249
Ausgabe-Token 64,654 53,522 21,570 24,948
Denk-Token 282,865 167,420 102,996 5,042
Antwortzeit (Durchschnitt) 115.89s 98.19s 33.54s 7.62s
Antwortzeit (Maximum) 876.20s 281.00s 99.85s 65.40s
Antwortzeit (Gesamt) 2433.66s 1571.05s 435.99s 159.94s
Parameter 1T insgesamt (32B aktiv) 1T insgesamt (32B aktiv) 744B insgesamt (40B aktiv) ~5T insgesamt (~500B aktiv)
Verfügbarkeit Gewichte verfügbar Gewichte verfügbar Open Source Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#128 MoonshotAI: Kimi K2.6

medium
Kosten
$0.013
Zeit
103.4s
Token
3,620 tok

#147 MoonshotAI: Kimi K2.5

medium
Kosten
$0.030
Zeit
58.6s
Token
8,683 tok

#92 GLM 5

medium
Kosten
$0.005
Zeit
20.7s
Token
2,068 tok

#43 Claude Opus 4.7

medium
Kosten
$0.059
Zeit
26.8s
Token
2,475 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Schnellvergleich

Vergleichspaar wechseln