Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Verglichene Modelle

Benchmark-Vergleich MiniMax M2.7 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Gemini 3.1 Flash Lite Preview (medium): GLM 5 (medium) führt bei Punktzahl mit 7.7. MiniMax M2.7 (medium) führt bei Zuverlässigkeit mit 10.0. Gemini 3.1 Flash Lite Preview (medium) hat den niedrigsten Gesamtkosten mit $0.115. Gemini 3.1 Flash Lite Preview (medium) ist mit 4.61s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-08-07

Rang
#205
Gesamte Ausgabe-Token
137,594
Antwortzeit (Durchschnitt)
41.28s
Gesamtkosten
$0.176
Rang
#97
Gesamte Ausgabe-Token
227,367
Antwortzeit (Durchschnitt)
99.00s
Gesamtkosten
$0.600
Rang
#59
Gesamte Ausgabe-Token
124,566
Antwortzeit (Durchschnitt)
33.54s
Gesamtkosten
$0.307
Rang
#82
Gesamte Ausgabe-Token
56,983
Antwortzeit (Durchschnitt)
4.61s
Gesamtkosten
$0.115
Empfohlenes Modell Gemini 3.1 Flash Lite Preview (medium)

Die Punktzahl bleibt nah an der besten hier (7.3 vs 7.7) und es kostet etwa 3.1x weniger als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik MiniMax M2.7 MiniMax M2.7 medium Veröffentlichung: 2026-03-18 Kimi K2.5 Kimi K2.5 medium Veröffentlichung: 2026-01-27 GLM 5 GLM 5 medium Veröffentlichung: 2026-02-12 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Veröffentlichung: 2026-03-03
Punktzahl 5.0 7.0 7.7 7.3
Rang #205 #97 #59 #82
Zuverlässigkeit 10.0 10.0 10.0 10.0
Konsistenz 6.6 7.0 8.1 9.9
Benchmark-Abdeckung 22/22 Tests · 66/66 Versuche 22/22 Tests · 66/66 Versuche 21/22 Tests · 63/66 Versuche 22/22 Tests · 66/66 Versuche
Korrekte Tests
Erfolgsquote pro Versuch 45.5% 65.2% 78.8% 59.1%
Instabile Tests 9 8 4 0
Gesamtläufe 66 66 63 66
Kosten pro Ergebnis 3.906 4.789 1.668 0.884
Gesamtkosten $0.176 $0.600 $0.307 $0.115
Eingabepreis $0.270 / 1M $0.571 / 1M $0.950 / 1M $0.250 / 1M
Ausgabepreis $1.080 / 1M $2.850 / 1M $2.551 / 1M $1.500 / 1M
Gesamte Eingabe-Token 114,518 118,448 35,224 117,480
Ausgabe-Token 18,558 62,124 21,570 10,589
Denk-Token 119,036 165,243 102,996 46,394
Antwortzeit (Durchschnitt) 41.28s 99.00s 33.54s 4.61s
Antwortzeit (Maximum) 196.21s 281.00s 99.85s 18.34s
Antwortzeit (Gesamt) 866.81s 1485.04s 435.99s 101.39s

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#205 MiniMax M2.7

medium
Kosten
$0.022
Zeit
22.8s
Token
9,250 tok

#97 MoonshotAI: Kimi K2.5

medium
Kosten
$0.030
Zeit
58.6s
Token
8,683 tok

#59 GLM 5

medium
Kosten
$0.005
Zeit
20.7s
Token
2,068 tok

#82 Gemini 3.1 Flash Lite Preview

medium
Kosten
$0.003
Zeit
5.2s
Token
1,944 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
MiniMax M2.7 5.7 9.1 33.3% 0 101.89s 2,961 1,231 38,841
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 4.09s 8,126 461 8,597

Schnellvergleich

Vergleichspaar wechseln