Navigation
Advertise here

Verglichene Modelle

Benchmark-Vergleich MiniMax M2.7 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Gemini 3.1 Flash Lite Preview (medium): GLM 5 (medium) führt bei Punktzahl mit 7.2. MiniMax M2.7 (medium) führt bei Zuverlässigkeit mit 10.0. Gemini 3.1 Flash Lite Preview (medium) hat den niedrigsten Gesamtkosten mit $0.158. Gemini 3.1 Flash Lite Preview (medium) ist mit 6.78s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-10-01

Verglichene Modelle

Rang
#298
Gesamte Ausgabe-Token
174,351
Antwortzeit (Durchschnitt)
50.32s
Gesamtkosten
$0.202
Rang
#205
Gesamte Ausgabe-Token
241,096
Antwortzeit (Durchschnitt)
125.76s
Gesamtkosten
$0.603
Rang
#146
Gesamte Ausgabe-Token
138,257
Antwortzeit (Durchschnitt)
39.05s
Gesamtkosten
$0.360
Rang
#155
Gesamte Ausgabe-Token
59,534
Antwortzeit (Durchschnitt)
6.78s
Gesamtkosten
$0.158
Empfohlenes Modell Gemini 3.1 Flash Lite Preview (medium)

Die Punktzahl bleibt nah an der besten hier (7.0 vs 7.2) und es kostet etwa 2.5x weniger als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik MiniMax M2.7 MiniMax M2.7 medium Veröffentlichung: 2026-03-18 Kimi K2.5 Kimi K2.5 medium Veröffentlichung: 2026-01-27 GLM 5 GLM 5 medium Veröffentlichung: 2026-02-12 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Veröffentlichung: 2026-03-03
Punktzahl 5.0 6.4 7.2 7.0
Rang #298 #205 #146 #155
Zuverlässigkeit 10.0 9.6 10.0 10.0
Konsistenz 6.4 7.1 7.9 9.9
Versuche 69/69 69/69 66/69 69/69
Korrekte Tests
Erfolgsquote pro Versuch 44.9% 60.9% 76.8% 60.9%
Instabile Tests 10 8 5 0
Gesamtläufe 69 69 66 69
Kosten pro Ergebnis 5.279 6.085 2.552 1.124
Gesamtkosten $0.202 $0.603 $0.360 $0.158
Eingabepreis $0.210 / 1M $0.450 / 1M $0.600 / 1M $0.250 / 1M
Ausgabepreis $0.840 / 1M $2.250 / 1M $1.920 / 1M $1.500 / 1M
Gesamte Eingabe-Token 277,130 292,271 212,440 272,221
Ausgabe-Token 45,188 55,025 22,922 12,345
Denk-Token 129,163 186,071 115,335 47,189
Antwortzeit (Durchschnitt) 50.32s 125.76s 39.05s 6.78s
Antwortzeit (Maximum) 198.82s 566.79s 110.70s 54.91s
Antwortzeit (Gesamt) 1107.03s 2137.84s 546.68s 155.96s
Parameter 230B insgesamt (10B aktiv) 1T insgesamt (32B aktiv) 744B insgesamt (40B aktiv) ~150B insgesamt (~10B aktiv)
Verfügbarkeit Gewichte verfügbar Gewichte verfügbar Open Source Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#298 MiniMax M2.7

medium
Kosten
$0.022
Zeit
22.8s
Token
9,250 tok

#205 MoonshotAI: Kimi K2.5

medium
Kosten
$0.030
Zeit
58.6s
Token
8,683 tok

#146 GLM 5

medium
Kosten
$0.005
Zeit
20.7s
Token
2,068 tok

#155 Gemini 3.1 Flash Lite Preview

medium
Kosten
$0.003
Zeit
5.2s
Token
1,944 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
MiniMax M2.7 5.7 9.1 33.3% 0 101.89s 2,961 1,231 38,841
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 4.09s 8,126 461 8,597

Schnellvergleich

Vergleichspaar wechseln