Navigation
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Gemini 3.5 Flash (minimal) vs Kimi K2.5 (medium)

Der Durchschnittsscore ist mit 6.4 vs 6.4 praktisch gleichauf. Gemini 3.5 Flash (minimal) hat die niedrigeren Benchmark-Kosten mit $0.508 vs $0.603. Gemini 3.5 Flash (minimal) ist schneller mit 4.67s vs 125.76s, mit Erfolgsraten von 58.0% vs 60.9%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-10-01

Verglichene Modelle

Rang
#208
Gesamte Ausgabe-Token
18,040
Antwortzeit (Durchschnitt)
4.67s
Gesamtkosten
$0.508
Rang
#206
Gesamte Ausgabe-Token
241,096
Antwortzeit (Durchschnitt)
125.76s
Gesamtkosten
$0.603
Empfohlenes Modell Gemini 3.5 Flash (minimal)

Es hat hier die beste Punktzahl (6.4) und antwortet etwa 26.9x schneller als Kimi K2.5 (medium).

Detaillierter Vergleich

Metrik Gemini 3.5 Flash Gemini 3.5 Flash minimal Veröffentlichung: 2026-05-19 Kimi K2.5 Kimi K2.5 medium Veröffentlichung: 2026-01-27
Punktzahl 6.4 6.4
Rang #208 #206
Zuverlässigkeit 10.0 9.6
Konsistenz 9.6 7.1
Versuche 69/69 69/69
Korrekte Tests
Erfolgsquote pro Versuch 58.0% 60.9%
Instabile Tests 1 8
Gesamtläufe 69 69
Kosten pro Ergebnis 3.903 6.085
Gesamtkosten $0.508 $0.603
Eingabepreis $1.500 / 1M $0.450 / 1M
Ausgabepreis $9.000 / 1M $2.250 / 1M
Gesamte Eingabe-Token 230,004 292,271
Ausgabe-Token 18,040 55,025
Denk-Token 0 186,071
Antwortzeit (Durchschnitt) 4.67s 125.76s
Antwortzeit (Maximum) 49.23s 566.79s
Antwortzeit (Gesamt) 107.45s 2137.84s
Parameter ~500B insgesamt (~20B aktiv) 1T insgesamt (32B aktiv)
Verfügbarkeit Geschlossen Gewichte verfügbar

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#208 Gemini 3.5 Flash

minimal
Kosten
$0.041
Zeit
20.4s
Token
4,608 tok

#206 MoonshotAI: Kimi K2.5

medium
Kosten
$0.030
Zeit
58.6s
Token
8,683 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Gemini 3.5 Flash 5.6 9.9 33.3% 0 2.75s 8,122 3,456 0
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693

Schnellvergleich

Vergleichspaar wechseln