Navigation
Advertise here

Kimi K2.6 vs Step 3.5 Flash (medium)

Kimi K2.6 führt beim Durchschnittsscore mit 5.5 vs 5.4. Step 3.5 Flash (medium) hat die niedrigeren Benchmark-Kosten mit $0.105 vs $0.222. Kimi K2.6 ist schneller mit 26.34s vs 190.48s, mit Erfolgsraten von 30.4% vs 49.3%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-10-02

Verglichene Modelle

Rang
#268
Gesamte Ausgabe-Token
64,022
Antwortzeit (Durchschnitt)
26.34s
Gesamtkosten
$0.222
Rang
#279
Gesamte Ausgabe-Token
607,130
Antwortzeit (Durchschnitt)
190.48s
Gesamtkosten
$0.105
Empfohlenes Modell Kimi K2.6

Es hat hier die beste Punktzahl (5.5) und antwortet etwa 7.2x schneller als Step 3.5 Flash (medium).

Detaillierter Vergleich

Metrik Kimi K2.6 Kimi K2.6 none Veröffentlichung: 2026-04-20 Step 3.5 Flash Step 3.5 Flash medium Veröffentlichung: 2026-02-01
Punktzahl 5.5 5.4
Rang #268 #279
Zuverlässigkeit 10.0 10.0
Konsistenz 9.0 8.3
Versuche 69/69 66/69
Korrekte Tests
Erfolgsquote pro Versuch 30.4% 49.3%
Instabile Tests 3 3
Gesamtläufe 69 66
Kosten pro Ergebnis 6.999 1.047
Gesamtkosten $0.222 $0.105
Eingabepreis $0.435 / 1M $0.100 / 1M
Ausgabepreis $1.828 / 1M $0.300 / 1M
Preis für Cache-Lesen $0.074 / 1M k. A.
Preis für Cache-Schreiben k. A. k. A.
Gesamte Eingabe-Token 241,357 139,086
Ausgabe-Token 64,022 193,584
Denk-Token 0 413,546
Antwortzeit (Durchschnitt) 26.34s 190.48s
Antwortzeit (Maximum) 238.89s 1597.85s
Antwortzeit (Gesamt) 605.78s 3238.23s
Parameter 1T insgesamt (32B aktiv) 196B insgesamt (11B aktiv)
Verfügbarkeit Gewichte verfügbar Open Source

Cache-Preise gelten für Eingabetokens. Lesen nutzt gespeicherte Prompts erneut; Schreiben speichert sie und kann mehr kosten. Für Ausgabetokens gilt der Ausgabepreis.

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#268 MoonshotAI: Kimi K2.6

none
Kosten
$0.020
Zeit
127.4s
Token
4,429 tok

#279 Step 3.5 Flash

medium
Kosten
$0.008
Zeit
277.1s
Token
23,695 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Kimi K2.6 5.5 9.8 33.3% 0 82.57s 5,986 14,754 0
Step 3.5 Flash 2.4 5.2 0.0% 0 258.38s 2,211 13,207 22,429

Schnellvergleich

Vergleichspaar wechseln