Advertise here
#401

Step 3.5 Flash

Stepfun Veröffentlichung: 2026-02-01 Getestet am: 2026-05-08 15:30 stepfun/step-3.5-flash::none
196B insgesamt (11B aktiv)MoEOpen Source
(medium) (none)

Zusammenfassung

Step 3.5 Flash erreicht 1.9 bei AI BENCHY und liegt auf #401. Das Modell hat 10.0 Zuverlässigkeit, 26.1% Erfolgsrate, $0.020 Gesamtkosten und 39.03s durchschnittliche Antwortzeit.

Was Step 3.5 Flash besonders macht: Am stärksten ist es in Anti-KI-Tricks, wo es #1 erreicht; am schwächsten ist Datenanalyse und -extraktion mit #11. Es nutzt ungewöhnlich viele Reasoning-Tokens, was langsamere oder teurere Läufe erklären kann.

Archiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.

Modelldaten

Recherchiert am 2026-08-12

Angegeben
Parameter
196B insgesamt (11B aktiv)
Architektur
MoE
Verfügbarkeit
Open Source
Lizenz
Apache-2.0

Punktzahl

1.9

Konsistenz

5.2

Gesamte Ausgabe-Token

64,795

Gesamte Eingabe-Token

1,971

Eingabepreis

$0.100 / 1M

Ausgabepreis

$0.300 / 1M

Preis für Cache-Lesen

k. A.

Preis für Cache-Schreiben

k. A.

Cache-Preise gelten für Eingabetokens. Lesen nutzt gespeicherte Prompts erneut; Schreiben speichert sie und kann mehr kosten. Für Ausgabetokens gilt der Ausgabepreis.

Korrekte Tests

Falsche Tests: 6

Erfolgsquote pro Versuch: 26.1%

Instabile Tests

0

Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).

Antwortzeit (Durchschnitt)

39.03s

Antwortzeit (Maximum): 114.12s

Antwortzeit (Gesamt): 312.26s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#401 Step 3.5 Flash

none
Kosten
$0.005
Zeit
156.3s
Token
13,887 tok

Testverlauf

Getestet am Punktzahl Zuverlässigkeit Korrekte Tests Gesamtkosten Vergleichen
2026-05-08 15:30 Neuer Test hinzugefügt 1.9 10.0 $0.020 Aktueller Lauf
2026-04-11 01:44 Erster erfasster Lauf 3.0 k. A. $0.000 Vergleichen

Dieser Lauf nutzte eine andere Benchmark-Suite. Berücksichtige Suite-Änderungen bei der historischen Einordnung.

Laufvergleich

LaufBenchmark-AbdeckungPunktzahlKonsistenzZuverlässigkeitKorrekte TestsInstabile TestsGesamte Ausgabe-TokenGesamte Eingabe-TokenGesamtkostenAntwortzeit (Durchschnitt)
2026-05-08 15:30 · Aktueller Lauf36/69 Versuche1.95.210.06/12064,7951,971$0.02039.03s
2026-04-11 01:44 · Erster erfasster Lauf3/3 Versuche3.010.0k. A.0/1000$0.0000ms
Differenz—-1.1-4.8+60+64795+1971+$0.020+39032ms

Die Benchmark-Abdeckung unterscheidet sich: 36/69 Versuche (Ziel: 3 Wiederholungen pro Test) gegenüber 3/3 Versuche (Ziel: 3 Wiederholungen pro Test). Summen und wiederholungsabhängige Metriken sind nicht direkt vergleichbar.

Diese beiden Läufe nutzten unterschiedliche Benchmark-Suiten, daher spiegeln die Deltas sowohl Modell- als auch Suite-Änderungen wider.

Preisverlauf

Historische Preisdaten für dieses Modell von OpenRouter.

Datum Eingabepreis Ausgabepreis Preis für Cache-Lesen Preis für Cache-Schreiben
2026-06-04 15:40 $0.090 / 1M $0.300 / 1M k. A. k. A.
2026-06-30 21:25 $0.100 / 1M $0.300 / 1M k. A. k. A.

Diagramme

Wähle zuerst das erste Modell und klicke dann ein zweites Modell, um eine Seite im direkten Vergleich zu öffnen.

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Kategorie Punktzahl Konsistenz Korrekte Tests
Agentenaufgaben 0.0 0.0
Anti-KI-Tricks 10.0 10.0
Programmierung 1.0 3.3
Kombiniert 1.5 5.0
Datenanalyse und -extraktion 1.5 5.0
Domänenspezifisch 3.3 3.3
Allgemeine Intelligenz 4.0 10.0
Befolgung von Anweisungen 5.0 5.0
Rätsellösen 0.0 0.0
Werkzeugaufrufe 3.0 10.0
Allgemeinwissen 3.0 10.0

Verglichene Modelle