Navigare
AI BENCHY
Compară Grafice Metodologie
❤️ Made by XCS
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Qwen: Qwen3.5-Flash vs StepFun: Step 3.5 Flash

Compară:

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-06

Metrică Qwen: Qwen3.5-Flash none Lansare: 2026-02-24 StepFun: Step 3.5 Flash medium Lansare: 2026-02-01 Disponibil gratuit
Rang #37 #13
Scor mediu 5.2 7.4
Consistență 9.6 9.1
Cost per rezultat 0.077 0.000
Cost total $0.006 $0.000
Teste corecte
Rată de trecere pe încercare 45.8% 68.8%
Teste instabile 1 2
Rulări totale 48 48
Tokenuri de ieșire 3,774 71,452
Tokenuri de raționament 0 155,147
Timp de răspuns (mediu) 3.54s 29.10s
Timp de răspuns (maxim) 13.73s 170.45s
Timp de răspuns (total) 56.70s 290.96s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor mediu vs Timp de răspuns (mediu)

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen: Qwen3.5-Flash 2.3 7.8 11.1% 1 1.62s 687 0
StepFun: Step 3.5 Flash 10.0 10.0 100.0% 0 18.54s 13,924 17,208
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen: Qwen3.5-Flash 10.0 10.0 0.0% 0 6.22s 1,794 0
StepFun: Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 1,176 12,984
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen: Qwen3.5-Flash 9.9 10.0 100.0% 0 1.57s 243 0
StepFun: Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 600 13,886
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen: Qwen3.5-Flash 7.0 10.0 66.7% 0 905ms 15 0
StepFun: Step 3.5 Flash 4.0 7.2 44.4% 1 170.45s 45,350 90,436
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen: Qwen3.5-Flash 10.0 10.0 100.0% 0 803ms 100 0
StepFun: Step 3.5 Flash 6.0 10.0 0.0% 0 6.54s 2,214 2,584
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen: Qwen3.5-Flash 5.0 10.0 50.0% 0 8.81s 63 0
StepFun: Step 3.5 Flash 9.0 6.8 83.3% 1 4.98s 2,284 3,412
Puzzle Solving Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen: Qwen3.5-Flash 1.3 10.0 0.0% 0 5.90s 608 0
StepFun: Step 3.5 Flash 4.0 10.0 33.3% 0 7.72s 5,629 10,835
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen: Qwen3.5-Flash 10.0 10.0 100.0% 0 3.67s 264 0
StepFun: Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 275 3,802

Comparație rapidă

Schimbă perechea de comparație