Navigare
AI BENCHY
Advertise here

AI BENCHY Compare

Qwen: Qwen3.6 Max Preview vs StepFun: Step 3.5 Flash

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-10

Metrică Qwen3.6 Max Preview Qwen3.6 Max Preview none Lansare: 2026-04-20 Step 3.5 Flash Step 3.5 Flash medium Lansare: 2026-02-01
Scor 7.2 7.6
Rang #54 #43
Fiabilitate 10.0 10.0
Consistență 9.1 9.2
Teste corecte
Rată de trecere pe încercare 64.9% 66.7%
Teste instabile 2 2
Rulări totale 57 54
Cost per rezultat 0.755 0.099
Cost total $0.083 $0.011
Preț de intrare $1.040 / 1M $0.100 / 1M
Preț de ieșire $6.240 / 1M $0.300 / 1M
Tokenuri de ieșire 4,751 78,299
Tokenuri de raționament 0 173,409
Timp de răspuns (mediu) 3.31s 41.66s
Timp de răspuns (maxim) 20.51s 170.45s
Timp de răspuns (total) 62.80s 499.91s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 5.2 7.9 41.7% 1 2.63s 513 0
Step 3.5 Flash 10.0 10.0 100.0% 0 40.57s 20,391 24,176
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 5.0 2.0 66.7% 1 3.45s 426 0
Step 3.5 Flash - - - - - - - -
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 3.0 10.0 0.0% 0 20.51s 2,842 0
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 1,176 12,984
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 2.87s 243 0
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 600 13,886
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 7.7 10.0 66.7% 0 1.22s 18 0
Step 3.5 Flash 5.3 7.2 44.4% 1 170.45s 45,350 90,436
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 4.3 10.0 0.0% 0 1.62s 76 0
Step 3.5 Flash 5.5 10.0 0.0% 0 22.39s 240 3,506
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 9.8 10.0 100.0% 0 1.45s 69 0
Step 3.5 Flash 8.5 6.8 83.3% 1 4.98s 2,284 3,412
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 2.38s 323 0
Step 3.5 Flash 5.3 10.0 33.3% 0 7.72s 5,629 10,835
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 5.27s 222 0
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 275 3,802
Cultură generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Qwen3.6 Max Preview 3.0 10.0 0.0% 0 1.97s 19 0
Step 3.5 Flash 3.0 10.0 0.0% 0 108.45s 2,354 10,372

Comparație rapidă

Schimbă perechea de comparație