Navigare
AI BENCHY
Advertise here

AI BENCHY Compare

Qwen: Qwen3.7 Max vs StepFun: Step 3.7 Flash

Rezumat

Comparație benchmark Qwen3.7 Max vs Step 3.7 Flash: Qwen3.7 Max conduce la scorul mediu cu 9.4 vs 7.7. Step 3.7 Flash are costul de benchmark mai mic, $0.341 vs $0.523. Step 3.7 Flash este mai rapid cu 15.74s vs 16.02s, cu rate de reușită de 88.9% vs 68.3%.

Model recomandat: Qwen3.7 Max - Are cel mai puternic scor din această comparație (9.4) și cel mai bun echilibru între cost și timp de răspuns dintre toate cele 2 modele.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-12

Metrică Qwen3.7 Max Qwen3.7 Max medium Lansare: 2026-05-22 Step 3.7 Flash Step 3.7 Flash low Lansare: 2026-05-29
Scor 9.4 7.7
Rang #4 #42
Fiabilitate 10.0 10.0
Consistență 9.6 8.4
Teste corecte
Rată de trecere pe încercare 88.9% 68.3%
Teste instabile 1 4
Rulări totale 63 63
Cost per rezultat 5.517 2.840
Cost total $0.523 $0.341
Preț de intrare $1.250 / 1M $0.200 / 1M
Preț de ieșire $3.750 / 1M $1.150 / 1M
Total tokenuri de intrare 42,360 40,101
Tokenuri de ieșire 2,129 289,325
Tokenuri de raționament 122,959 0
Timp de răspuns (mediu) 16.02s 15.74s
Timp de răspuns (maxim) 59.98s 124.75s
Timp de răspuns (total) 336.51s 330.63s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 Qwen3.7 Max

medium
Cost
$0.017
Time
68.8s
Tokens
4,526 tok

#42 Step 3.7 Flash

low
Invalid SVG
Cost
$0.004
Time
25.3s
Tokens
3,072 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 6.36s 672 222 8,742
Step 3.7 Flash 8.7 7.9 91.7% 1 4.02s 756 10,896 0
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 35.31s 7,893 423 34,808
Step 3.7 Flash 8.2 7.2 88.9% 1 9.46s 7,437 18,685 0
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 19.60s 14,934 366 8,405
Step 3.7 Flash 10.0 10.0 100.0% 0 7.98s 13,683 6,426 0
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 8.80s 7,782 270 6,254
Step 3.7 Flash 7.3 5.8 83.3% 1 2.29s 7,398 2,667 0
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 5.9 7.2 55.6% 1 24.94s 771 61 31,793
Step 3.7 Flash 5.3 7.2 44.4% 1 43.31s 828 104,487 0
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 11.70s 516 135 4,457
Step 3.7 Flash 3.4 9.3 0.0% 0 7.00s 525 4,604 0
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 7.46s 699 102 5,452
Step 3.7 Flash 9.8 10.0 100.0% 0 1.58s 735 1,857 0
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 8.84s 696 259 8,908
Step 3.7 Flash 5.5 9.9 33.3% 0 1.84s 756 3,564 0
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 6.63s 8,193 267 1,220
Step 3.7 Flash 10.0 10.0 100.0% 0 3.25s 7,746 1,360 0
Cultură generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 3.0 10.0 0.0% 0 33.37s 204 24 12,920
Step 3.7 Flash 3.0 10.0 0.0% 0 124.75s 237 134,779 0

Comparație rapidă

Schimbă perechea de comparație