GPT-5.4 (medium) conduce la scorul mediu cu 8.8 vs 8.7. Qwen3.8 27B (high) are costul de benchmark mai mic, ~$0.298 vs $2.006. GPT-5.4 (medium) este mai rapid cu 24.81s vs 166.34s, cu rate de reușită de 78.3% vs 78.3%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-10-01
Modele comparate
Rang
#50
Total tokenuri de ieșire
96,502
Timp de răspuns (mediu)
24.81s
Cost total
$2.006
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#55
Total tokenuri de ieșire
677,080
Timp de răspuns (mediu)
166.34s
Cost total
~$0.298Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Model recomandatQwen3.8 27B (high)
Scorul rămâne aproape de cel mai bun scor de aici (8.7 vs 8.8) și costă de aproximativ 6.7x mai puțin decât GPT-5.4 (medium).
Qwen3.8 27BQwen3.8 27BhighRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14Disponibil gratuit
Qwen3.8 27BQwen3.8 27BhighRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14Disponibil gratuit
Scor
8.8Scor mediu pe toate testele de benchmark.…
8.7Scor mediu pe toate testele de benchmark.…
Rang
#50
#55
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
9.7Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
8.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
69/69
69/69
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Nu a urmat instrucțiunile: 2Timp de răspuns (mediu)24.81sTimp de răspuns (maxim)100.41sTimp de răspuns (total)570.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Fără răspuns: 2Răspuns greșit: 2Timp de răspuns (mediu)166.34sTimp de răspuns (maxim)640.85sTimp de răspuns (total)3825.81sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
78.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
78.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
69Rulări totale…
69Rulări totale…
Cost per rezultat
12.535
~1.751Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Cost total
$2.006
~$0.298Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Preț de intrare
$2.500 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$15.000 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
223,210Total tokenuri de intrare…
348,967Total tokenuri de intrare…
Tokenuri de ieșire
7,312Tokenuri de ieșire…
1,005Tokenuri de ieșire…
Tokenuri de raționament
89,190Tokenuri de raționament…
676,075Tokenuri de raționament…
Timp de răspuns (mediu)
24.81sTimp de răspuns (mediu)…
166.34sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
100.41sTimp de răspuns (maxim)…
640.85sTimp de răspuns (maxim)…
Timp de răspuns (total)
570.60sTimp de răspuns (total)…
3825.81sTimp de răspuns (total)…
Parametri
~1.5T în total (~100B activi)
27.3B
Disponibilitate
Închis
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#50 GPT-5.4
medium
Cost
$0.214
Timp
199.6s
Tokenuri
14,349 tok
#55 Qwen3.8 27B
highRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.008Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)67.82sTimp de răspuns (maxim)67.82sTimp de răspuns (total)67.82sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
67.82sTimp de răspuns (mediu)…
142,074Total tokenuri de intrare…
1,157Tokenuri de ieșire…
4,879Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)132.27sTimp de răspuns (maxim)132.27sTimp de răspuns (total)132.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.11sTimp de răspuns (maxim)6.42sTimp de răspuns (total)16.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.11sTimp de răspuns (mediu)…
606Total tokenuri de intrare…
240Tokenuri de ieșire…
1,511Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.10sTimp de răspuns (maxim)21.48sTimp de răspuns (total)32.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)44.36sTimp de răspuns (maxim)96.94sTimp de răspuns (total)133.08sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
44.36sTimp de răspuns (mediu)…
7,305Total tokenuri de intrare…
433Tokenuri de ieșire…
24,216Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
8.1Scor mediu pe toate testele de benchmark.…
7.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)248.62sTimp de răspuns (maxim)458.25sTimp de răspuns (total)745.85sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)29.77sTimp de răspuns (maxim)38.97sTimp de răspuns (total)59.55sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
29.77sTimp de răspuns (mediu)…
58,038Total tokenuri de intrare…
4,214Tokenuri de ieșire…
13,351Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)185.57sTimp de răspuns (maxim)333.21sTimp de răspuns (total)371.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.32sTimp de răspuns (maxim)5.40sTimp de răspuns (total)10.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.32sTimp de răspuns (mediu)…
7,140Total tokenuri de intrare…
234Tokenuri de ieșire…
804Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)34.85sTimp de răspuns (maxim)57.71sTimp de răspuns (total)69.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)72.44sTimp de răspuns (maxim)100.41sTimp de răspuns (total)217.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
72.44sTimp de răspuns (mediu)…
628Total tokenuri de intrare…
61Tokenuri de ieșire…
36,544Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Răspuns greșit: 1Timp de răspuns (mediu)526.74sTimp de răspuns (maxim)640.85sTimp de răspuns (total)1580.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)4.92sTimp de răspuns (maxim)4.92sTimp de răspuns (total)4.92sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.92sTimp de răspuns (mediu)…
477Total tokenuri de intrare…
145Tokenuri de ieșire…
321Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)8.45sTimp de răspuns (maxim)8.45sTimp de răspuns (total)8.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.11sTimp de răspuns (maxim)3.68sTimp de răspuns (total)6.22sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.11sTimp de răspuns (mediu)…
660Total tokenuri de intrare…
93Tokenuri de ieșire…
897Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
9.8Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.24sTimp de răspuns (maxim)10.18sTimp de răspuns (total)16.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)9.14sTimp de răspuns (maxim)18.14sTimp de răspuns (total)27.41sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.14sTimp de răspuns (mediu)…
642Total tokenuri de intrare…
441Tokenuri de ieșire…
3,815Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.6Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)199.90sTimp de răspuns (maxim)569.33sTimp de răspuns (total)599.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)13.28sTimp de răspuns (maxim)13.28sTimp de răspuns (total)13.28sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
13.28sTimp de răspuns (mediu)…
5,445Total tokenuri de intrare…
264Tokenuri de ieșire…
1,031Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.62sTimp de răspuns (maxim)5.62sTimp de răspuns (total)5.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)13.95sTimp de răspuns (maxim)13.95sTimp de răspuns (total)13.95sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
13.95sTimp de răspuns (mediu)…
195Total tokenuri de intrare…
30Tokenuri de ieșire…
1,821Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)263.98sTimp de răspuns (maxim)263.98sTimp de răspuns (total)263.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…