Scorul mediu este practic egal la 5.5 vs 5.6. Qwen3.8 27B are costul de benchmark mai mic, ~$0.006 vs $1.745. Qwen3.8 27B este mai rapid cu 3.12s vs 214.25s, cu rate de reușită de 40.9% vs 19.7%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-08-29
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#220
Total tokenuri de ieșire
11,445
Timp de răspuns (mediu)
3.12s
Cost total
~$0.006Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Rang
#217
Total tokenuri de ieșire
682,538
Timp de răspuns (mediu)
214.25s
Cost total
$1.745
Model recomandatQwen3.8 27B
Are cel mai bun scor aici (5.5) și costă de aproximativ 308.3x mai puțin decât Hy4 preview (low).
Comparație detaliată
Metrică
Qwen3.8 27BQwen3.8 27BnoneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
5.4Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.5Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
66/66
66/66
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 11Nu a urmat instrucțiunile: 1Apel de instrument invalid: 1Timp de răspuns (mediu)3.12sTimp de răspuns (maxim)44.76sTimp de răspuns (total)68.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 14Răspuns greșit: 3Nu a urmat instrucțiunile: 1Fără răspuns: 1Timp de răspuns (mediu)214.25sTimp de răspuns (maxim)597.45sTimp de răspuns (total)4713.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
40.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
19.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
3Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
Cost per rezultat
~0.063Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
58.157
Cost total
~$0.006Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
$1.745
Preț de intrare
N/DPreț de intrare…
$0.834 / 1MPreț de intrare…
Preț de ieșire
N/DPreț de ieșire…
$2.501 / 1MPreț de ieșire…
Total tokenuri de intrare
122,463Total tokenuri de intrare…
45,154Total tokenuri de intrare…
Tokenuri de ieșire
11,445Tokenuri de ieșire…
4,022Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
678,516Tokenuri de raționament…
Timp de răspuns (mediu)
3.12sTimp de răspuns (mediu)…
214.25sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
44.76sTimp de răspuns (maxim)…
597.45sTimp de răspuns (maxim)…
Timp de răspuns (total)
68.69sTimp de răspuns (total)…
4713.56sTimp de răspuns (total)…
Parametri
27.3B
770B în total (49B activi)
Disponibilitate
Ponderi disponibile
Sursă deschisă
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#220 Qwen3.8 27B
noneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.001Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
Timp
23.9s
Tokenuri
1,922 tok
#217 Hy4 preview
low
Provider returned error
Cost
$0.000
Timp
1.1s
Tokenuri
0 tok
Scor
-
Cost
-
Timp
-
Tokenuri
-
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor vs Timp de răspuns (mediu)
Total tokenuri de ieșire
Scor vs Total tokenuri de ieșire
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)828msTimp de răspuns (maxim)1.95sTimp de răspuns (total)3.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 4Timp de răspuns (mediu)129.60sTimp de răspuns (maxim)237.97sTimp de răspuns (total)518.41sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
129.60sTimp de răspuns (mediu)…
624Total tokenuri de intrare…
478Tokenuri de ieșire…
72,022Tokenuri de raționament…
Programare
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)1.19sTimp de răspuns (maxim)1.97sTimp de răspuns (total)3.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 3Timp de răspuns (mediu)219.15sTimp de răspuns (maxim)259.22sTimp de răspuns (total)657.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
219.15sTimp de răspuns (mediu)…
6,110Total tokenuri de intrare…
135Tokenuri de ieșire…
96,407Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Răspuns greșit: 1Timp de răspuns (mediu)24.10sTimp de răspuns (maxim)44.76sTimp de răspuns (total)48.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
16.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 2Timp de răspuns (mediu)139.43sTimp de răspuns (maxim)171.85sTimp de răspuns (total)278.85sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
139.43sTimp de răspuns (mediu)…
28,254Total tokenuri de intrare…
2,485Tokenuri de ieșire…
8,420Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.14sTimp de răspuns (maxim)1.18sTimp de răspuns (total)2.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)88.53sTimp de răspuns (maxim)120.56sTimp de răspuns (total)177.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
88.53sTimp de răspuns (mediu)…
7,197Total tokenuri de intrare…
195Tokenuri de ieșire…
18,424Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)552msTimp de răspuns (maxim)675msTimp de răspuns (total)1.66sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Eroare API: 1Timp de răspuns (mediu)470.24sTimp de răspuns (maxim)547.52sTimp de răspuns (total)1410.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
470.24sTimp de răspuns (mediu)…
716Total tokenuri de intrare…
28Tokenuri de ieșire…
220,446Tokenuri de raționament…
Inteligență generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
4.2Scor mediu pe toate testele de benchmark.…
9.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.31sTimp de răspuns (maxim)1.31sTimp de răspuns (total)1.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)110.43sTimp de răspuns (maxim)110.43sTimp de răspuns (total)110.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
110.43sTimp de răspuns (mediu)…
525Total tokenuri de intrare…
170Tokenuri de ieșire…
13,806Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)582msTimp de răspuns (maxim)633msTimp de răspuns (total)1.16sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)77.72sTimp de răspuns (maxim)91.04sTimp de răspuns (total)155.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
77.72sTimp de răspuns (mediu)…
732Total tokenuri de intrare…
71Tokenuri de ieșire…
17,054Tokenuri de raționament…
Rezolvare de puzzle-uri
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)1.25sTimp de răspuns (maxim)1.84sTimp de răspuns (total)3.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)238.03sTimp de răspuns (maxim)373.63sTimp de răspuns (total)714.10sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
238.03sTimp de răspuns (mediu)…
750Total tokenuri de intrare…
454Tokenuri de ieșire…
103,707Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.75sTimp de răspuns (maxim)2.75sTimp de răspuns (total)2.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)93.67sTimp de răspuns (maxim)93.67sTimp de răspuns (total)93.67sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
93.67sTimp de răspuns (mediu)…
0Total tokenuri de intrare…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Cultură generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)703msTimp de răspuns (maxim)703msTimp de răspuns (total)703msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)597.45sTimp de răspuns (maxim)597.45sTimp de răspuns (total)597.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…