Qwen3.8 27B (high) conduce la scorul mediu cu 8.4 vs 8.3. Qwen3.8 27B (high) are costul de benchmark mai mic, ~$0.287 vs $0.537. DeepSeek V4.1 Flash (max) este mai rapid cu 61.35s vs 167.89s, cu rate de reușită de 68.2% vs 77.3%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-09-10
Modele comparate
Rang
#62
Total tokenuri de ieșire
871,126
Timp de răspuns (mediu)
61.35s
Cost total
$0.537
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#59
Total tokenuri de ieșire
656,635
Timp de răspuns (mediu)
167.89s
Cost total
~$0.287Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Model recomandatQwen3.8 27B (high)
Are cel mai bun scor aici (8.4) și costă de aproximativ 1.9x mai puțin decât DeepSeek V4.1 Flash (max).
Qwen3.8 27BQwen3.8 27BhighRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BhighRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Scor
8.3Scor mediu pe toate testele de benchmark.…
8.4Scor mediu pe toate testele de benchmark.…
Rang
#62
#59
Fiabilitate
9.1Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
9.6Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
66/66
66/66
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 6Eroare API: 1Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)61.35sTimp de răspuns (maxim)335.08sTimp de răspuns (total)1349.61sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Fără răspuns: 2Răspuns greșit: 2Timp de răspuns (mediu)167.89sTimp de răspuns (maxim)640.85sTimp de răspuns (total)3693.54sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
68.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
77.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
Cost per rezultat
3.829
~1.792Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Cost total
$0.537
~$0.287Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Preț de intrare
$0.150 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$0.600 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
89,024Total tokenuri de intrare…
100,179Total tokenuri de intrare…
Tokenuri de ieșire
5,558Tokenuri de ieșire…
904Tokenuri de ieșire…
Tokenuri de raționament
865,568Tokenuri de raționament…
655,731Tokenuri de raționament…
Timp de răspuns (mediu)
61.35sTimp de răspuns (mediu)…
167.89sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
335.08sTimp de răspuns (maxim)…
640.85sTimp de răspuns (maxim)…
Timp de răspuns (total)
1349.61sTimp de răspuns (total)…
3693.54sTimp de răspuns (total)…
Parametri
748B în total (16B activi)
27.3B
Disponibilitate
Sursă deschisă
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#62 DeepSeek V4.1 Flash
max
Cost
$0.066
Timp
211.0s
Tokenuri
54,712 tok
#59 Qwen3.8 27B
highRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.008Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.35sTimp de răspuns (maxim)11.86sTimp de răspuns (total)17.41sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.35sTimp de răspuns (mediu)…
852Total tokenuri de intrare…
213Tokenuri de ieșire…
7,262Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.10sTimp de răspuns (maxim)21.48sTimp de răspuns (total)32.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)62.50sTimp de răspuns (maxim)80.58sTimp de răspuns (total)187.50sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
62.50sTimp de răspuns (mediu)…
7,509Total tokenuri de intrare…
373Tokenuri de ieșire…
132,357Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
8.1Scor mediu pe toate testele de benchmark.…
7.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)248.62sTimp de răspuns (maxim)458.25sTimp de răspuns (total)745.85sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)160.31sTimp de răspuns (maxim)164.09sTimp de răspuns (total)320.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
160.31sTimp de răspuns (mediu)…
66,677Total tokenuri de intrare…
4,031Tokenuri de ieșire…
221,091Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)185.57sTimp de răspuns (maxim)333.21sTimp de răspuns (total)371.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)4.56sTimp de răspuns (maxim)8.91sTimp de răspuns (total)9.12sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.56sTimp de răspuns (mediu)…
2,397Total tokenuri de intrare…
120Tokenuri de ieșire…
2,047Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)34.85sTimp de răspuns (maxim)57.71sTimp de răspuns (total)69.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)198.41sTimp de răspuns (maxim)335.08sTimp de răspuns (total)595.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
198.41sTimp de răspuns (mediu)…
909Total tokenuri de intrare…
27Tokenuri de ieșire…
384,462Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Răspuns greșit: 1Timp de răspuns (mediu)526.74sTimp de răspuns (maxim)640.85sTimp de răspuns (total)1580.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.00sTimp de răspuns (maxim)4.00sTimp de răspuns (total)4.00sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.00sTimp de răspuns (mediu)…
549Total tokenuri de intrare…
148Tokenuri de ieșire…
1,093Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)8.45sTimp de răspuns (maxim)8.45sTimp de răspuns (total)8.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.64sTimp de răspuns (maxim)11.30sTimp de răspuns (total)15.29sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.64sTimp de răspuns (mediu)…
783Total tokenuri de intrare…
63Tokenuri de ieșire…
2,293Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
9.8Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.24sTimp de răspuns (maxim)10.18sTimp de răspuns (total)16.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)30.82sTimp de răspuns (maxim)73.06sTimp de răspuns (total)92.46sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
30.82sTimp de răspuns (mediu)…
828Total tokenuri de intrare…
339Tokenuri de ieșire…
54,014Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.6Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)199.90sTimp de răspuns (maxim)569.33sTimp de răspuns (total)599.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.49sTimp de răspuns (maxim)9.49sTimp de răspuns (total)9.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.49sTimp de răspuns (mediu)…
8,259Total tokenuri de intrare…
228Tokenuri de ieșire…
693Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.62sTimp de răspuns (maxim)5.62sTimp de răspuns (total)5.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)98.48sTimp de răspuns (maxim)98.48sTimp de răspuns (total)98.48sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
98.48sTimp de răspuns (mediu)…
261Total tokenuri de intrare…
16Tokenuri de ieșire…
60,256Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)263.98sTimp de răspuns (maxim)263.98sTimp de răspuns (total)263.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…