Scorul mediu este practic egal la 8.4 vs 8.3. Qwen3.8 27B (high) are costul de benchmark mai mic, ~$0.287 vs $0.508. GLM 5.3 FlashX (max) este mai rapid cu 41.21s vs 167.89s, cu rate de reușită de 77.3% vs 78.8%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-09-21
Modele comparate
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#60
Total tokenuri de ieșire
656,635
Timp de răspuns (mediu)
167.89s
Cost total
~$0.287Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Rang
#63
Total tokenuri de ieșire
375,734
Timp de răspuns (mediu)
41.21s
Cost total
$0.508
Model recomandatGLM 5.3 FlashX (max)
Are cel mai bun scor aici (8.3) și răspunde de aproximativ 4.1x mai rapid decât Qwen3.8 27B (high).
Comparație detaliată
Metrică
Qwen3.8 27BQwen3.8 27BhighRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BhighRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
9.6Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
66/66
66/66
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Fără răspuns: 2Răspuns greșit: 2Timp de răspuns (mediu)167.89sTimp de răspuns (maxim)640.85sTimp de răspuns (total)3693.54sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
77.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
78.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
5Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
Cost per rezultat
~1.792Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
3.381
Cost total
~$0.287Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
$0.508
Preț de intrare
N/DPreț de intrare…
$0.370 / 1MPreț de intrare…
Preț de ieșire
N/DPreț de ieșire…
$1.250 / 1MPreț de ieșire…
Total tokenuri de intrare
100,179Total tokenuri de intrare…
101,211Total tokenuri de intrare…
Tokenuri de ieșire
904Tokenuri de ieșire…
6,301Tokenuri de ieșire…
Tokenuri de raționament
655,731Tokenuri de raționament…
369,433Tokenuri de raționament…
Timp de răspuns (mediu)
167.89sTimp de răspuns (mediu)…
41.21sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
640.85sTimp de răspuns (maxim)…
390.70sTimp de răspuns (maxim)…
Timp de răspuns (total)
3693.54sTimp de răspuns (total)…
906.52sTimp de răspuns (total)…
Parametri
27.3B
320B în total (18B activi)
Disponibilitate
Ponderi disponibile
Închis
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#60 Qwen3.8 27B
highRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.008Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
Timp
270.1s
Tokenuri
18,963 tok
#63 GLM 5.3 FlashX
max
Cost
$0.046
Timp
251.3s
Tokenuri
36,769 tok
Rang
-
Cost
-
Timp
-
Tokenuri
-
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor vs Timp de răspuns (mediu)
Total tokenuri de ieșire
Scor vs Total tokenuri de ieșire
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.10sTimp de răspuns (maxim)21.48sTimp de răspuns (total)32.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.65sTimp de răspuns (maxim)4.90sTimp de răspuns (total)10.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.65sTimp de răspuns (mediu)…
639Total tokenuri de intrare…
301Tokenuri de ieșire…
2,210Tokenuri de raționament…
Programare
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
8.1Scor mediu pe toate testele de benchmark.…
7.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)248.62sTimp de răspuns (maxim)458.25sTimp de răspuns (total)745.85sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)24.61sTimp de răspuns (maxim)30.05sTimp de răspuns (total)73.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
24.61sTimp de răspuns (mediu)…
7,317Total tokenuri de intrare…
463Tokenuri de ieșire…
36,503Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)185.57sTimp de răspuns (maxim)333.21sTimp de răspuns (total)371.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Timp de răspuns (mediu)45.23sTimp de răspuns (maxim)71.40sTimp de răspuns (total)90.46sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
45.23sTimp de răspuns (mediu)…
76,431Total tokenuri de intrare…
3,485Tokenuri de ieșire…
35,762Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)34.85sTimp de răspuns (maxim)57.71sTimp de răspuns (total)69.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.38sTimp de răspuns (maxim)3.44sTimp de răspuns (total)6.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.38sTimp de răspuns (mediu)…
7,149Total tokenuri de intrare…
223Tokenuri de ieșire…
2,262Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Răspuns greșit: 1Timp de răspuns (mediu)526.74sTimp de răspuns (maxim)640.85sTimp de răspuns (total)1580.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Fără răspuns: 1Răspuns greșit: 1Timp de răspuns (mediu)224.00sTimp de răspuns (maxim)390.70sTimp de răspuns (total)672.00sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
224.00sTimp de răspuns (mediu)…
759Total tokenuri de intrare…
583Tokenuri de ieșire…
279,058Tokenuri de raționament…
Inteligență generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)8.45sTimp de răspuns (maxim)8.45sTimp de răspuns (total)8.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.01sTimp de răspuns (maxim)5.01sTimp de răspuns (total)5.01sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.01sTimp de răspuns (mediu)…
498Total tokenuri de intrare…
209Tokenuri de ieșire…
1,290Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
9.8Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.24sTimp de răspuns (maxim)10.18sTimp de răspuns (total)16.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.23sTimp de răspuns (maxim)2.24sTimp de răspuns (total)4.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.23sTimp de răspuns (mediu)…
678Total tokenuri de intrare…
72Tokenuri de ieșire…
1,032Tokenuri de raționament…
Rezolvare de puzzle-uri
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.6Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)199.90sTimp de răspuns (maxim)569.33sTimp de răspuns (total)599.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)3.88sTimp de răspuns (maxim)6.30sTimp de răspuns (total)11.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.88sTimp de răspuns (mediu)…
672Total tokenuri de intrare…
456Tokenuri de ieșire…
2,848Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.62sTimp de răspuns (maxim)5.62sTimp de răspuns (total)5.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.39sTimp de răspuns (maxim)9.39sTimp de răspuns (total)9.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.39sTimp de răspuns (mediu)…
6,861Total tokenuri de intrare…
231Tokenuri de ieșire…
712Tokenuri de raționament…
Cultură generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)263.98sTimp de răspuns (maxim)263.98sTimp de răspuns (total)263.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)22.41sTimp de răspuns (maxim)22.41sTimp de răspuns (total)22.41sUn test este considerat trecut complet doar dacă toate rulările lui trec.…