Scorul mediu este practic egal la 7.9 vs 7.9. Costul hardware-ului local nu a fost măsurat, deci comparațiile de cost nu sunt disponibile. Qwen3.8 27B (low) este mai rapid cu 39.11s vs 142.84s, cu rate de reușită de 77.3% vs 68.2%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-08-15
Rang
#58
Total tokenuri de ieșire
224,128
Timp de răspuns (mediu)
142.84s
Cost total
$3.467
Rang
#61
Total tokenuri de ieșire
169,329
Timp de răspuns (mediu)
39.11s
Cost total
N/D
Model recomandatQwen3.8 27B (low)
Are cel mai bun scor aici (7.9) și răspunde de aproximativ 3.7x mai rapid decât Kimi K3 (max).
Qwen3.8 27BQwen3.8 27BlowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Scor
7.9Scor mediu pe toate testele de benchmark.…
7.9Scor mediu pe toate testele de benchmark.…
Rang
#58
#61
Fiabilitate
9.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
66/66
66/66
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 2Fără răspuns: 2Formatare suplimentară: 1Timp expirat: 1Timp de răspuns (mediu)142.84sTimp de răspuns (maxim)766.58sTimp de răspuns (total)2714.02sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Fără răspuns: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)39.11sTimp de răspuns (maxim)376.04sTimp de răspuns (total)860.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
77.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
68.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
Cost per rezultat
21.668Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
N/DAfișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$3.467Cost total (preț curent)…
N/DCost total (preț curent)…
Preț de intrare
$3.000 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$15.000 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
34,960Total tokenuri de intrare…
99,705Total tokenuri de intrare…
Tokenuri de ieșire
2,887Tokenuri de ieșire…
1,545Tokenuri de ieșire…
Tokenuri de raționament
221,241Tokenuri de raționament…
167,784Tokenuri de raționament…
Timp de răspuns (mediu)
142.84sTimp de răspuns (mediu)…
39.11sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
766.58sTimp de răspuns (maxim)…
376.04sTimp de răspuns (maxim)…
Timp de răspuns (total)
2714.02sTimp de răspuns (total)…
860.51sTimp de răspuns (total)…
Parametri
2.8T în total (104B activi)
27.3B
Disponibilitate
Ponderi disponibile
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#58 MoonshotAI: Kimi K3
max
Cost
$0.281
Timp
506.9s
Tokenuri
18,863 tok
#61 Qwen3.8 27B
lowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)10.24sTimp de răspuns (maxim)15.21sTimp de răspuns (total)40.97sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.24sTimp de răspuns (mediu)…
1,638Total tokenuri de intrare…
496Tokenuri de ieșire…
2,629Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.02sTimp de răspuns (maxim)5.68sTimp de răspuns (total)12.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)325.79sTimp de răspuns (maxim)589.43sTimp de răspuns (total)977.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
325.79sTimp de răspuns (mediu)…
8,061Total tokenuri de intrare…
460Tokenuri de ieșire…
84,012Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)140.92sTimp de răspuns (maxim)376.04sTimp de răspuns (total)422.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)223.03sTimp de răspuns (maxim)223.03sTimp de răspuns (total)223.03sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
223.03sTimp de răspuns (mediu)…
12,792Total tokenuri de intrare…
399Tokenuri de ieșire…
20,460Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)90.63sTimp de răspuns (maxim)143.71sTimp de răspuns (total)181.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Timp de răspuns (mediu)16.72sTimp de răspuns (maxim)18.73sTimp de răspuns (total)33.44sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
16.72sTimp de răspuns (mediu)…
7,839Total tokenuri de intrare…
354Tokenuri de ieșire…
2,606Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.03sTimp de răspuns (maxim)9.09sTimp de răspuns (total)16.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp expirat: 1Timp de răspuns (mediu)683.62sTimp de răspuns (maxim)766.58sTimp de răspuns (total)1367.25sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
683.62sTimp de răspuns (mediu)…
838Total tokenuri de intrare…
57Tokenuri de ieșire…
106,892Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)60.78sTimp de răspuns (maxim)120.94sTimp de răspuns (total)182.34sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)14.91sTimp de răspuns (maxim)14.91sTimp de răspuns (total)14.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
14.91sTimp de răspuns (mediu)…
732Total tokenuri de intrare…
191Tokenuri de ieșire…
871Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)5.37sTimp de răspuns (maxim)5.37sTimp de răspuns (total)5.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.66sTimp de răspuns (maxim)7.99sTimp de răspuns (total)15.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.66sTimp de răspuns (mediu)…
1,179Total tokenuri de intrare…
147Tokenuri de ieșire…
1,119Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.43sTimp de răspuns (maxim)2.87sTimp de răspuns (total)4.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.36sTimp de răspuns (maxim)12.30sTimp de răspuns (total)22.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.36sTimp de răspuns (mediu)…
1,416Total tokenuri de intrare…
495Tokenuri de ieșire…
1,368Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.91sTimp de răspuns (maxim)8.81sTimp de răspuns (total)14.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Total tokenuri de intrare…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)8.42sTimp de răspuns (maxim)8.42sTimp de răspuns (total)8.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)19.67sTimp de răspuns (maxim)19.67sTimp de răspuns (total)19.67sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
19.67sTimp de răspuns (mediu)…
465Total tokenuri de intrare…
288Tokenuri de ieșire…
1,284Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)12.64sTimp de răspuns (maxim)12.64sTimp de răspuns (total)12.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…