KAT-Coder-Air V2.5 (high) conduce la scorul mediu cu 5.6 vs 5.5. Costul hardware-ului local nu a fost măsurat, deci comparațiile de cost nu sunt disponibile. Qwen3.8 27B este mai rapid cu 3.12s vs 15.87s, cu rate de reușită de 42.4% vs 40.9%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-08-15
Rang
#201
Total tokenuri de ieșire
114,654
Timp de răspuns (mediu)
15.87s
Cost total
$0.077
Rang
#211
Total tokenuri de ieșire
11,445
Timp de răspuns (mediu)
3.12s
Cost total
N/D
Model recomandatQwen3.8 27B
Scorul rămâne aproape de cel mai bun scor de aici (5.5 vs 5.6) și răspunde de aproximativ 5.1x mai rapid decât KAT-Coder-Air V2.5 (high).
Qwen3.8 27BQwen3.8 27BnoneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Scor
5.6Scor mediu pe toate testele de benchmark.…
5.5Scor mediu pe toate testele de benchmark.…
Rang
#201
#211
Fiabilitate
9.8Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
8.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
66/66
66/66
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 9Eroare API: 3Formatare suplimentară: 3Timp de răspuns (mediu)15.87sTimp de răspuns (maxim)118.35sTimp de răspuns (total)349.16sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 11Nu a urmat instrucțiunile: 1Apel de instrument invalid: 1Timp de răspuns (mediu)3.12sTimp de răspuns (maxim)44.76sTimp de răspuns (total)68.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
42.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
40.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
5Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
Cost per rezultat
1.091Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
N/DAfișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.077Cost total (preț curent)…
N/DCost total (preț curent)…
Preț de intrare
$0.150 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$0.600 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
50,423Total tokenuri de intrare…
122,463Total tokenuri de intrare…
Tokenuri de ieșire
4,144Tokenuri de ieșire…
11,445Tokenuri de ieșire…
Tokenuri de raționament
110,510Tokenuri de raționament…
0Tokenuri de raționament…
Timp de răspuns (mediu)
15.87sTimp de răspuns (mediu)…
3.12sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
118.35sTimp de răspuns (maxim)…
44.76sTimp de răspuns (maxim)…
Timp de răspuns (total)
349.16sTimp de răspuns (total)…
68.69sTimp de răspuns (total)…
Parametri
~35B în total (~3B activi)
27.3B
Disponibilitate
Închis
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#201 KAT-Coder-Air V2.5
high
SVG invalid
Cost
$0.000
Timp
300.0s
Tokenuri
0 tok
#211 Qwen3.8 27B
noneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Răspuns greșit: 1Timp de răspuns (mediu)2.49sTimp de răspuns (maxim)3.97sTimp de răspuns (total)9.97sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.49sTimp de răspuns (mediu)…
615Total tokenuri de intrare…
204Tokenuri de ieșire…
1,290Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)828msTimp de răspuns (maxim)1.95sTimp de răspuns (total)3.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Formatare suplimentară: 1Răspuns greșit: 1Timp de răspuns (mediu)39.07sTimp de răspuns (maxim)104.98sTimp de răspuns (total)117.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
39.07sTimp de răspuns (mediu)…
6,948Total tokenuri de intrare…
1,166Tokenuri de ieșire…
55,883Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)1.19sTimp de răspuns (maxim)1.97sTimp de răspuns (total)3.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)74.48sTimp de răspuns (maxim)118.35sTimp de răspuns (total)148.95sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
74.48sTimp de răspuns (mediu)…
23,854Total tokenuri de intrare…
485Tokenuri de ieșire…
28,559Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Răspuns greșit: 1Timp de răspuns (mediu)24.10sTimp de răspuns (maxim)44.76sTimp de răspuns (total)48.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)3.59sTimp de răspuns (maxim)4.92sTimp de răspuns (total)7.18sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.59sTimp de răspuns (mediu)…
7,776Total tokenuri de intrare…
284Tokenuri de ieșire…
2,140Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.14sTimp de răspuns (maxim)1.18sTimp de răspuns (total)2.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 2Răspuns greșit: 1Timp de răspuns (mediu)7.28sTimp de răspuns (maxim)8.71sTimp de răspuns (total)21.85sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.28sTimp de răspuns (mediu)…
724Total tokenuri de intrare…
1,101Tokenuri de ieșire…
7,738Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)552msTimp de răspuns (maxim)675msTimp de răspuns (total)1.66sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)7.10sTimp de răspuns (maxim)7.10sTimp de răspuns (total)7.10sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.10sTimp de răspuns (mediu)…
516Total tokenuri de intrare…
179Tokenuri de ieșire…
539Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
4.2Scor mediu pe toate testele de benchmark.…
9.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.31sTimp de răspuns (maxim)1.31sTimp de răspuns (total)1.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.51sTimp de răspuns (maxim)1.91sTimp de răspuns (total)3.01sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.51sTimp de răspuns (mediu)…
699Total tokenuri de intrare…
90Tokenuri de ieșire…
675Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)582msTimp de răspuns (maxim)633msTimp de răspuns (total)1.16sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)2.47sTimp de răspuns (maxim)2.86sTimp de răspuns (total)7.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.47sTimp de răspuns (mediu)…
696Total tokenuri de intrare…
285Tokenuri de ieșire…
1,576Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)1.25sTimp de răspuns (maxim)1.84sTimp de răspuns (total)3.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.77sTimp de răspuns (maxim)4.77sTimp de răspuns (total)4.77sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.77sTimp de răspuns (mediu)…
8,391Total tokenuri de intrare…
330Tokenuri de ieșire…
1,082Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.75sTimp de răspuns (maxim)2.75sTimp de răspuns (total)2.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)21.72sTimp de răspuns (maxim)21.72sTimp de răspuns (total)21.72sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
21.72sTimp de răspuns (mediu)…
204Total tokenuri de intrare…
20Tokenuri de ieșire…
11,028Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)703msTimp de răspuns (maxim)703msTimp de răspuns (total)703msUn test este considerat trecut complet doar dacă toate rulările lui trec.…