Scorul mediu este practic egal la 5.4 vs 5.4. North Mini Code (medium) are costul de benchmark mai mic, $0.000 vs ~$0.010. Qwen3.8 27B este mai rapid cu 5.05s vs 140.39s, cu rate de reușită de 42.0% vs 39.1%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-10-01
Modele comparate
Rang
#273
Total tokenuri de ieșire
1,818,271
Timp de răspuns (mediu)
140.39s
Cost total
$0.000
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#272
Total tokenuri de ieșire
13,791
Timp de răspuns (mediu)
5.05s
Cost total
~$0.010Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Model recomandatQwen3.8 27B
Are cel mai bun scor aici (5.4) și răspunde de aproximativ 27.8x mai rapid decât North Mini Code (medium).
Qwen3.8 27BQwen3.8 27BnoneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14Disponibil gratuit
Qwen3.8 27BQwen3.8 27BnoneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14Disponibil gratuit
Scor
5.4Scor mediu pe toate testele de benchmark.…
5.4Scor mediu pe toate testele de benchmark.…
Rang
#273
#272
Fiabilitate
8.9Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
8.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 12Nu a urmat instrucțiunile: 1Apel de instrument invalid: 1Timp de răspuns (mediu)5.05sTimp de răspuns (maxim)47.42sTimp de răspuns (total)116.11sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
42.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
39.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
61Rulări totale…
69Rulări totale…
Cost per rezultat
0.000
~0.107Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Cost total
$0.000
~$0.010Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Preț de intrare
$0.000 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$0.000 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
166,347Total tokenuri de intrare…
281,460Total tokenuri de intrare…
Tokenuri de ieșire
423,884Tokenuri de ieșire…
13,791Tokenuri de ieșire…
Tokenuri de raționament
1,394,387Tokenuri de raționament…
0Tokenuri de raționament…
Timp de răspuns (mediu)
140.39sTimp de răspuns (mediu)…
5.05sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
786.72sTimp de răspuns (maxim)…
47.42sTimp de răspuns (maxim)…
Timp de răspuns (total)
3229.07sTimp de răspuns (total)…
116.11sTimp de răspuns (total)…
Parametri
30B în total (3B activi)
27.3B
Disponibilitate
Sursă deschisă
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#273 North Mini Code
medium
Cost
$0.000
Timp
51.8s
Tokenuri
12,460 tok
#272 Qwen3.8 27B
noneRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.001Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)105.20sTimp de răspuns (maxim)105.20sTimp de răspuns (total)105.20sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
105.20sTimp de răspuns (mediu)…
84,605Total tokenuri de intrare…
0Tokenuri de ieșire…
53,480Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)47.42sTimp de răspuns (maxim)47.42sTimp de răspuns (total)47.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Timp de răspuns (mediu)64.79sTimp de răspuns (maxim)230.24sTimp de răspuns (total)259.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
64.79sTimp de răspuns (mediu)…
324Total tokenuri de intrare…
64,441Tokenuri de ieșire…
68,535Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)828msTimp de răspuns (maxim)1.95sTimp de răspuns (total)3.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)320.43sTimp de răspuns (maxim)357.05sTimp de răspuns (total)961.28sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
320.43sTimp de răspuns (mediu)…
7,119Total tokenuri de intrare…
219,891Tokenuri de ieșire…
561,569Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)1.19sTimp de răspuns (maxim)1.97sTimp de răspuns (total)3.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
16.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Apel de instrument invalid: 1Timp de răspuns (mediu)554.89sTimp de răspuns (maxim)786.72sTimp de răspuns (total)1109.78sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
554.89sTimp de răspuns (mediu)…
63,682Total tokenuri de intrare…
0Tokenuri de ieșire…
472,040Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Răspuns greșit: 1Timp de răspuns (mediu)24.10sTimp de răspuns (maxim)44.76sTimp de răspuns (total)48.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)24.06sTimp de răspuns (maxim)26.90sTimp de răspuns (total)48.13sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
24.06sTimp de răspuns (mediu)…
6,819Total tokenuri de intrare…
240Tokenuri de ieșire…
2,659Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.14sTimp de răspuns (maxim)1.18sTimp de răspuns (total)2.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp expirat: 1Timp de răspuns (mediu)107.19sTimp de răspuns (maxim)195.94sTimp de răspuns (total)321.57sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
107.19sTimp de răspuns (mediu)…
550Total tokenuri de intrare…
7,595Tokenuri de ieșire…
102,957Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)552msTimp de răspuns (maxim)675msTimp de răspuns (total)1.66sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)25.08sTimp de răspuns (maxim)25.08sTimp de răspuns (total)25.08sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
25.08sTimp de răspuns (mediu)…
444Total tokenuri de intrare…
1,546Tokenuri de ieșire…
1,635Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
4.2Scor mediu pe toate testele de benchmark.…
9.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.31sTimp de răspuns (maxim)1.31sTimp de răspuns (total)1.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)15.43sTimp de răspuns (maxim)28.25sTimp de răspuns (total)30.85sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
15.43sTimp de răspuns (mediu)…
379Total tokenuri de intrare…
909Tokenuri de ieșire…
1,339Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)582msTimp de răspuns (maxim)633msTimp de răspuns (total)1.16sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)19.70sTimp de răspuns (maxim)36.03sTimp de răspuns (total)59.10sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
19.70sTimp de răspuns (mediu)…
543Total tokenuri de intrare…
2,215Tokenuri de ieșire…
2,485Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)1.25sTimp de răspuns (maxim)1.84sTimp de răspuns (total)3.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.93sTimp de răspuns (maxim)3.93sTimp de răspuns (total)3.93sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.93sTimp de răspuns (mediu)…
1,776Total tokenuri de intrare…
41Tokenuri de ieșire…
563Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.75sTimp de răspuns (maxim)2.75sTimp de răspuns (total)2.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)305.02sTimp de răspuns (maxim)305.02sTimp de răspuns (total)305.02sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
305.02sTimp de răspuns (mediu)…
106Total tokenuri de intrare…
127,006Tokenuri de ieșire…
127,125Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)703msTimp de răspuns (maxim)703msTimp de răspuns (total)703msUn test este considerat trecut complet doar dacă toate rulările lui trec.…