Muse Glimmer 30B (high) conduce la scorul mediu cu 7.7 vs 7.6. Qwen3.8 27B (low) are costul de benchmark mai mic, ~$0.089 vs $0.625. Qwen3.8 27B (low) este mai rapid cu 46.60s vs 69.87s, cu rate de reușită de 66.7% vs 68.1%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-10-01
Modele comparate
Rang
#112
Total tokenuri de ieșire
388,743
Timp de răspuns (mediu)
69.87s
Cost total
$0.625
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#117
Total tokenuri de ieșire
209,143
Timp de răspuns (mediu)
46.60s
Cost total
~$0.089Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
Model recomandatQwen3.8 27B (low)
Scorul rămâne aproape de cel mai bun scor de aici (7.6 vs 7.7) și costă de aproximativ 7.1x mai puțin decât Muse Glimmer 30B (high).
Qwen3.8 27BQwen3.8 27BlowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14Disponibil gratuit
Qwen3.8 27BQwen3.8 27BlowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14Disponibil gratuit
Scor
7.7Scor mediu pe toate testele de benchmark.…
7.6Scor mediu pe toate testele de benchmark.…
Rang
#112
#117
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
7.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
69/69
69/69
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 7Nu a urmat instrucțiunile: 3Fără răspuns: 2Timp de răspuns (mediu)69.87sTimp de răspuns (maxim)451.90sTimp de răspuns (total)1607.12sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Fără răspuns: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)46.60sTimp de răspuns (maxim)376.04sTimp de răspuns (total)1071.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
68.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
8Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
69Rulări totale…
69Rulări totale…
Cost per rezultat
5.675
~0.589Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
Cost total
$0.625
~$0.089Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
Preț de intrare
$0.350 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$1.500 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
281,859Total tokenuri de intrare…
315,290Total tokenuri de intrare…
Tokenuri de ieșire
102,526Tokenuri de ieșire…
1,607Tokenuri de ieșire…
Tokenuri de raționament
286,217Tokenuri de raționament…
207,536Tokenuri de raționament…
Timp de răspuns (mediu)
69.87sTimp de răspuns (mediu)…
46.60sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
451.90sTimp de răspuns (maxim)…
376.04sTimp de răspuns (maxim)…
Timp de răspuns (total)
1607.12sTimp de răspuns (total)…
1071.83sTimp de răspuns (total)…
Parametri
30B
27.3B
Disponibilitate
Sursă deschisă
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#112 Muse Glimmer 30B
high
Cost
$0.005
Timp
61.7s
Tokenuri
3,097 tok
#117 Qwen3.8 27B
lowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.003Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)139.73sTimp de răspuns (maxim)139.73sTimp de răspuns (total)139.73sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
139.73sTimp de răspuns (mediu)…
178,365Total tokenuri de intrare…
1,937Tokenuri de ieșire…
16,000Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.1Scor mediu pe toate testele de benchmark.…
3.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)211.32sTimp de răspuns (maxim)211.32sTimp de răspuns (total)211.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
91.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)13.18sTimp de răspuns (maxim)27.66sTimp de răspuns (total)52.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
13.18sTimp de răspuns (mediu)…
810Total tokenuri de intrare…
9,052Tokenuri de ieșire…
11,687Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.02sTimp de răspuns (maxim)5.68sTimp de răspuns (total)12.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)95.97sTimp de răspuns (maxim)127.91sTimp de răspuns (total)287.92sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
95.97sTimp de răspuns (mediu)…
7,419Total tokenuri de intrare…
16,128Tokenuri de ieșire…
55,433Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)140.92sTimp de răspuns (maxim)376.04sTimp de răspuns (total)422.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)115.38sTimp de răspuns (maxim)161.28sTimp de răspuns (total)230.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
115.38sTimp de răspuns (mediu)…
75,453Total tokenuri de intrare…
4,435Tokenuri de ieșire…
49,342Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)90.63sTimp de răspuns (maxim)143.71sTimp de răspuns (total)181.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)14.89sTimp de răspuns (maxim)16.84sTimp de răspuns (total)29.77sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
14.89sTimp de răspuns (mediu)…
7,065Total tokenuri de intrare…
4,422Tokenuri de ieșire…
7,478Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.03sTimp de răspuns (maxim)9.09sTimp de răspuns (total)16.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Fără răspuns: 1Timp de răspuns (mediu)182.58sTimp de răspuns (maxim)451.90sTimp de răspuns (total)547.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
182.58sTimp de răspuns (mediu)…
885Total tokenuri de intrare…
60,569Tokenuri de ieșire…
72,346Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)60.78sTimp de răspuns (maxim)120.94sTimp de răspuns (total)182.34sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)6.36sTimp de răspuns (maxim)6.36sTimp de răspuns (total)6.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.36sTimp de răspuns (mediu)…
525Total tokenuri de intrare…
1,574Tokenuri de ieșire…
1,659Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)5.37sTimp de răspuns (maxim)5.37sTimp de răspuns (total)5.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)8.62sTimp de răspuns (maxim)8.74sTimp de răspuns (total)17.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.62sTimp de răspuns (mediu)…
765Total tokenuri de intrare…
2,259Tokenuri de ieșire…
4,296Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.43sTimp de răspuns (maxim)2.87sTimp de răspuns (total)4.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)64.76sTimp de răspuns (maxim)173.50sTimp de răspuns (total)194.28sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
64.76sTimp de răspuns (mediu)…
795Total tokenuri de intrare…
846Tokenuri de ieșire…
46,992Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.91sTimp de răspuns (maxim)8.81sTimp de răspuns (total)14.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.41sTimp de răspuns (maxim)6.41sTimp de răspuns (total)6.41sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.41sTimp de răspuns (mediu)…
9,546Total tokenuri de intrare…
331Tokenuri de ieșire…
1,137Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)8.42sTimp de răspuns (maxim)8.42sTimp de răspuns (total)8.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)94.20sTimp de răspuns (maxim)94.20sTimp de răspuns (total)94.20sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
94.20sTimp de răspuns (mediu)…
231Total tokenuri de intrare…
973Tokenuri de ieșire…
19,847Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)12.64sTimp de răspuns (maxim)12.64sTimp de răspuns (total)12.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…