Muse Spark 1.1 (high) conduce la scorul mediu cu 8.0 vs 7.9. Qwen3.8 27B (low) are costul de benchmark mai mic, ~$0.071 vs $1.709. Muse Spark 1.1 (high) este mai rapid cu 30.84s vs 39.11s, cu rate de reușită de 68.2% vs 68.2%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-08-29
Rang
#53
Total tokenuri de ieșire
363,989
Timp de răspuns (mediu)
30.84s
Cost total
$1.709
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#62
Total tokenuri de ieșire
169,329
Timp de răspuns (mediu)
39.11s
Cost total
~$0.071Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Model recomandatQwen3.8 27B (low)
Scorul rămâne aproape de cel mai bun scor de aici (7.9 vs 8.0) și costă de aproximativ 24.1x mai puțin decât Muse Spark 1.1 (high).
Qwen3.8 27BQwen3.8 27BlowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Scor
8.0Scor mediu pe toate testele de benchmark.…
7.9Scor mediu pe toate testele de benchmark.…
Rang
#53
#62
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
7.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Fără răspuns: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)39.11sTimp de răspuns (maxim)376.04sTimp de răspuns (total)860.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
68.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
68.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
6Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
64Rulări totale…
66Rulări totale…
Cost per rezultat
14.236
~0.473Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Cost total
$1.709
~$0.071Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Preț de intrare
$1.250 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$4.250 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
129,003Total tokenuri de intrare…
99,705Total tokenuri de intrare…
Tokenuri de ieșire
8,340Tokenuri de ieșire…
1,545Tokenuri de ieșire…
Tokenuri de raționament
355,649Tokenuri de raționament…
167,784Tokenuri de raționament…
Timp de răspuns (mediu)
30.84sTimp de răspuns (mediu)…
39.11sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
196.03sTimp de răspuns (maxim)…
376.04sTimp de răspuns (maxim)…
Timp de răspuns (total)
647.67sTimp de răspuns (total)…
860.51sTimp de răspuns (total)…
Parametri
~1T în total (~50B activi)
27.3B
Disponibilitate
Închis
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#53 Muse Spark 1.1
high
Cost
$0.039
Timp
50.1s
Tokenuri
9,423 tok
#62 Qwen3.8 27B
lowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.003Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
8.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)8.60sTimp de răspuns (maxim)15.63sTimp de răspuns (total)34.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.60sTimp de răspuns (mediu)…
2,334Total tokenuri de intrare…
516Tokenuri de ieșire…
13,023Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.02sTimp de răspuns (maxim)5.68sTimp de răspuns (total)12.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)22.92sTimp de răspuns (maxim)27.22sTimp de răspuns (total)68.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
22.92sTimp de răspuns (mediu)…
8,562Total tokenuri de intrare…
349Tokenuri de ieșire…
36,039Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)140.92sTimp de răspuns (maxim)376.04sTimp de răspuns (total)422.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 2Timp de răspuns (mediu)70.25sTimp de răspuns (maxim)78.10sTimp de răspuns (total)140.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
70.25sTimp de răspuns (mediu)…
90,082Total tokenuri de intrare…
5,535Tokenuri de ieșire…
68,439Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)90.63sTimp de răspuns (maxim)143.71sTimp de răspuns (total)181.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.40sTimp de răspuns (maxim)10.84sTimp de răspuns (total)16.81sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.40sTimp de răspuns (mediu)…
7,827Total tokenuri de intrare…
240Tokenuri de ieșire…
5,907Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.03sTimp de răspuns (maxim)9.09sTimp de răspuns (total)16.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Formatare suplimentară: 1Răspuns greșit: 1Timp de răspuns (mediu)60.59sTimp de răspuns (maxim)67.02sTimp de răspuns (total)121.18sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
60.59sTimp de răspuns (mediu)…
852Total tokenuri de intrare…
329Tokenuri de ieșire…
67,684Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)60.78sTimp de răspuns (maxim)120.94sTimp de răspuns (total)182.34sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.73sTimp de răspuns (maxim)7.73sTimp de răspuns (total)7.73sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.73sTimp de răspuns (mediu)…
906Total tokenuri de intrare…
116Tokenuri de ieșire…
3,390Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)5.37sTimp de răspuns (maxim)5.37sTimp de răspuns (total)5.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)7.81sTimp de răspuns (maxim)9.13sTimp de răspuns (total)15.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.81sTimp de răspuns (mediu)…
1,527Total tokenuri de intrare…
193Tokenuri de ieșire…
7,158Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.43sTimp de răspuns (maxim)2.87sTimp de răspuns (total)4.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)69.96sTimp de răspuns (maxim)196.03sTimp de răspuns (total)209.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
69.96sTimp de răspuns (mediu)…
1,938Total tokenuri de intrare…
225Tokenuri de ieșire…
140,780Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.91sTimp de răspuns (maxim)8.81sTimp de răspuns (total)14.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.88sTimp de răspuns (maxim)9.88sTimp de răspuns (total)9.88sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.88sTimp de răspuns (mediu)…
14,363Total tokenuri de intrare…
795Tokenuri de ieșire…
2,938Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)8.42sTimp de răspuns (maxim)8.42sTimp de răspuns (total)8.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)22.93sTimp de răspuns (maxim)22.93sTimp de răspuns (total)22.93sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
22.93sTimp de răspuns (mediu)…
612Total tokenuri de intrare…
42Tokenuri de ieșire…
10,291Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)12.64sTimp de răspuns (maxim)12.64sTimp de răspuns (total)12.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…