Claude Sonnet 4.6 (medium) vs Qwen3.8 27B (medium)
Claude Sonnet 4.6 (medium) conduce la scorul mediu cu 7.8 vs 7.8. Qwen3.8 27B (medium) are costul de benchmark mai mic, ~$0.058 vs $2.126. Claude Sonnet 4.6 (medium) este mai rapid cu 28.08s vs 33.05s, cu rate de reușită de 65.2% vs 66.7%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-09-28
Modele comparate
Rang
#100
Total tokenuri de ieșire
120,427
Timp de răspuns (mediu)
28.08s
Cost total
$2.126
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#101
Total tokenuri de ieșire
136,162
Timp de răspuns (mediu)
33.05s
Cost total
~$0.058Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Model recomandatQwen3.8 27B (medium)
Scorul rămâne aproape de cel mai bun scor de aici (7.8 vs 7.8) și costă de aproximativ 37.2x mai puțin decât Claude Sonnet 4.6 (medium).
Qwen3.8 27BQwen3.8 27BmediumRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Scor
7.8Scor mediu pe toate testele de benchmark.…
7.8Scor mediu pe toate testele de benchmark.…
Rang
#100
#101
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
9.6Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.5Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
66/66
66/66
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Formatare suplimentară: 3Timp expirat: 1Timp de răspuns (mediu)28.08sTimp de răspuns (maxim)140.96sTimp de răspuns (total)421.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
65.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
Cost per rezultat
15.182
~0.409Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Cost total
$2.126
~$0.058Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Preț de intrare
$3.000 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$15.000 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
106,316Total tokenuri de intrare…
98,266Total tokenuri de intrare…
Tokenuri de ieșire
79,338Tokenuri de ieșire…
1,861Tokenuri de ieșire…
Tokenuri de raționament
41,089Tokenuri de raționament…
134,301Tokenuri de raționament…
Timp de răspuns (mediu)
28.08sTimp de răspuns (mediu)…
33.05sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
140.96sTimp de răspuns (maxim)…
214.63sTimp de răspuns (maxim)…
Timp de răspuns (total)
421.15sTimp de răspuns (total)…
694.04sTimp de răspuns (total)…
Parametri
~1T în total (~100B activi)
27.3B
Disponibilitate
Închis
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#100 Claude Sonnet 4.6
medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Cost
$0.000
Timp
300.0s
Tokenuri
0 tok
#101 Qwen3.8 27B
mediumRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.002Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Răspuns greșit: 1Timp de răspuns (mediu)2.98sTimp de răspuns (maxim)4.95sTimp de răspuns (total)5.97sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.98sTimp de răspuns (mediu)…
789Total tokenuri de intrare…
1,046Tokenuri de ieșire…
1,093Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.93sTimp de răspuns (maxim)5.18sTimp de răspuns (total)11.70sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Răspuns greșit: 1Timp de răspuns (mediu)33.29sTimp de răspuns (maxim)35.76sTimp de răspuns (total)99.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
33.29sTimp de răspuns (mediu)…
6,995Total tokenuri de intrare…
16,089Tokenuri de ieșire…
3,686Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)40.50sTimp de răspuns (maxim)72.14sTimp de răspuns (total)121.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)93.65sTimp de răspuns (maxim)140.96sTimp de răspuns (total)187.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
93.65sTimp de răspuns (mediu)…
75,531Total tokenuri de intrare…
31,916Tokenuri de ieșire…
9,109Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
8.7Scor mediu pe toate testele de benchmark.…
6.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Timp de răspuns (mediu)124.48sTimp de răspuns (maxim)214.63sTimp de răspuns (total)248.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)13.90sTimp de răspuns (maxim)13.90sTimp de răspuns (total)13.90sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
13.90sTimp de răspuns (mediu)…
8,676Total tokenuri de intrare…
649Tokenuri de ieșire…
742Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)8.76sTimp de răspuns (maxim)10.36sTimp de răspuns (total)17.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Timp expirat: 1Răspuns greșit: 1Timp de răspuns (mediu)58.37sTimp de răspuns (maxim)58.37sTimp de răspuns (total)58.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
58.37sTimp de răspuns (mediu)…
495Total tokenuri de intrare…
24,380Tokenuri de ieșire…
22,891Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)76.98sTimp de răspuns (maxim)144.07sTimp de răspuns (total)230.93sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.94sTimp de răspuns (maxim)4.94sTimp de răspuns (total)4.94sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.94sTimp de răspuns (mediu)…
564Total tokenuri de intrare…
256Tokenuri de ieșire…
433Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)9.20sTimp de răspuns (maxim)9.20sTimp de răspuns (total)9.20sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.61sTimp de răspuns (maxim)2.61sTimp de răspuns (total)2.61sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.61sTimp de răspuns (mediu)…
792Total tokenuri de intrare…
318Tokenuri de ieșire…
552Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.54sTimp de răspuns (maxim)2.67sTimp de răspuns (total)5.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.31sTimp de răspuns (maxim)6.24sTimp de răspuns (total)10.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.31sTimp de răspuns (mediu)…
816Total tokenuri de intrare…
592Tokenuri de ieșire…
646Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
8.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)12.62sTimp de răspuns (maxim)29.62sTimp de răspuns (total)37.85sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.48sTimp de răspuns (maxim)7.48sTimp de răspuns (total)7.48sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.48sTimp de răspuns (mediu)…
11,454Total tokenuri de intrare…
655Tokenuri de ieșire…
351Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)30.09sTimp de răspuns (maxim)30.09sTimp de răspuns (total)30.09sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
30.09sTimp de răspuns (mediu)…
204Total tokenuri de intrare…
3,437Tokenuri de ieșire…
1,586Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)11.29sTimp de răspuns (maxim)11.29sTimp de răspuns (total)11.29sUn test este considerat trecut complet doar dacă toate rulările lui trec.…