Scorul mediu este practic egal la 8.4 vs 8.4. GPT-6 Sol (low) are costul de benchmark mai mic, $0.273 vs ~$0.287. GPT-6 Sol (low) este mai rapid cu 6.92s vs 167.89s, cu rate de reușită de 86.4% vs 77.3%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-09-23
Modele comparate
Rang
#68
Total tokenuri de ieșire
11,677
Timp de răspuns (mediu)
6.92s
Cost total
$0.273
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#65
Total tokenuri de ieșire
656,635
Timp de răspuns (mediu)
167.89s
Cost total
~$0.287Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Model recomandatGPT-6 Sol (low)
Are cel mai bun scor aici (8.4) și răspunde de aproximativ 24.3x mai rapid decât Qwen3.8 27B (high).
Qwen3.8 27BQwen3.8 27BhighRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BhighRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Scor
8.4Scor mediu pe toate testele de benchmark.…
8.4Scor mediu pe toate testele de benchmark.…
Rang
#68
#65
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
9.6Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
8.5Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
66/66
66/66
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Timp de răspuns (mediu)6.92sTimp de răspuns (maxim)17.91sTimp de răspuns (total)152.17sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Fără răspuns: 2Răspuns greșit: 2Timp de răspuns (mediu)167.89sTimp de răspuns (maxim)640.85sTimp de răspuns (total)3693.54sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
86.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
77.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
Cost per rezultat
1.604
~1.792Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Cost total
$0.273
~$0.287Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Preț de intrare
$2.000 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$10.000 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
77,882Total tokenuri de intrare…
100,179Total tokenuri de intrare…
Tokenuri de ieșire
4,047Tokenuri de ieșire…
904Tokenuri de ieșire…
Tokenuri de raționament
7,630Tokenuri de raționament…
655,731Tokenuri de raționament…
Timp de răspuns (mediu)
6.92sTimp de răspuns (mediu)…
167.89sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
17.91sTimp de răspuns (maxim)…
640.85sTimp de răspuns (maxim)…
Timp de răspuns (total)
152.17sTimp de răspuns (total)…
3693.54sTimp de răspuns (total)…
Parametri
~2T în total (~150B activi)
27.3B
Disponibilitate
Închis
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#68 GPT-6 Sol
low
Cost
$0.018
Timp
17.4s
Tokenuri
1,850 tok
#65 Qwen3.8 27B
highRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.008Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.43sTimp de răspuns (maxim)3.18sTimp de răspuns (total)9.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.43sTimp de răspuns (mediu)…
606Total tokenuri de intrare…
172Tokenuri de ieșire…
339Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.10sTimp de răspuns (maxim)21.48sTimp de răspuns (total)32.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)8.74sTimp de răspuns (maxim)16.82sTimp de răspuns (total)26.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.74sTimp de răspuns (mediu)…
7,302Total tokenuri de intrare…
405Tokenuri de ieșire…
1,296Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
8.1Scor mediu pe toate testele de benchmark.…
7.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)248.62sTimp de răspuns (maxim)458.25sTimp de răspuns (total)745.85sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.13sTimp de răspuns (maxim)9.76sTimp de răspuns (total)16.26sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.13sTimp de răspuns (mediu)…
54,674Total tokenuri de intrare…
2,524Tokenuri de ieșire…
512Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)185.57sTimp de răspuns (maxim)333.21sTimp de răspuns (total)371.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)13.63sTimp de răspuns (maxim)14.86sTimp de răspuns (total)27.26sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
13.63sTimp de răspuns (mediu)…
7,140Total tokenuri de intrare…
224Tokenuri de ieșire…
17Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)34.85sTimp de răspuns (maxim)57.71sTimp de răspuns (total)69.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)11.45sTimp de răspuns (maxim)16.44sTimp de răspuns (total)34.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
11.45sTimp de răspuns (mediu)…
732Total tokenuri de intrare…
71Tokenuri de ieșire…
4,573Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Răspuns greșit: 1Timp de răspuns (mediu)526.74sTimp de răspuns (maxim)640.85sTimp de răspuns (total)1580.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)17.91sTimp de răspuns (maxim)17.91sTimp de răspuns (total)17.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
17.91sTimp de răspuns (mediu)…
477Total tokenuri de intrare…
83Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)8.45sTimp de răspuns (maxim)8.45sTimp de răspuns (total)8.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.37sTimp de răspuns (maxim)2.57sTimp de răspuns (total)4.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.37sTimp de răspuns (mediu)…
660Total tokenuri de intrare…
93Tokenuri de ieșire…
185Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
9.8Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.24sTimp de răspuns (maxim)10.18sTimp de răspuns (total)16.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.66sTimp de răspuns (maxim)3.06sTimp de răspuns (total)7.97sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.66sTimp de răspuns (mediu)…
642Total tokenuri de intrare…
209Tokenuri de ieșire…
314Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.6Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)199.90sTimp de răspuns (maxim)569.33sTimp de răspuns (total)599.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.03sTimp de răspuns (maxim)4.03sTimp de răspuns (total)4.03sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.03sTimp de răspuns (mediu)…
5,454Total tokenuri de intrare…
236Tokenuri de ieșire…
16Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.62sTimp de răspuns (maxim)5.62sTimp de răspuns (total)5.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)3.67sTimp de răspuns (maxim)3.67sTimp de răspuns (total)3.67sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.67sTimp de răspuns (mediu)…
195Total tokenuri de intrare…
30Tokenuri de ieșire…
378Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)263.98sTimp de răspuns (maxim)263.98sTimp de răspuns (total)263.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…