GPT-5.5 (low) conduce la scorul mediu cu 9.3 vs 4.7. Hunter Alpha (medium) are costul de benchmark mai mic, $0.000 vs $1.253. GPT-5.5 (low) este mai rapid cu 10.13s vs 10.33s, cu rate de reușită de 86.4% vs 53.0%.
Model recomandatGPT-5.5 (low)Are cel mai puternic scor din această comparație (9.3) și cel mai bun echilibru între cost și timp de răspuns dintre toate cele 2 modele.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-07-25
Hunter AlphaHunter AlphamediumModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-03-11
Scor
9.3Scor mediu pe toate testele de benchmark.…
4.7Scor mediu pe toate testele de benchmark.…
Rang
#9
#199
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
N/DScorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
6.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)10.13sTimp de răspuns (maxim)56.19sTimp de răspuns (total)222.82sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
86.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
53.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
6Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
52Rulări totale…
Cost per rezultat
6.594Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.000Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$1.253Cost total (preț curent)…
$0.000Cost total (preț curent)…
Preț de intrare
$5.000 / 1MPreț de intrare…
$0.000 / 1MPreț de intrare…
Preț de ieșire
$30.000 / 1MPreț de ieșire…
$0.000 / 1MPreț de ieșire…
Total tokenuri de intrare
80,058Total tokenuri de intrare…
28,927Total tokenuri de intrare…
Tokenuri de ieșire
5,378Tokenuri de ieșire…
4,682Tokenuri de ieșire…
Tokenuri de raționament
23,040Tokenuri de raționament…
17,969Tokenuri de raționament…
Timp de răspuns (mediu)
10.13sTimp de răspuns (mediu)…
10.33sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
56.19sTimp de răspuns (maxim)…
30.53sTimp de răspuns (maxim)…
Timp de răspuns (total)
222.82sTimp de răspuns (total)…
175.58sTimp de răspuns (total)…
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#9 GPT-5.5
low
Cost
$0.068
Timp
37.0s
Tokenuri
2,339 tok
#199 Hunter Alpha
medium
Hunter Alpha was a stealth model revealed on March 18th as an early testing version of MiMo-V2-Pro. Find it here: https://openrouter.ai/xiaomi/mimo-v2-pro
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.41sTimp de răspuns (maxim)6.32sTimp de răspuns (total)17.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.41sTimp de răspuns (mediu)…
606Total tokenuri de intrare…
238Tokenuri de ieșire…
1,020Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.3Scor mediu pe toate testele de benchmark.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)4.75sTimp de răspuns (maxim)7.62sTimp de răspuns (total)19.00sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)15.04sTimp de răspuns (maxim)21.06sTimp de răspuns (total)45.11sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
15.04sTimp de răspuns (mediu)…
7,302Total tokenuri de intrare…
423Tokenuri de ieșire…
6,402Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
9.8Scor mediu pe toate testele de benchmark.…
3.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)13.73sTimp de răspuns (maxim)17.90sTimp de răspuns (total)27.46sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
13.73sTimp de răspuns (mediu)…
56,868Total tokenuri de intrare…
3,635Tokenuri de ieșire…
1,297Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
2.3Scor mediu pe toate testele de benchmark.…
8.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Timp de răspuns (mediu)30.53sTimp de răspuns (maxim)30.53sTimp de răspuns (total)30.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.28sTimp de răspuns (maxim)5.13sTimp de răspuns (total)6.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.28sTimp de răspuns (mediu)…
7,140Total tokenuri de intrare…
228Tokenuri de ieșire…
157Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)23.16sTimp de răspuns (maxim)26.55sTimp de răspuns (total)46.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)28.05sTimp de răspuns (maxim)56.19sTimp de răspuns (total)84.16sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
28.05sTimp de răspuns (mediu)…
723Total tokenuri de intrare…
69Tokenuri de ieșire…
11,609Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Timp expirat: 1Răspuns greșit: 1Timp de răspuns (mediu)10.52sTimp de răspuns (maxim)18.68sTimp de răspuns (total)31.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.17sTimp de răspuns (maxim)5.17sTimp de răspuns (total)5.17sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.17sTimp de răspuns (mediu)…
477Total tokenuri de intrare…
133Tokenuri de ieșire…
245Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.0Scor mediu pe toate testele de benchmark.…
3.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)6.44sTimp de răspuns (maxim)6.44sTimp de răspuns (total)6.44sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.74sTimp de răspuns (maxim)3.99sTimp de răspuns (total)7.48sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.74sTimp de răspuns (mediu)…
660Total tokenuri de intrare…
93Tokenuri de ieșire…
415Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.18sTimp de răspuns (maxim)4.46sTimp de răspuns (total)8.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.74sTimp de răspuns (maxim)5.61sTimp de răspuns (total)14.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.74sTimp de răspuns (mediu)…
642Total tokenuri de intrare…
279Tokenuri de ieșire…
954Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.1Scor mediu pe toate testele de benchmark.…
4.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)5.35sTimp de răspuns (maxim)6.20sTimp de răspuns (total)16.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.96sTimp de răspuns (maxim)4.96sTimp de răspuns (total)4.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.96sTimp de răspuns (mediu)…
5,445Total tokenuri de intrare…
250Tokenuri de ieșire…
101Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)17.33sTimp de răspuns (maxim)17.33sTimp de răspuns (total)17.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)10.06sTimp de răspuns (maxim)10.06sTimp de răspuns (total)10.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.06sTimp de răspuns (mediu)…
195Total tokenuri de intrare…
30Tokenuri de ieșire…
840Tokenuri de raționament…
Hunter AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
0.0Scor mediu pe toate testele de benchmark.…
0.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…