Comparație benchmark Nemotron 3 Super (medium) vs Qwen3.5-122B-A10B (medium) vs Elephant Alpha (medium) vs gpt-oss-120b (medium):Qwen3.5-122B-A10B (medium) conduce la Scor cu 7.1. Qwen3.5-122B-A10B (medium) conduce la Fiabilitate cu 10.0. Elephant Alpha (medium) are cel mai mic Cost total, $0.000. Elephant Alpha (medium) are cel mai rapid timp de răspuns, 1.27s.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-09-04
Rang
#217
Total tokenuri de ieșire
115,574
Timp de răspuns (mediu)
52.31s
Cost total
$0.050
Rang
#127
Total tokenuri de ieșire
487,519
Timp de răspuns (mediu)
65.67s
Cost total
$1.207
Rang
#295
Total tokenuri de ieșire
2,596
Timp de răspuns (mediu)
1.27s
Cost total
$0.000
Rang
#189
Total tokenuri de ieșire
98,282
Timp de răspuns (mediu)
20.81s
Cost total
$0.020
Model recomandatgpt-oss-120b (medium)
Oferă cel mai bun compromis per total: scor competitiv (6.1), cost mai mic decât celelalte modele din această comparație și timp de răspuns echilibrat.
9.1Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
N/DScorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
8.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.5Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Timp expirat: 2Apel de instrument invalid: 1Timp de răspuns (mediu)65.67sTimp de răspuns (maxim)519.30sTimp de răspuns (total)1444.68sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 9Nu a urmat instrucțiunile: 3Apel de instrument invalid: 1Timp de răspuns (mediu)20.81sTimp de răspuns (maxim)68.16sTimp de răspuns (total)332.88sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
40.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
71.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
28.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
3Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
5Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
63Rulări totale…
66Rulări totale…
Cost per rezultat
0.004
8.446
0.000
0.224
Cost total
$0.050
$1.207
$0.000
$0.020
Preț de intrare
$0.085 / 1MPreț de intrare…
$0.290 / 1MPreț de intrare…
$0.000 / 1MPreț de intrare…
$0.037 / 1MPreț de intrare…
Preț de ieșire
$0.400 / 1MPreț de ieșire…
$2.400 / 1MPreț de ieșire…
$0.000 / 1MPreț de ieșire…
$0.170 / 1MPreț de ieșire…
Total tokenuri de intrare
81,438Total tokenuri de intrare…
124,780Total tokenuri de intrare…
33,744Total tokenuri de intrare…
108,767Total tokenuri de intrare…
Tokenuri de ieșire
17,674Tokenuri de ieșire…
47,694Tokenuri de ieșire…
2,596Tokenuri de ieșire…
29,378Tokenuri de ieșire…
Tokenuri de raționament
97,900Tokenuri de raționament…
439,825Tokenuri de raționament…
0Tokenuri de raționament…
68,904Tokenuri de raționament…
Timp de răspuns (mediu)
52.31sTimp de răspuns (mediu)…
65.67sTimp de răspuns (mediu)…
1.27sTimp de răspuns (mediu)…
20.81sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
431.98sTimp de răspuns (maxim)…
519.30sTimp de răspuns (maxim)…
3.70sTimp de răspuns (maxim)…
68.16sTimp de răspuns (maxim)…
Timp de răspuns (total)
1046.21sTimp de răspuns (total)…
1444.68sTimp de răspuns (total)…
22.82sTimp de răspuns (total)…
332.88sTimp de răspuns (total)…
Parametri
120B în total (12B activi)
122B în total (10B activi)
104B în total (7.4B activi)
117B în total (5.1B activi)
Disponibilitate
Ponderi disponibile
Sursă deschisă
Sursă deschisă
Sursă deschisă
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#217 Nemotron 3 Super
medium
Cost
$0.000
Timp
272.6s
Tokenuri
5,296 tok
#127 Qwen3.5-122B-A10B
medium
Cost
$0.019
Timp
48.7s
Tokenuri
6,034 tok
#295 Elephant Alpha
medium
Elephant Alpha was a stealth model revealed on April 21st as Ling-2.6-flash. Find it here: https://openrouter.ai/inclusionai/ling-2.6-flash:free
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)7.85sTimp de răspuns (maxim)22.30sTimp de răspuns (total)31.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.75sTimp de răspuns (maxim)18.03sTimp de răspuns (total)39.01sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.75sTimp de răspuns (mediu)…
672Total tokenuri de intrare…
269Tokenuri de ieșire…
16,835Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.6Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)1.19sTimp de răspuns (maxim)2.04sTimp de răspuns (total)4.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)10.21sTimp de răspuns (maxim)19.76sTimp de răspuns (total)20.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 3Timp de răspuns (mediu)147.32sTimp de răspuns (maxim)232.25sTimp de răspuns (total)294.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Răspuns greșit: 1Timp de răspuns (mediu)114.48sTimp de răspuns (maxim)168.16sTimp de răspuns (total)343.44sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
114.48sTimp de răspuns (mediu)…
7,630Total tokenuri de intrare…
8,057Tokenuri de ieșire…
82,578Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.7Scor mediu pe toate testele de benchmark.…
7.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 2Răspuns greșit: 1Timp de răspuns (mediu)1.30sTimp de răspuns (maxim)1.30sTimp de răspuns (total)1.30sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)38.37sTimp de răspuns (maxim)68.16sTimp de răspuns (total)115.10sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)259.89sTimp de răspuns (maxim)431.98sTimp de răspuns (total)519.77sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Timp de răspuns (mediu)313.55sTimp de răspuns (maxim)519.30sTimp de răspuns (total)627.09sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
313.55sTimp de răspuns (mediu)…
97,886Total tokenuri de intrare…
18,373Tokenuri de ieșire…
203,450Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
1.5Scor mediu pe toate testele de benchmark.…
5.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)3.70sTimp de răspuns (maxim)3.70sTimp de răspuns (total)3.70sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Timp de răspuns (mediu)23.96sTimp de răspuns (maxim)31.18sTimp de răspuns (total)47.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)18.16sTimp de răspuns (maxim)20.65sTimp de răspuns (total)36.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)23.41sTimp de răspuns (maxim)29.79sTimp de răspuns (total)46.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
23.41sTimp de răspuns (mediu)…
7,782Total tokenuri de intrare…
270Tokenuri de ieșire…
16,558Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)979msTimp de răspuns (maxim)1.02sTimp de răspuns (total)1.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.98sTimp de răspuns (maxim)1.98sTimp de răspuns (total)1.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp expirat: 1Timp de răspuns (mediu)19.35sTimp de răspuns (maxim)21.56sTimp de răspuns (total)38.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)74.43sTimp de răspuns (maxim)119.29sTimp de răspuns (total)223.29sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
74.43sTimp de răspuns (mediu)…
780Total tokenuri de intrare…
19,154Tokenuri de ieșire…
61,573Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)925msTimp de răspuns (maxim)1.16sTimp de răspuns (total)2.77sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)27.55sTimp de răspuns (maxim)50.92sTimp de răspuns (total)55.10sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)6.91sTimp de răspuns (maxim)6.91sTimp de răspuns (total)6.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Timp de răspuns (mediu)34.11sTimp de răspuns (maxim)34.11sTimp de răspuns (total)34.11sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
34.11sTimp de răspuns (mediu)…
344Total tokenuri de intrare…
66Tokenuri de ieșire…
7,592Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
4.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)920msTimp de răspuns (maxim)920msTimp de răspuns (total)920msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)7.90sTimp de răspuns (maxim)7.90sTimp de răspuns (total)7.90sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)6.97sTimp de răspuns (maxim)11.23sTimp de răspuns (total)13.95sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.88sTimp de răspuns (maxim)15.44sTimp de răspuns (total)19.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.88sTimp de răspuns (mediu)…
593Total tokenuri de intrare…
77Tokenuri de ieșire…
7,372Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
9.8Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)987msTimp de răspuns (maxim)1.13sTimp de răspuns (total)1.97sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.63sTimp de răspuns (maxim)7.63sTimp de răspuns (total)7.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)3.15sTimp de răspuns (maxim)4.52sTimp de răspuns (total)9.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)17.89sTimp de răspuns (maxim)31.99sTimp de răspuns (total)53.68sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
17.89sTimp de răspuns (mediu)…
696Total tokenuri de intrare…
284Tokenuri de ieșire…
27,575Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)868msTimp de răspuns (maxim)972msTimp de răspuns (total)2.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)21.71sTimp de răspuns (maxim)32.40sTimp de răspuns (total)43.41sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)39.75sTimp de răspuns (maxim)39.75sTimp de răspuns (total)39.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.60sTimp de răspuns (maxim)4.60sTimp de răspuns (total)4.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.60sTimp de răspuns (mediu)…
8,193Total tokenuri de intrare…
322Tokenuri de ieșire…
1,226Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Timp de răspuns (mediu)2.83sTimp de răspuns (maxim)2.83sTimp de răspuns (total)2.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.91sTimp de răspuns (maxim)6.91sTimp de răspuns (total)6.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)55.32sTimp de răspuns (maxim)55.32sTimp de răspuns (total)55.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)52.87sTimp de răspuns (maxim)52.87sTimp de răspuns (total)52.87sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
52.87sTimp de răspuns (mediu)…
204Total tokenuri de intrare…
822Tokenuri de ieșire…
15,066Tokenuri de raționament…
Elephant AlphaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)26.51sTimp de răspuns (maxim)26.51sTimp de răspuns (total)26.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…