Comparație benchmark Gemini 3 Flash Preview vs Grok 4.20 Beta: Gemini 3 Flash Preview conduce la scorul mediu cu 9.8 vs 5.8. Grok 4.20 Beta are costul de benchmark mai mic, $0.087 vs $0.667. Grok 4.20 Beta este mai rapid cu 1.19s vs 18.64s, cu rate de reușită de 98.4% vs 37.0%.
Model recomandat: Grok 4.20 Beta - Oferă cel mai bun compromis per total: scor competitiv (5.8), cost mai mic decât Gemini 3 Flash Preview și timp de răspuns echilibrat.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-10
Grok 4.20 BetaGrok 4.20 BetanoneModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-03-12
Scor
9.8Scor mediu pe toate testele de benchmark.…
5.8Scor mediu pe toate testele de benchmark.…
Rang
#1
#107
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
N/DScorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)18.64sTimp de răspuns (maxim)117.26sTimp de răspuns (total)391.35sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 10Nu a urmat instrucțiunile: 1Apel de instrument invalid: 1Timp de răspuns (mediu)1.19sTimp de răspuns (maxim)6.48sTimp de răspuns (total)21.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
98.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
37.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
63Rulări totale…
52Rulări totale…
Cost per rezultat
3.335Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
1.510Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.667Cost total (preț curent)…
$0.087Cost total (preț curent)…
Preț de intrare
$0.500 / 1MPreț de intrare…
$2.041 / 1MPreț de intrare…
Preț de ieșire
$3.000 / 1MPreț de ieșire…
$2.041 / 1MPreț de ieșire…
Total tokenuri de intrare
37,017Total tokenuri de intrare…
40,597Total tokenuri de intrare…
Tokenuri de ieșire
2,006Tokenuri de ieșire…
1,657Tokenuri de ieșire…
Tokenuri de raționament
214,153Tokenuri de raționament…
0Tokenuri de raționament…
Timp de răspuns (mediu)
18.64sTimp de răspuns (mediu)…
1.19sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
117.26sTimp de răspuns (maxim)…
6.48sTimp de răspuns (maxim)…
Timp de răspuns (total)
391.35sTimp de răspuns (total)…
21.43sTimp de răspuns (total)…
Generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.88sTimp de răspuns (maxim)5.73sTimp de răspuns (total)15.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.88sTimp de răspuns (mediu)…
494Total tokenuri de intrare…
330Tokenuri de ieșire…
3,216Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
4.0Scor mediu pe toate testele de benchmark.…
8.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
16.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Timp de răspuns (mediu)597msTimp de răspuns (maxim)866msTimp de răspuns (total)2.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)84.40sTimp de răspuns (maxim)117.26sTimp de răspuns (total)253.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
84.40sTimp de răspuns (mediu)…
8,122Total tokenuri de intrare…
462Tokenuri de ieșire…
161,084Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.14sTimp de răspuns (maxim)1.14sTimp de răspuns (total)1.14sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)22.42sTimp de răspuns (maxim)22.42sTimp de răspuns (total)22.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
22.42sTimp de răspuns (mediu)…
12,873Total tokenuri de intrare…
351Tokenuri de ieșire…
10,485Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Timp de răspuns (mediu)6.48sTimp de răspuns (maxim)6.48sTimp de răspuns (total)6.48sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.43sTimp de răspuns (maxim)6.18sTimp de răspuns (total)10.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.43sTimp de răspuns (mediu)…
7,548Total tokenuri de intrare…
279Tokenuri de ieșire…
4,893Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)601msTimp de răspuns (maxim)634msTimp de răspuns (total)1.20sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)15.27sTimp de răspuns (maxim)34.09sTimp de răspuns (total)45.80sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
15.27sTimp de răspuns (mediu)…
633Total tokenuri de intrare…
12Tokenuri de ieșire…
21,684Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)611msTimp de răspuns (maxim)616msTimp de răspuns (total)1.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.19sTimp de răspuns (maxim)5.19sTimp de răspuns (total)5.19sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.19sTimp de răspuns (mediu)…
486Total tokenuri de intrare…
72Tokenuri de ieșire…
1,905Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)541msTimp de răspuns (maxim)541msTimp de răspuns (total)541msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.04sTimp de răspuns (maxim)4.70sTimp de răspuns (total)8.08sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.04sTimp de răspuns (mediu)…
615Total tokenuri de intrare…
72Tokenuri de ieșire…
2,709Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)649msTimp de răspuns (maxim)952msTimp de răspuns (total)1.30sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.05sTimp de răspuns (maxim)5.64sTimp de răspuns (total)12.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.05sTimp de răspuns (mediu)…
558Total tokenuri de intrare…
183Tokenuri de ieșire…
4,365Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)586msTimp de răspuns (maxim)813msTimp de răspuns (total)1.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)12.60sTimp de răspuns (maxim)12.60sTimp de răspuns (total)12.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
12.60sTimp de răspuns (mediu)…
5,532Total tokenuri de intrare…
234Tokenuri de ieșire…
1,487Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.79sTimp de răspuns (maxim)4.79sTimp de răspuns (total)4.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.50sTimp de răspuns (maxim)5.50sTimp de răspuns (total)5.50sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.50sTimp de răspuns (mediu)…
156Total tokenuri de intrare…
11Tokenuri de ieșire…
2,325Tokenuri de raționament…
Grok 4.20 BetaModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.