Comparație benchmark Gemini 3.5 Flash vs Grok 4.1 Fast: Gemini 3.5 Flash conduce la scorul mediu cu 9.8 vs 5.6. Grok 4.1 Fast are costul de benchmark mai mic, $0.069 vs $1.115. Gemini 3.5 Flash este mai rapid cu 8.84s vs 23.85s, cu rate de reușită de 96.8% vs 55.6%.
Model recomandat: Gemini 3.5 Flash - Are cel mai bun scor aici (9.8) și răspunde de aproximativ 2.7x mai rapid decât Grok 4.1 Fast.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-07-02
Grok 4.1 FastGrok 4.1 FastmediumModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2025-11-19
Scor
9.8Scor mediu pe toate testele de benchmark.…
5.6Scor mediu pe toate testele de benchmark.…
Rang
#1
#119
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
6.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)8.84sTimp de răspuns (maxim)34.82sTimp de răspuns (total)185.57sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 4Răspuns greșit: 4Fără răspuns: 1Timp expirat: 1Timp de răspuns (mediu)23.85sTimp de răspuns (maxim)121.79sTimp de răspuns (total)286.16sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
96.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
6Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
63Rulări totale…
57Rulări totale…
Cost per rezultat
5.575Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.642Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$1.115Cost total (preț curent)…
$0.069Cost total (preț curent)…
Preț de intrare
$1.500 / 1MPreț de intrare…
$0.484 / 1MPreț de intrare…
Preț de ieșire
$9.000 / 1MPreț de ieșire…
$0.484 / 1MPreț de ieșire…
Total tokenuri de intrare
37,594Total tokenuri de intrare…
42,845Total tokenuri de intrare…
Tokenuri de ieșire
1,975Tokenuri de ieșire…
2,006Tokenuri de ieșire…
Tokenuri de raționament
115,638Tokenuri de raționament…
96,334Tokenuri de raționament…
Timp de răspuns (mediu)
8.84sTimp de răspuns (mediu)…
23.85sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
34.82sTimp de răspuns (maxim)…
121.79sTimp de răspuns (maxim)…
Timp de răspuns (total)
185.57sTimp de răspuns (total)…
286.16sTimp de răspuns (total)…
Prezentare generare
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#1 Gemini 3.5 Flash
high
Cost
$0.208
Timp
118.2s
Tokenuri
23,158 tok
#119 Grok 4.1 Fast
medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.57sTimp de răspuns (maxim)3.60sTimp de răspuns (total)10.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.57sTimp de răspuns (mediu)…
492Total tokenuri de intrare…
174Tokenuri de ieșire…
4,997Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
8.7Scor mediu pe toate testele de benchmark.…
7.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
91.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)3.81sTimp de răspuns (maxim)5.65sTimp de răspuns (total)7.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)22.96sTimp de răspuns (maxim)34.82sTimp de răspuns (total)68.88sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
22.96sTimp de răspuns (mediu)…
8,118Total tokenuri de intrare…
456Tokenuri de ieșire…
47,129Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.8Scor mediu pe toate testele de benchmark.…
4.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)23.58sTimp de răspuns (maxim)23.58sTimp de răspuns (total)23.58sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)22.37sTimp de răspuns (maxim)22.37sTimp de răspuns (total)22.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
22.37sTimp de răspuns (mediu)…
12,873Total tokenuri de intrare…
351Tokenuri de ieșire…
16,323Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)37.64sTimp de răspuns (maxim)37.64sTimp de răspuns (total)37.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.43sTimp de răspuns (maxim)8.51sTimp de răspuns (total)12.87sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.43sTimp de răspuns (mediu)…
7,548Total tokenuri de intrare…
279Tokenuri de ieșire…
8,466Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.63sTimp de răspuns (maxim)6.63sTimp de răspuns (total)6.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)14.09sTimp de răspuns (maxim)22.00sTimp de răspuns (total)42.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
14.09sTimp de răspuns (mediu)…
633Total tokenuri de intrare…
12Tokenuri de ieșire…
24,721Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.8Scor mediu pe toate testele de benchmark.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Răspuns greșit: 1Timp de răspuns (mediu)121.79sTimp de răspuns (maxim)121.79sTimp de răspuns (total)121.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.63sTimp de răspuns (maxim)3.63sTimp de răspuns (total)3.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.63sTimp de răspuns (mediu)…
486Total tokenuri de intrare…
115Tokenuri de ieșire…
1,650Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
4.2Scor mediu pe toate testele de benchmark.…
9.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)16.25sTimp de răspuns (maxim)16.25sTimp de răspuns (total)16.25sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.35sTimp de răspuns (maxim)3.42sTimp de răspuns (total)6.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.35sTimp de răspuns (mediu)…
615Total tokenuri de intrare…
70Tokenuri de ieșire…
3,799Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)4.63sTimp de răspuns (maxim)4.63sTimp de răspuns (total)4.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.23sTimp de răspuns (maxim)3.68sTimp de răspuns (total)9.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.23sTimp de răspuns (mediu)…
558Total tokenuri de intrare…
241Tokenuri de ieșire…
4,940Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.3Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)7.40sTimp de răspuns (maxim)7.79sTimp de răspuns (total)14.81sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.96sTimp de răspuns (maxim)4.96sTimp de răspuns (total)4.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.96sTimp de răspuns (mediu)…
6,115Total tokenuri de intrare…
265Tokenuri de ieșire…
1,608Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
2.8Scor mediu pe toate testele de benchmark.…
1.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)27.71sTimp de răspuns (maxim)27.71sTimp de răspuns (total)27.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.94sTimp de răspuns (maxim)3.94sTimp de răspuns (total)3.94sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.94sTimp de răspuns (mediu)…
156Total tokenuri de intrare…
12Tokenuri de ieșire…
2,005Tokenuri de raționament…
Grok 4.1 FastModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)25.52sTimp de răspuns (maxim)25.52sTimp de răspuns (total)25.52sUn test este considerat trecut complet doar dacă toate rulările lui trec.…