AI BENCHY Compare

Google: Gemini 3.1 Pro Preview vs xAI: Grok 4.20 Beta

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-12

Metrică	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lansare: 2026-02-19	Grok 4.20 Beta Grok 4.20 Beta none Lansare: 2026-03-12

Metrică	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lansare: 2026-02-19	Grok 4.20 Beta Grok 4.20 Beta none Lansare: 2026-03-12
Rang	#2	#52
Scor mediu	9.4	4.4
Consistență	10.0	9.1
Cost per rezultat	3.417	2.214
Cost total	$0.513	$0.089
Teste corecte
Rată de trecere pe încercare	93.8%	33.3%
Teste instabile	0	2
Rulări totale	48	48
Tokenuri de ieșire	1,521	1,511
Tokenuri de raționament	35,656	0
Timp de răspuns (mediu)	16.60s	1.22s
Timp de răspuns (maxim)	40.61s	6.48s
Timp de răspuns (total)	149.36s	19.53s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor mediu vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor mediu vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.52s	106	2,533
Grok 4.20 Beta	3.3	7.9	22.2%	1		562ms	245	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	9.0	10.0	100.0%	0		40.61s	432	9,281
Grok 4.20 Beta	10.0	10.0	0.0%	0		6.48s	282	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	9.9	10.0	100.0%	0		7.72s	279	3,904
Grok 4.20 Beta	9.9	10.0	100.0%	0		601ms	197	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	7.0	10.0	66.7%	0		32.73s	18	12,424
Grok 4.20 Beta	10.0	10.0	0.0%	0		611ms	160	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		11.77s	108	1,179
Grok 4.20 Beta	5.0	10.0	0.0%	0		541ms	87	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.56s	72	2,236
Grok 4.20 Beta	4.5	10.0	0.0%	0		687ms	60	0

Puzzle Solving	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.15s	232	3,117
Grok 4.20 Beta	4.0	7.2	55.6%	1		541ms	291	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		23.15s	274	982
Grok 4.20 Beta	10.0	10.0	100.0%	0		4.79s	189	0

Comparație rapidă

Schimbă perechea de comparație

MiniMax M2.5mediumvsGrok 4.20 Betanone gpt-oss-120bmediumDisponibil gratuitvsGrok 4.20 Betanone Mercury 2mediumvsGrok 4.20 Betanone Qwen3 Coder NextmediumvsGrok 4.20 Betanone Qwen3.5-35B-A3BmediumvsGrok 4.20 Betanone GPT-5 NanomediumvsGrok 4.20 Betanone Grok 4.20 BetanonevsGLM 4.7 Flashmedium Nemotron 3 Super 120b A12bmediumDisponibil gratuitvsGrok 4.20 Betanone Hunter AlphamediumvsGrok 4.20 Betanone GPT-5 MinimediumvsGrok 4.20 Betanone Qwen3.5-9BmediumvsGrok 4.20 Betanone Gemini 3.1 Pro PreviewmediumvsGPT-5.2 Chatnone