AI BENCHY Compare

Google: Gemma 4 31B vs OpenAI: GPT-5.3-Codex

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-10

Metrică	Gemma 4 31B Gemma 4 31B medium Lansare: 2026-04-02 Disponibil gratuit	GPT-5.3-Codex GPT-5.3-Codex medium Lansare: 2026-02-05

Metrică	Gemma 4 31B Gemma 4 31B medium Lansare: 2026-04-02 Disponibil gratuit	GPT-5.3-Codex GPT-5.3-Codex medium Lansare: 2026-02-05
Scor	8.2	8.2
Rang	#14	#13
Fiabilitate	6.7	10.0
Consistență	9.6	8.3
Teste corecte
Rată de trecere pe încercare	77.2%	80.7%
Teste instabile	1	4
Rulări totale	57	57
Cost per rezultat	0.158	4.594
Cost total	$0.023	$0.598
Preț de intrare	$0.130 / 1M	$1.750 / 1M
Preț de ieșire	$0.380 / 1M	$14.000 / 1M
Tokenuri de ieșire	14,426	2,309
Tokenuri de raționament	37,964	36,880
Timp de răspuns (mediu)	28.72s	15.33s
Timp de răspuns (maxim)	90.14s	100.93s
Timp de răspuns (total)	488.27s	291.34s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	10.0	10.0	100.0%	0		12.89s	962	2,046
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	240	1,722

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	4.7	1.6	66.7%	1		70.97s	3,166	5,449
GPT-5.3-Codex	10.0	10.0	100.0%	0		8.95s	491	1,530

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	364	2,731

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	10.0	10.0	100.0%	0		21.11s	1,822	2,951
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	234	728

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	7.7	10.0	66.7%	0		38.48s	4,349	8,985
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	64	25,308

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	10.0	10.0	100.0%	0		9.57s	105	888
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	187	331

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	10.0	10.0	100.0%	0		12.76s	533	2,035
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	93	693

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	9.9	10.0	100.0%	0		27.63s	1,797	5,596
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.12s	352	1,644

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	254	492

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemma 4 31B	3.0	10.0	0.0%	0		90.14s	1,692	10,014
GPT-5.3-Codex	2.8	1.6	33.3%	1		14.43s	30	1,701

Comparație rapidă

Schimbă perechea de comparație

Gemini 3 Flash PreviewnonevsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.3-Codexmedium Gemma 4 31BmediumDisponibil gratuitvsGPT-5.2 Chatnone Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium Gemma 4 31BmediumDisponibil gratuitvsGPT-5.5low Gemini 3.1 Flash LitelowvsGPT-5.3-Codexmedium Gemma 4 31BmediumDisponibil gratuitvsGPT-5.3 Chatnone DeepSeek V4 FlashhighvsGemma 4 31BmediumDisponibil gratuit DeepSeek V4 FlashhighvsGPT-5.3-Codexmedium Gemma 4 31BmediumDisponibil gratuitvsQwen3.6 Max Previewnone Gemma 4 31BmediumDisponibil gratuitvsRing 2.6 1tnoneDisponibil gratuit