AI BENCHY Compare

Google: Gemini 3.1 Pro Preview vs OpenAI: GPT-5.4 Nano

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-01

Metrică	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lansare: 2026-02-19	GPT-5.4 Nano GPT-5.4 Nano medium Lansare: 2026-03-17

Metrică	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lansare: 2026-02-19	GPT-5.4 Nano GPT-5.4 Nano medium Lansare: 2026-03-17
Scor	9.6	7.6
Rang	#2	#51
Fiabilitate	N/D	N/D
Consistență	10.0	9.0
Teste corecte
Rată de trecere pe încercare	94.4%	68.5%
Teste instabile	0	2
Rulări totale	54	54
Cost per rezultat	3.400	0.747
Cost total	$0.578	$0.083
Preț de intrare	$2.000 / 1M	$0.200 / 1M
Preț de ieșire	$12.000 / 1M	$1.250 / 1M
Tokenuri de ieșire	1,932	2,946
Tokenuri de raționament	40,542	58,132
Timp de răspuns (mediu)	15.96s	11.21s
Timp de răspuns (maxim)	40.61s	94.06s
Timp de răspuns (total)	175.52s	201.80s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.90s	112	3,218
GPT-5.4 Nano	8.3	10.0	75.0%	0		4.52s	683	2,254

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		19.88s	405	4,201
GPT-5.4 Nano	10.0	10.0	100.0%	0		13.41s	472	3,616

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	9.5	10.0	100.0%	0		40.61s	432	9,281
GPT-5.4 Nano	9.8	10.0	100.0%	0		24.13s	349	5,719

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.72s	279	3,904
GPT-5.4 Nano	10.0	10.0	100.0%	0		2.54s	234	516

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	7.7	10.0	66.7%	0		32.73s	18	12,424
GPT-5.4 Nano	5.9	7.2	55.6%	1		38.18s	60	43,325

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		11.77s	108	1,179
GPT-5.4 Nano	4.5	10.0	0.0%	0		4.15s	179	443

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.56s	72	2,236
GPT-5.4 Nano	9.8	10.0	100.0%	0		1.88s	95	521

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.15s	232	3,117
GPT-5.4 Nano	4.0	7.1	22.2%	1		3.65s	640	1,356

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		23.15s	274	982
GPT-5.4 Nano	10.0	10.0	100.0%	0		7.71s	234	382

Comparație rapidă

Schimbă perechea de comparație

GPT-5.4 NanomediumvsQwen3.6 Max Previewnone Claude Sonnet 4.6nonevsGPT-5.4 Nanomedium DeepSeek V4 FlashhighvsGPT-5.4 Nanomedium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.4 Nanomedium Claude Opus 4.7nonevsGemini 3.1 Pro Previewmedium Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4 Nanomedium Gemini 3 Flash PreviewnonevsGPT-5.4 Nanomedium GPT-5.4 NanomediumvsHY3 PreviewlowDisponibil gratuit DeepSeek V4 ProhighvsGPT-5.4 Nanomedium Gemma 4 31BnoneDisponibil gratuitvsGPT-5.4 Nanomedium GPT-5.4 NanomediumvsQwen3.5 Plus 2026-02-15none