Compară Grafice

Limbă:

❤️ Made by XCS

AI BENCHY Compare

Google: Gemini 3 Flash Preview vs OpenAI: GPT-5.4

Compară:

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-05

Metrică	Google: Gemini 3 Flash Preview medium Lansare: 2025-12-17	OpenAI: GPT-5.4 none Lansare: 2026-03-05
Rang	#1	#44
Scor mediu	10.0	4.6
Teste corecte
Consistență	10.0	8.9
Cost per rezultat	1.064	1.496
Cost total	$0.160	$0.090
Rată de trecere pe încercare	100.0%	44.4%
Teste instabile	0	2
common.totalAttempts	45 (15 x 3)	45 (15 x 3)
Tokenuri de ieșire	1,523	1,635
Tokenuri de raționament	46,622	0
Timp de răspuns (medie)	13.39s	1.46s
Timp de răspuns (maxim)	50.16s	2.89s
Timp de răspuns (total)	107.12s	21.86s

Top modele după scor

Timp de răspuns (medie)

Scor vs cost total

Scor mediu vs Timp de răspuns (medie)

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (medie)	Tokenuri de ieșire	Tokenuri de raționament
Google: Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.61s	299	3,127
OpenAI: GPT-5.4	10.0	7.3	11.1%	1		1.41s	388	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (medie)	Tokenuri de ieșire	Tokenuri de raționament
Google: Gemini 3 Flash Preview	10.0	10.0	100.0%	0		50.16s	351	12,645
OpenAI: GPT-5.4	10.0	10.0	0.0%	0		2.89s	291	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (medie)	Tokenuri de ieșire	Tokenuri de raționament
Google: Gemini 3 Flash Preview	9.9	10.0	100.0%	0		4.72s	279	5,333
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		1.04s	222	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (medie)	Tokenuri de ieșire	Tokenuri de raționament
Google: Gemini 3 Flash Preview	10.0	10.0	100.0%	0		21.12s	12	14,908
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		1.07s	50	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (medie)	Tokenuri de ieșire	Tokenuri de raționament
Google: Gemini 3 Flash Preview	10.0	10.0	100.0%	0		6.10s	72	4,558
OpenAI: GPT-5.4	5.5	10.0	50.0%	0		1.07s	81	0

Puzzle Solving	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (medie)	Tokenuri de ieșire	Tokenuri de raționament
Google: Gemini 3 Flash Preview	10.0	10.0	100.0%	0		4.43s	276	4,921
OpenAI: GPT-5.4	4.0	9.8	33.3%	0		1.52s	357	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (medie)	Tokenuri de ieșire	Tokenuri de raționament
Google: Gemini 3 Flash Preview	10.0	10.0	100.0%	0		10.55s	234	1,130
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0

Comparație rapidă

Schimbă perechea de comparație

MiniMax M2.5mediumvsGPT-5.4none Mercury 2mediumvsGPT-5.4none GPT-5.4nonevsQwen3.5-35B-A3Bmedium GPT-5.4nonevsQwen3 Coder Nextmedium GPT-5.4nonevsGLM 4.7 Flashmedium Claude Opus 4.6mediumvsGPT-5.4none Kimi K2.5mediumvsGPT-5.4none GPT-5.4nonevsGrok 4.1 Fastmedium Gemini 3 Flash PreviewmediumvsGPT-5.2 Chatnone GPT-5.4nonevsQwen3.5-Flashmedium Seed-2.0-MinimediumvsGPT-5.4none Gemini 3 Flash PreviewmediumvsGPT-5.3 Chatnone