Compare Charts Methodology

Language:

❤️ Made by XCS

AI BENCHY Compare

Google: Gemini 3 Pro Preview vs OpenAI: GPT-5.3 Chat

Compare:

Last updated at: 2026-03-06

Metric	Google: Gemini 3 Pro Preview medium Release: 2025-11-18	OpenAI: GPT-5.3 Chat none Release: 2026-03-03
Avg Score	8.1	7.5
Rank	#9	#19
Tests Correct
Consistency	10.0	8.4
Cost per result	1.547	3.110
Total Cost	$0.186	$0.311
Attempt pass rate	80.0%	75.6%
Flaky tests	0	3
common.totalRuns	45 (15 x 3)	45 (15 x 3)
Output Tokens	1,424	18,953
Reasoning Tokens	9,332	0
Response Time (avg)	6.87s	6.22s
Response Time (max)	11.96s	18.33s
Response Time (total)	55.00s	93.31s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Google: Gemini 3 Pro Preview	10.0	10.0	100.0%	0		3.75s	143	1,107
OpenAI: GPT-5.3 Chat	7.3	7.5	77.8%	1		4.72s	3,091	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Google: Gemini 3 Pro Preview	10.0	10.0	0.0%	0		10.37s	351	952
OpenAI: GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	2,614	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Google: Gemini 3 Pro Preview	9.9	10.0	100.0%	0		10.84s	279	3,156
OpenAI: GPT-5.3 Chat	9.9	10.0	100.0%	0		2.21s	942	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Google: Gemini 3 Pro Preview	4.0	10.0	33.3%	0		7.01s	15	1,195
OpenAI: GPT-5.3 Chat	10.0	4.4	33.3%	2		13.01s	8,264	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Google: Gemini 3 Pro Preview	9.5	10.0	100.0%	0		3.26s	69	754
OpenAI: GPT-5.3 Chat	9.0	10.0	50.0%	0		3.29s	1,455	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Google: Gemini 3 Pro Preview	10.0	10.0	100.0%	0		3.91s	243	1,197
OpenAI: GPT-5.3 Chat	10.0	10.0	100.0%	0		2.93s	1,726	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Google: Gemini 3 Pro Preview	10.0	10.0	100.0%	0		11.96s	324	971
OpenAI: GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	861	0

Quick Compare

Switch Comparison Pair

GPT-5.3 ChatnonevsGLM 5medium GPT-5.3 ChatnonevsMiMo-V2-Flashmedium GPT-5.3 ChatnonevsStep 3.5 FlashmediumFree Available Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.3 Chatnone Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone Gemini 2.5 FlashmediumvsGPT-5.3 Chatnone DeepSeek V3.2mediumvsGPT-5.3 Chatnone Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3 Chatnone Gemini 3 Pro PreviewmediumvsGPT-5.2 Chatnone Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.5-Flashmedium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.3 Chatnone