AI BENCHY Compare

OpenAI: GPT-4o-mini vs Elephant

Last updated at: 2026-04-14

Metric	GPT-4o-mini GPT-4o-mini none Release: 2024-07-18	Elephant Elephant medium Release: 2026-04-14

Metric	GPT-4o-mini GPT-4o-mini none Release: 2024-07-18	Elephant Elephant medium Release: 2026-04-14
Score	4.9	5.2
Rank	#85	#77
Consistency	9.9	9.6
Tests Correct
Attempt pass rate	22.2%	29.6%
Flaky tests	0	1
Total Runs	54	54
Cost per result	0.122	0.000
Total Cost	$0.005	$0.000
Input Price	$0.150 / 1M	$0.000 / 1M
Output Price	$0.600 / 1M	$0.000 / 1M
Output Tokens	1,947	2,596
Reasoning Tokens	0	0
Response Time (avg)	2.00s	1.27s
Response Time (max)	7.58s	3.70s
Response Time (total)	21.99s	22.82s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	4.8	10.0	25.0%	0		1.34s	186	0
Elephant	6.6	10.0	50.0%	0		1.19s	815	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	3.0	8.7	0.0%	0		2.55s	347	0
Elephant	5.1	3.3	33.3%	1		1.30s	365	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	3.0	10.0	0.0%	0		7.58s	568	0
Elephant	3.0	10.0	0.0%	0		3.70s	562	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	10.0	10.0	100.0%	0		1.27s	183	0
Elephant	6.5	10.0	50.0%	0		979ms	246	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	3.0	10.0	0.0%	0		637ms	15	0
Elephant	3.0	10.0	0.0%	0		925ms	24	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	4.0	10.0	0.0%	0		909ms	66	0
Elephant	4.3	10.0	0.0%	0		920ms	105	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	4.8	10.0	0.0%	0		1.27s	69	0
Elephant	9.8	10.0	100.0%	0		987ms	82	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	3.7	10.0	0.0%	0		1.30s	308	0
Elephant	3.7	10.0	0.0%	0		867ms	166	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	10.0	10.0	100.0%	0		2.51s	205	0
Elephant	3.0	10.0	0.0%	0		2.83s	231	0

Quick Compare

Switch Comparison Pair

ElephantmediumvsGrok 4.20none Mistral Small 4nonevsElephantmedium gpt-oss-120bnoneFree AvailablevsElephantmedium Trinity Large PreviewnoneFree AvailablevsElephantmedium GPT-5.4 MininonevsElephantmedium ElephantmediumvsQwen3 Coder Nextnone GPT-4o-mininonevsQwen3 Coder Nextmedium Nemotron 3 SupernoneFree AvailablevsElephantmedium GPT-4o-mininonevsGLM 4.7 Flashmedium ElephantmediumvsGLM 5 Turbonone Kimi K2.5nonevsElephantmedium ElephantmediumvsGLM 5.1none