AI BENCHY Compare

OpenAI: GPT-5.4 vs Elephant Alpha

Last updated at: 2026-05-29

Metric	GPT-5.4 GPT-5.4 none Release: 2026-03-05	Elephant Alpha Elephant Alpha medium Release: 2026-04-14

Metric	GPT-5.4 GPT-5.4 none Release: 2026-03-05	Elephant Alpha Elephant Alpha medium Release: 2026-04-14
Score	5.6	5.4
Rank	#120	#127
Reliability	10.0	N/A
Consistency	9.1	9.6
Tests Correct
Attempt pass rate	38.3%	33.3%
Flaky tests	2	1
Total Runs	60	60
Cost per result	1.644	0.000
Total Cost	$0.116	$0.000
Input Price	$2.500 / 1M	$0.000 / 1M
Output Price	$15.000 / 1M	$0.000 / 1M
Output Tokens	2,402	2,596
Reasoning Tokens	0	0
Response Time (avg)	1.45s	1.27s
Response Time (max)	2.95s	3.70s
Response Time (total)	29.00s	22.82s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	3.2	8.0	8.3%	1		1.21s	406	0
Elephant Alpha	6.6	10.0	50.0%	0		1.19s	815	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	6.8	10.0	50.0%	0		1.99s	501	0
Elephant Alpha	4.0	6.7	16.7%	1		1.30s	365	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	3.0	10.0	0.0%	0		2.89s	291	0
Elephant Alpha	3.0	10.0	0.0%	0		3.70s	562	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	10.0	10.0	100.0%	0		1.04s	222	0
Elephant Alpha	6.5	10.0	50.0%	0		979ms	246	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	5.3	7.2	44.4%	1		1.07s	50	0
Elephant Alpha	3.0	10.0	0.0%	0		925ms	24	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	4.4	9.9	0.0%	0		1.78s	184	0
Elephant Alpha	4.3	10.0	0.0%	0		920ms	105	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	6.5	10.0	50.0%	0		1.07s	81	0
Elephant Alpha	9.8	10.0	100.0%	0		987ms	82	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	5.6	9.8	33.3%	0		1.44s	381	0
Elephant Alpha	5.3	10.0	33.3%	0		868ms	166	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0
Elephant Alpha	3.0	10.0	0.0%	0		2.83s	231	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.4	3.0	10.0	0.0%	0		990ms	40	0
Elephant Alpha	0.0	0.0	0.0%	0		0ms	0	0

Quick Compare

Switch Comparison Pair

Elephant AlphamediumvsQwen3.5-122B-A10Bnone Elephant AlphamediumvsGrok 4.20none gpt-oss-120bnoneFree AvailablevsElephant Alphamedium Elephant AlphamediumvsGLM 5 Turbonone Kimi K2.5nonevsElephant Alphamedium Ling-2.6-flashnonevsElephant Alphamedium MiniMax M2.5mediumFree AvailablevsGPT-5.4none Elephant AlphamediumvsQwen3.6 Flashnone CobuddymediumvsGPT-5.4none Mistral Small 4mediumvsGPT-5.4none Elephant AlphamediumvsMiMo-V2.5-Pronone MiniMax M2.7mediumvsGPT-5.4none