AI BENCHY Compare

Arcee AI: Trinity Large Preview vs OpenAI: GPT-5.4 Mini

Last updated at: 2026-04-29

Metric	Trinity Large Preview Trinity Large Preview none Release: 2026-01-27	GPT-5.4 Mini GPT-5.4 Mini none Release: 2026-03-17

Metric	Trinity Large Preview Trinity Large Preview none Release: 2026-01-27	GPT-5.4 Mini GPT-5.4 Mini none Release: 2026-03-17
Score	5.3	5.1
Rank	#102	#112
Reliability	N/A	N/A
Consistency	9.6	8.6
Tests Correct
Attempt pass rate	29.6%	35.2%
Flaky tests	1	3
Total Runs	52	54
Cost per result	0.000	0.630
Total Cost	$0.000	$0.032
Input Price	$0.150 / 1M	$0.750 / 1M
Output Price	$0.450 / 1M	$4.500 / 1M
Output Tokens	1,985	2,418
Reasoning Tokens	0	0
Response Time (avg)	5.07s	1.17s
Response Time (max)	39.47s	2.52s
Response Time (total)	91.23s	21.01s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.0	10.0	0.0%	0		3.02s	593	0
GPT-5.4 Mini	3.1	8.1	8.3%	1		929ms	654	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	6.3	10.0	0.0%	0		39.47s	142	0
GPT-5.4 Mini	10.0	10.0	100.0%	0		1.19s	333	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.0	10.0	0.0%	0		8.91s	294	0
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.52s	298	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	100.0%	0		3.26s	186	0
GPT-5.4 Mini	10.0	10.0	100.0%	0		1.30s	222	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	5.3	10.0	33.3%	0		877ms	25	0
GPT-5.4 Mini	3.5	4.4	33.3%	2		937ms	88	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.4	9.9	0.0%	0		2.86s	124	0
GPT-5.4 Mini	4.8	10.0	0.0%	0		1.82s	174	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.1	6.7	16.7%	1		1.09s	63	0
GPT-5.4 Mini	6.3	10.0	50.0%	0		728ms	101	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	5.4	10.0	33.3%	0		3.30s	291	0
GPT-5.4 Mini	5.4	10.0	33.3%	0		860ms	293	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	267	0
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.32s	255	0

Quick Compare

Switch Comparison Pair

Trinity Large PreviewnonevsMiniMax M2.7medium Nemotron 3 Nano Omni 30b A3b ReasoningmediumFree AvailablevsGPT-5.4 Mininone Trinity Large PreviewnonevsElephant Alphamedium GPT-5.4 MininonevsElephant Alphamedium Trinity Large PreviewnonevsNemotron 3 Nano Omni 30b A3b ReasoningmediumFree Available MiniMax M2.7mediumvsGPT-5.4 Mininone Trinity Large PreviewnonevsMistral Small 4medium Trinity Large PreviewnonevsMiniMax M2.5mediumFree Available GPT-5.4 MininonevsQwen3 Coder Nextmedium Trinity Large Previewnonevsgpt-oss-120bmediumFree Available Mistral Small 4mediumvsGPT-5.4 Mininone GPT-5.4 MininonevsGLM 4.7 Flashmedium