Compare Charts

Language:

❤️ Made by XCS

AI BENCHY Compare

Arcee AI: Trinity Large Preview (free) vs OpenAI: GPT-5.4

Compare:

Last updated at: 2026-03-05

Metric	Arcee AI: Trinity Large Preview (free) none Release: 2026-01-27 Free Available	OpenAI: GPT-5.4 none Release: 2026-03-05
Rank	#45	#44
Avg Score	4.3	4.6
Tests Correct
Consistency	9.6	8.9
Cost per result	0.000	1.496
Total Cost	$0.000	$0.090
Attempt pass rate	35.6%	44.4%
Flaky tests	1	2
common.totalAttempts	45 (15 x 3)	45 (15 x 3)
Output Tokens	1,713	1,635
Reasoning Tokens	0	0
Response Time (avg)	3.17s	1.46s
Response Time (max)	8.91s	2.89s
Response Time (total)	47.61s	21.86s

Top Models by Score

Response Time (avg)

Score vs Total Cost

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Arcee AI: Trinity Large Preview (free)	10.0	10.0	0.0%	0		3.59s	587	0
OpenAI: GPT-5.4	10.0	7.3	11.1%	1		1.41s	388	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Arcee AI: Trinity Large Preview (free)	10.0	10.0	0.0%	0		8.91s	294	0
OpenAI: GPT-5.4	10.0	10.0	0.0%	0		2.89s	291	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Arcee AI: Trinity Large Preview (free)	9.9	10.0	100.0%	0		3.26s	186	0
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		1.04s	222	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Arcee AI: Trinity Large Preview (free)	4.0	10.0	33.3%	0		877ms	25	0
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		1.07s	50	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Arcee AI: Trinity Large Preview (free)	3.5	6.7	16.7%	1		1.09s	63	0
OpenAI: GPT-5.4	5.5	10.0	50.0%	0		1.07s	81	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Arcee AI: Trinity Large Preview (free)	4.0	10.0	33.3%	0		3.30s	291	0
OpenAI: GPT-5.4	4.0	9.8	33.3%	0		1.52s	357	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Arcee AI: Trinity Large Preview (free)	10.0	10.0	100.0%	0		6.67s	267	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0

Quick Compare

Switch Comparison Pair

MiniMax M2.5mediumvsGPT-5.4none Trinity Large Preview (free)noneFree AvailablevsMiniMax M2.5medium Mercury 2mediumvsGPT-5.4none Trinity Large Preview (free)noneFree Availablevsgpt-oss-120bmediumFree Available Trinity Large Preview (free)noneFree AvailablevsQwen3 Coder Nextmedium Trinity Large Preview (free)noneFree AvailablevsGLM 4.7 Flashmedium Trinity Large Preview (free)noneFree AvailablevsMercury 2medium GPT-5.4nonevsQwen3.5-35B-A3Bmedium GPT-5.4nonevsQwen3 Coder Nextmedium GPT-5.4nonevsGLM 4.7 Flashmedium Trinity Large Preview (free)noneFree AvailablevsGPT-5 Nanomedium Trinity Large Preview (free)noneFree AvailablevsQwen3.5-35B-A3Bmedium