Compare Charts Methodology

Language:

❤️ Made by XCS

AI BENCHY Compare

Trinity Large Preview vs OpenAI: GPT-4o-mini

Compare:

Last updated at: 2026-03-06

Metric	Trinity Large Preview none Release: 2026-01-27 Free Available	OpenAI: GPT-4o-mini none Release: 2024-07-18
Rank	#45	#47
Avg Score	4.2	4.0
Consistency	9.6	10.0
Cost per result	0.000	0.114
Total Cost	$0.000	$0.005
Tests Correct
Attempt pass rate	33.3%	25.0%
Flaky tests	1	0
Total Runs	48 (16 x 3)	48 (16 x 3)
Output Tokens	1,837	1,594
Reasoning Tokens	0	0
Response Time (avg)	3.15s	2.07s
Response Time (max)	8.91s	7.58s
Response Time (total)	50.46s	18.60s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	0.0%	0		3.59s	587	0
OpenAI: GPT-4o-mini	4.0	10.0	33.3%	0		1.83s	180	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	0.0%	0		8.91s	294	0
OpenAI: GPT-4o-mini	10.0	10.0	0.0%	0		7.58s	568	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	9.9	10.0	100.0%	0		3.26s	186	0
OpenAI: GPT-4o-mini	9.9	10.0	100.0%	0		1.27s	183	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.0	10.0	33.3%	0		877ms	25	0
OpenAI: GPT-4o-mini	10.0	10.0	0.0%	0		637ms	15	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.0	9.9	0.0%	0		2.86s	124	0
OpenAI: GPT-4o-mini	3.0	10.0	0.0%	0		909ms	66	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.5	6.7	16.7%	1		1.09s	63	0
OpenAI: GPT-4o-mini	4.5	10.0	0.0%	0		1.27s	69	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.0	10.0	33.3%	0		3.30s	291	0
OpenAI: GPT-4o-mini	2.3	10.0	0.0%	0		1.30s	308	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	267	0
OpenAI: GPT-4o-mini	10.0	10.0	100.0%	0		2.51s	205	0

Quick Compare

Switch Comparison Pair

Trinity Large PreviewnoneFree AvailablevsMiniMax M2.5medium GPT-4o-mininonevsQwen3 Coder Nextmedium MiniMax M2.5mediumvsGPT-4o-mininone Trinity Large PreviewnoneFree AvailablevsQwen3 Coder Nextmedium Trinity Large PreviewnoneFree Availablevsgpt-oss-120bmediumFree Available GPT-4o-mininonevsGLM 4.7 Flashmedium Trinity Large PreviewnoneFree AvailablevsMercury 2medium Trinity Large PreviewnoneFree AvailablevsGLM 4.7 Flashmedium Trinity Large PreviewnoneFree AvailablevsQwen3.5-35B-A3Bmedium Trinity Large PreviewnoneFree AvailablevsGPT-5 Nanomedium Mercury 2mediumvsGPT-4o-mininone GPT-4o-mininonevsQwen3.5-35B-A3Bmedium