Compare Charts Methodology

Language:

❤️ Made by XCS

AI BENCHY Compare

Trinity Large Preview vs Google: Gemini 3.1 Pro Preview

Compare:

Last updated at: 2026-03-06

Metric	Trinity Large Preview none Release: 2026-01-27 Free Available	Google: Gemini 3.1 Pro Preview medium Release: 2026-02-19
Rank	#45	#2
Avg Score	4.2	9.4
Consistency	9.6	10.0
Cost per result	0.000	3.417
Total Cost	$0.000	$0.513
Tests Correct
Attempt pass rate	33.3%	93.8%
Flaky tests	1	0
Total Runs	48 (16 x 3)	48 (16 x 3)
Output Tokens	1,837	1,521
Reasoning Tokens	0	35,656
Response Time (avg)	3.15s	16.60s
Response Time (max)	8.91s	40.61s
Response Time (total)	50.46s	149.36s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	0.0%	0		3.59s	587	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.52s	106	2,533

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	0.0%	0		8.91s	294	0
Google: Gemini 3.1 Pro Preview	9.0	10.0	100.0%	0		40.61s	432	9,281

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	9.9	10.0	100.0%	0		3.26s	186	0
Google: Gemini 3.1 Pro Preview	9.9	10.0	100.0%	0		7.72s	279	3,904

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.0	10.0	33.3%	0		877ms	25	0
Google: Gemini 3.1 Pro Preview	7.0	10.0	66.7%	0		32.73s	18	12,424

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.0	9.9	0.0%	0		2.86s	124	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		11.77s	108	1,179

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.5	6.7	16.7%	1		1.09s	63	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.56s	72	2,236

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.0	10.0	33.3%	0		3.30s	291	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.15s	232	3,117

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	267	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		23.15s	274	982

Quick Compare

Switch Comparison Pair

Trinity Large PreviewnoneFree AvailablevsMiniMax M2.5medium Trinity Large PreviewnoneFree AvailablevsQwen3 Coder Nextmedium Trinity Large PreviewnoneFree Availablevsgpt-oss-120bmediumFree Available Trinity Large PreviewnoneFree AvailablevsMercury 2medium Trinity Large PreviewnoneFree AvailablevsGLM 4.7 Flashmedium Trinity Large PreviewnoneFree AvailablevsQwen3.5-35B-A3Bmedium Trinity Large PreviewnoneFree AvailablevsGPT-5 Nanomedium Trinity Large PreviewnoneFree AvailablevsGPT-5 Minimedium Gemini 3.1 Pro PreviewmediumvsGPT-5.2 Chatnone Trinity Large PreviewnoneFree AvailablevsGrok 4.1 Fastmedium Gemini 3.1 Pro PreviewmediumvsGPT-5.3 Chatnone Trinity Large PreviewnoneFree AvailablevsKimi K2.5medium