Compare Charts Methodology

Language:

❤️ Made by XCS

AI BENCHY Compare

Trinity Large Preview vs MoonshotAI: Kimi K2.5

Compare:

Last updated at: 2026-03-06

Metric	Trinity Large Preview none Release: 2026-01-27 Free Available	MoonshotAI: Kimi K2.5 none Release: 2026-01-27
Rank	#45	#46
Avg Score	4.2	4.1
Consistency	9.6	8.6
Cost per result	0.000	0.295
Total Cost	$0.000	$0.015
Tests Correct
Attempt pass rate	33.3%	39.6%
Flaky tests	1	3
Total Runs	48 (16 x 3)	48 (16 x 3)
Output Tokens	1,837	2,000
Reasoning Tokens	0	0
Response Time (avg)	3.15s	11.91s
Response Time (max)	8.91s	42.13s
Response Time (total)	50.46s	107.16s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	0.0%	0		3.59s	587	0
MoonshotAI: Kimi K2.5	2.7	7.9	11.1%	1		11.38s	363	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	0.0%	0		8.91s	294	0
MoonshotAI: Kimi K2.5	10.0	2.1	33.3%	1		19.16s	748	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	9.9	10.0	100.0%	0		3.26s	186	0
MoonshotAI: Kimi K2.5	5.4	5.8	83.3%	1		42.13s	187	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.0	10.0	33.3%	0		877ms	25	0
MoonshotAI: Kimi K2.5	4.0	10.0	33.3%	0		4.38s	29	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.0	9.9	0.0%	0		2.86s	124	0
MoonshotAI: Kimi K2.5	10.0	10.0	100.0%	0		4.00s	76	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.5	6.7	16.7%	1		1.09s	63	0
MoonshotAI: Kimi K2.5	5.5	10.0	50.0%	0		2.67s	60	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.0	10.0	33.3%	0		3.30s	291	0
MoonshotAI: Kimi K2.5	10.0	10.0	0.0%	0		4.73s	317	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	267	0
MoonshotAI: Kimi K2.5	10.0	10.0	100.0%	0		13.99s	220	0

Quick Compare

Switch Comparison Pair

Trinity Large PreviewnoneFree AvailablevsMiniMax M2.5medium Kimi K2.5nonevsQwen3 Coder Nextmedium MiniMax M2.5mediumvsKimi K2.5none Trinity Large PreviewnoneFree AvailablevsQwen3 Coder Nextmedium Trinity Large PreviewnoneFree Availablevsgpt-oss-120bmediumFree Available Kimi K2.5nonevsGLM 4.7 Flashmedium Kimi K2.5nonevsgpt-oss-120bmediumFree Available Trinity Large PreviewnoneFree AvailablevsMercury 2medium Trinity Large PreviewnoneFree AvailablevsGLM 4.7 Flashmedium Mercury 2mediumvsKimi K2.5none Trinity Large PreviewnoneFree AvailablevsQwen3.5-35B-A3Bmedium Trinity Large PreviewnoneFree AvailablevsGPT-5 Nanomedium