Compare Charts Methodology

Language:

❤️ Made by XCS

AI BENCHY Compare

Trinity Large Preview vs Qwen: Qwen3.5-35B-A3B

Compare:

Last updated at: 2026-03-06

Metric	Trinity Large Preview none Release: 2026-01-27 Free Available	Qwen: Qwen3.5-35B-A3B none Release: 2026-02-24
Rank	#45	#42
Avg Score	4.2	4.7
Consistency	9.6	8.6
Cost per result	0.000	0.237
Total Cost	$0.000	$0.015
Tests Correct
Attempt pass rate	33.3%	50.0%
Flaky tests	1	3
Total Runs	48 (16 x 3)	48 (16 x 3)
Output Tokens	1,837	3,756
Reasoning Tokens	0	0
Response Time (avg)	3.15s	4.10s
Response Time (max)	8.91s	47.43s
Response Time (total)	50.46s	65.62s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	0.0%	0		3.59s	587	0
Qwen: Qwen3.5-35B-A3B	10.0	7.2	22.2%	1		1.76s	569	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	0.0%	0		8.91s	294	0
Qwen: Qwen3.5-35B-A3B	10.0	10.0	0.0%	0		47.43s	1,833	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	9.9	10.0	100.0%	0		3.26s	186	0
Qwen: Qwen3.5-35B-A3B	9.9	10.0	100.0%	0		1.16s	243	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.0	10.0	33.3%	0		877ms	25	0
Qwen: Qwen3.5-35B-A3B	7.0	10.0	66.7%	0		485ms	15	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.0	9.9	0.0%	0		2.86s	124	0
Qwen: Qwen3.5-35B-A3B	6.0	3.4	66.7%	1		1.19s	114	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	3.5	6.7	16.7%	1		1.09s	63	0
Qwen: Qwen3.5-35B-A3B	5.0	10.0	50.0%	0		809ms	63	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	4.0	10.0	33.3%	0		3.30s	291	0
Qwen: Qwen3.5-35B-A3B	1.7	7.4	22.2%	1		1.34s	655	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	267	0
Qwen: Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		2.30s	264	0

Quick Compare

Switch Comparison Pair

MiniMax M2.5mediumvsQwen3.5-35B-A3Bnone gpt-oss-120bmediumFree AvailablevsQwen3.5-35B-A3Bnone Trinity Large PreviewnoneFree AvailablevsMiniMax M2.5medium Mercury 2mediumvsQwen3.5-35B-A3Bnone Trinity Large PreviewnoneFree AvailablevsQwen3 Coder Nextmedium GPT-5 NanomediumvsQwen3.5-35B-A3Bnone Trinity Large PreviewnoneFree Availablevsgpt-oss-120bmediumFree Available Trinity Large PreviewnoneFree AvailablevsMercury 2medium Trinity Large PreviewnoneFree AvailablevsGLM 4.7 Flashmedium GPT-5 MinimediumvsQwen3.5-35B-A3Bnone Trinity Large PreviewnoneFree AvailablevsQwen3.5-35B-A3Bmedium Trinity Large PreviewnoneFree AvailablevsGPT-5 Nanomedium