AI BENCHY Compare

OpenAI: GPT-4o-mini vs Laguna Xs.2

Last updated at: 2026-04-29

Metric	GPT-4o-mini GPT-4o-mini none Release: 2024-07-18	Laguna Xs.2 Laguna Xs.2 medium Release: 2026-04-28 Free Available

Metric	GPT-4o-mini GPT-4o-mini none Release: 2024-07-18	Laguna Xs.2 Laguna Xs.2 medium Release: 2026-04-28 Free Available
Score	4.9	6.2
Rank	#119	#81
Reliability	N/A	10.0
Consistency	9.9	6.9
Tests Correct
Attempt pass rate	22.2%	57.4%
Flaky tests	0	7
Total Runs	54	54
Cost per result	0.122	0.000
Total Cost	$0.005	$0.000
Input Price	$0.150 / 1M	$0.000 / 1M
Output Price	$0.600 / 1M	$0.000 / 1M
Output Tokens	1,947	58,141
Reasoning Tokens	0	0
Response Time (avg)	2.00s	6.03s
Response Time (max)	7.58s	29.11s
Response Time (total)	21.99s	108.59s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	4.8	10.0	25.0%	0		1.34s	186	0
Laguna Xs.2	7.4	5.9	83.3%	2		2.60s	5,283	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	3.0	8.7	0.0%	0		2.55s	347	0
Laguna Xs.2	6.3	3.7	33.3%	1		14.36s	7,896	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	3.0	10.0	0.0%	0		7.58s	568	0
Laguna Xs.2	3.0	10.0	0.0%	0		15.92s	8,501	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	10.0	10.0	100.0%	0		1.27s	183	0
Laguna Xs.2	7.1	5.6	83.3%	1		9.34s	10,472	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	3.0	10.0	0.0%	0		637ms	15	0
Laguna Xs.2	4.1	4.4	44.5%	2		11.12s	18,712	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	4.0	10.0	0.0%	0		909ms	66	0
Laguna Xs.2	4.1	10.0	0.0%	0		2.76s	1,421	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	4.8	10.0	0.0%	0		1.27s	69	0
Laguna Xs.2	10.0	10.0	100.0%	0		1.68s	1,517	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	3.7	10.0	0.0%	0		1.30s	308	0
Laguna Xs.2	5.3	10.0	33.3%	0		2.12s	3,168	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-4o-mini	10.0	10.0	100.0%	0		2.51s	205	0
Laguna Xs.2	4.7	1.6	66.7%	1		3.39s	1,171	0

Quick Compare

Switch Comparison Pair

Gemini 2.5 FlashnonevsLaguna Xs.2mediumFree Available Seed-2.0-LitenonevsLaguna Xs.2mediumFree Available Gemma 4 26B A4BnoneFree AvailablevsLaguna Xs.2mediumFree Available Laguna Xs.2mediumFree AvailablevsQwen3.5-35B-A3Bnone Laguna Xs.2mediumFree AvailablevsQwen3.5-Flashnone Laguna Xs.2mediumFree AvailablevsGLM 5V Turbonone Laguna Xs.2mediumFree AvailablevsQwen3.6 27Bnone DeepSeek V3.2nonevsLaguna Xs.2mediumFree Available Laguna Xs.2mediumFree AvailablevsMiMo-V2-Pronone GPT-4o-mininonevsQwen3 Coder Nextmedium GPT-5.4nonevsLaguna Xs.2mediumFree Available GPT-4o-mininonevsGLM 4.7 Flashmedium