AI BENCHY Compare

Mistral: Mistral Small 4 vs OpenAI: GPT-5 Mini

Last updated at: 2026-03-17

Metric	Mistral Small 4 Mistral Small 4 none Release: 2026-03-16	GPT-5 Mini GPT-5 Mini medium Release: 2025-08-07

Metric	Mistral Small 4 Mistral Small 4 none Release: 2026-03-16	GPT-5 Mini GPT-5 Mini medium Release: 2025-08-07
Rank	#61	#38
Score	5.3	6.8
Consistency	9.5	8.5
Cost per result	0.108	1.473
Total Cost	$0.006	$0.118
Tests Correct
Attempt pass rate	33.3%	58.8%
Flaky tests	1	3
Total Runs	51	51
Output Tokens	1,624	5,896
Reasoning Tokens	0	49,322
Response Time (avg)	629ms	24.02s
Response Time (max)	1.72s	88.15s
Response Time (total)	10.70s	408.39s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mistral Small 4	3.4	7.9	16.7%	1		395ms	182	0
GPT-5 Mini	7.1	7.6	66.7%	1		13.86s	1,715	6,378

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mistral Small 4	3.0	10.0	0.0%	0		1.72s	496	0
GPT-5 Mini	10.0	10.0	100.0%	0		88.15s	754	11,520

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mistral Small 4	10.0	10.0	100.0%	0		822ms	261	0
GPT-5 Mini	10.0	10.0	100.0%	0		12.58s	453	3,200

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mistral Small 4	5.3	10.0	33.3%	0		367ms	28	0
GPT-5 Mini	3.6	7.2	22.2%	1		44.63s	293	14,016

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mistral Small 4	4.0	10.0	0.0%	0		729ms	205	0
GPT-5 Mini	4.5	10.0	0.0%	0		13.50s	349	1,856

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mistral Small 4	6.5	10.0	50.0%	0		380ms	69	0
GPT-5 Mini	8.0	6.6	83.3%	1		15.66s	318	4,992

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mistral Small 4	3.1	9.9	0.0%	0		589ms	170	0
GPT-5 Mini	5.6	9.8	33.3%	0		14.09s	1,527	5,760

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mistral Small 4	10.0	10.0	100.0%	0		1.40s	213	0
GPT-5 Mini	10.0	10.0	100.0%	0		18.64s	487	1,600

Quick Compare

Switch Comparison Pair

GPT-5 MinimediumvsQwen3.5 Plus 2026-02-15none GPT-5 MinimediumvsGLM 5none Claude Sonnet 4.6nonevsGPT-5 Minimedium Mistral Small 4nonevsQwen3 Coder Nextmedium DeepSeek V3.2nonevsGPT-5 Minimedium Mistral Small 4nonevsGLM 4.7 Flashmedium MiniMax M2.5mediumFree AvailablevsMistral Small 4none Mistral Small 4nonevsgpt-oss-120bmediumFree Available Mistral Small 4nonevsQwen3.5-9Bmedium GPT-5 MinimediumvsQwen3.5-Flashnone Seed-2.0-LitenonevsGPT-5 Minimedium Gemini 2.5 FlashnonevsGPT-5 Minimedium