AI BENCHY Compare

Google: Gemini 3.5 Flash vs LiquidAI: LFM2-24B-A2B

Last updated at: 2026-05-28

Metric	Gemini 3.5 Flash Gemini 3.5 Flash low Release: 2026-05-19	LFM2-24B-A2B LFM2-24B-A2B none Release: 2026-02-24

Metric	Gemini 3.5 Flash Gemini 3.5 Flash low Release: 2026-05-19	LFM2-24B-A2B LFM2-24B-A2B none Release: 2026-02-24
Score	9.3	4.2
Rank	#3	#154
Reliability	10.0	N/A
Consistency	10.0	9.4
Tests Correct
Attempt pass rate	90.0%	16.7%
Flaky tests	0	1
Total Runs	60	48
Cost per result	1.582	0.024
Total Cost	$0.285	$0.001
Input Price	$1.500 / 1M	$0.030 / 1M
Output Price	$9.000 / 1M	$0.120 / 1M
Output Tokens	2,027	1,173
Reasoning Tokens	23,938	0
Response Time (avg)	2.98s	782ms
Response Time (max)	6.44s	3.15s
Response Time (total)	59.59s	10.94s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.52s	209	2,536
LFM2-24B-A2B	3.3	9.8	0.0%	0		471ms	490	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	6.8	10.0	50.0%	0		5.54s	452	6,839
LFM2-24B-A2B	-	-	-	-	-	-	-	-

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	10.0	10.0	100.0%	0		6.44s	351	3,050
LFM2-24B-A2B	3.0	10.0	0.0%	0		0ms	0	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	10.0	10.0	100.0%	0		1.81s	279	1,164
LFM2-24B-A2B	3.0	10.0	0.0%	0		714ms	219	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	7.7	10.0	66.7%	0		3.39s	12	4,538
LFM2-24B-A2B	5.9	7.2	55.6%	1		287ms	30	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.27s	119	916
LFM2-24B-A2B	4.0	10.0	0.0%	0		395ms	72	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	9.9	10.0	100.0%	0		1.86s	71	1,652
LFM2-24B-A2B	6.3	10.0	50.0%	0		752ms	60	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.35s	288	2,150
LFM2-24B-A2B	3.8	10.0	0.0%	0		1.78s	302	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.27s	234	403
LFM2-24B-A2B	3.0	10.0	0.0%	0		0ms	0	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.5 Flash	10.0	10.0	100.0%	0		1.88s	12	690
LFM2-24B-A2B	-	-	-	-	-	-	-	-

Quick Compare

Switch Comparison Pair

Gemini 3.5 FlashlowvsQwen3.7 Maxmedium Claude Opus 4.7mediumvsGemini 3.5 Flashlow Gemini 3.5 FlashlowvsGPT-5.5medium Claude Opus 4.8mediumvsGemini 3.5 Flashlow Gemini 3.5 FlashlowvsQwen3.6 Max Previewmedium Gemini 3.5 FlashlowvsGPT-5.3-Codexmedium Gemini 3.5 FlashlowvsGLM 5medium Gemini 3.5 FlashlowvsQwen3.5 Plus 2026-02-15medium Seed-2.0-LitemediumvsGemini 3.5 Flashlow Gemini 3.5 FlashlowvsQwen3.5-27Bmedium Gemini 3.5 FlashlowvsQwen3.7 Maxnone Gemini 3.5 FlashlowvsGPT-5.4medium