Orodha ya Utatuzi wa mafumbo x Jibu lisilo sahihi

Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Jibu lisilo sahihi katika Utatuzi wa mafumbo, ili uone udhaifu haraka.

Modeli zilizoonyeshwa

Jumla ya kushindwa

201

Modeli iliyoathirika zaidi

Qwen3.5-Flash 3

Sababu za kushindwa

Jibu lisilo sahihi201 Hakufuata maelekezo90 Hitilafu ya API12 Muundo wa ziada8 Muda umeisha5 Hakuna jibu3

Kategoria

Mahususi kwa domeni412 Mbinu za kupinga AI293 Uandishi wa msimbo252 Utatuzi wa mafumbo201 Maarifa ya jumla168 Mchanganyiko68 Ufuataji wa maagizo61 Akili ya jumla59 Uchanganuzi na uchimbaji wa data41 Mwito wa zana3

142/142

Nafasi	Modeli	Kampuni	Idadi ya Jibu lisilo sahihi	Alama ya kategoria	Jumla ya gharama	Majaribio sahihi	Muda wa majibu (wastani)
#125	Qwen3.5-Flash none	Qwen	3	3.1	$0.073	0/3	10.9s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.073 Muda wa majibu (wastani) 10.9s
#137	North Mini Code medium	Cohere	3	3.3	$0.000	0/3	19.7s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.000 Muda wa majibu (wastani) 19.7s
#144	KAT-Coder-Air V2.5 high	Kwaipilot	3	3.5	$0.077	0/3	2.47s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.077 Muda wa majibu (wastani) 2.47s
#149	KAT-Coder-Air V2.5 medium	Kwaipilot	3	3.6	$0.048	0/3	1.87s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.048 Muda wa majibu (wastani) 1.87s
#155	Kimi K2.5 none	Moonshot AI	3	3.0	$0.127	0/3	4.04s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.127 Muda wa majibu (wastani) 4.04s
#160	Laguna XS 2.1 none	Poolside	3	3.0	$0.008	0/3	1.01s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.008 Muda wa majibu (wastani) 1.01s
#166	Qwen3 Coder Next none	Qwen	3	3.0	$0.025	0/3	24.3s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.025 Muda wa majibu (wastani) 24.3s
#182	KAT-Coder-Air V2.5 none	Kwaipilot	3	2.9	$0.067	0/3	1.84s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.067 Muda wa majibu (wastani) 1.84s
#189	Mercury 2 none	Inception	3	3.1	$0.030	0/3	535ms
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.030 Muda wa majibu (wastani) 535ms
#203	Grok 4.1 Fast none	X AI	3	3.0	$0.008	0/3	1.10s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.008 Muda wa majibu (wastani) 1.10s
#29	Step 3.7 Flash medium	Stepfun	2	5.7	$0.515	1/3	6.19s
Jumla ya majaribio 3 Majaribio yenye makosa 2 Jumla ya gharama $0.515 Muda wa majibu (wastani) 6.19s
#51	Nemotron 3 Ultra medium	NVIDIA	2	5.5	$0.774	1/3	3.54s
Jumla ya majaribio 3 Majaribio yenye makosa 2 Jumla ya gharama $0.774 Muda wa majibu (wastani) 3.54s
#53	GPT-5.4 Nano medium	OpenAI	2	4.1	$0.138	0/3	3.79s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.138 Muda wa majibu (wastani) 3.79s
#60	LongCat 2.0 medium	Meituan	2	5.4	$0.478	1/3	8.84s
Jumla ya majaribio 3 Majaribio yenye makosa 2 Jumla ya gharama $0.478 Muda wa majibu (wastani) 8.84s
#62	KAT-Coder-Pro V2.5 low	Kwaipilot	2	6.4	$0.387	1/3	3.11s
Jumla ya majaribio 3 Majaribio yenye makosa 2 Jumla ya gharama $0.387 Muda wa majibu (wastani) 3.11s

Chuja miundo

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa

Utatuzi wa mafumbo: Jibu lisilo sahihi

Chuja miundo

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa