Orodha ya Mchanganyiko x Jibu lisilo sahihi

Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Jibu lisilo sahihi katika Mchanganyiko, ili uone udhaifu haraka. Panga kwa: Idadi ya kushindwa ↑.

Modeli zilizoonyeshwa

Jumla ya kushindwa

Modeli iliyoathirika zaidi

Grok 4.5 1

Sababu za kushindwa

Mwito wa zana si sahihi91 Jibu lisilo sahihi68 Hakuna jibu29 Hitilafu ya API26 Muda umeisha5 Hakufuata maelekezo1 Muundo wa ziada1

Kategoria

Mahususi kwa domeni412 Mbinu za kupinga AI293 Uandishi wa msimbo252 Utatuzi wa mafumbo201 Maarifa ya jumla168 Mchanganyiko68 Ufuataji wa maagizo61 Akili ya jumla59 Uchanganuzi na uchimbaji wa data41 Mwito wa zana3

63/63

Nafasi	Modeli	Kampuni	Idadi ya Jibu lisilo sahihi	Alama ya kategoria	Jumla ya gharama	Majaribio sahihi	Muda wa majibu (wastani)
#20	Grok 4.5 low	X AI	1	6.5	$0.935	1/2	12.8s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.935 Muda wa majibu (wastani) 12.8s
#52	Kimi K2.7 Code medium	Moonshot AI	1	7.3	$0.751	1/2	66.0s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.751 Muda wa majibu (wastani) 66.0s
#59	Qwen3.7 Max none	Qwen	1	6.5	$0.197	1/2	37.2s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.197 Muda wa majibu (wastani) 37.2s
#83	GPT-5.6 Sol none	OpenAI	1	6.5	$0.524	1/2	8.37s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.524 Muda wa majibu (wastani) 8.37s
#87	GPT-5.5 none	OpenAI	1	6.5	$0.544	1/2	8.90s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.544 Muda wa majibu (wastani) 8.90s
#89	Gemini 3 Flash Preview none	Google	1	3.8	$0.085	0/2	12.4s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.085 Muda wa majibu (wastani) 12.4s
#92	KAT-Coder-Pro V2.5 none	Kwaipilot	1	4.1	$0.476	0/2	183.1s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.476 Muda wa majibu (wastani) 183.1s
#98	Qwen3.6 Max Preview none	Qwen	1	6.5	$0.231	1/2	61.6s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.231 Muda wa majibu (wastani) 61.6s
#103	Qwen3.5-27B none	Qwen	1	6.4	$0.090	1/2	39.4s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.090 Muda wa majibu (wastani) 39.4s
#104	Gemini 3.1 Flash Lite Preview low	Google	1	3.0	$0.646	0/2	160.6s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.646 Muda wa majibu (wastani) 160.6s
#105	Gemini 3.1 Flash Lite low	Google	1	3.2	$0.621	0/2	161.2s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.621 Muda wa majibu (wastani) 161.2s
#106	Gemini 3.1 Flash Lite Preview none	Google	1	3.0	$0.052	0/2	6.23s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.052 Muda wa majibu (wastani) 6.23s
#107	Qwen3.5 Plus 2026-02-15 none	Qwen	1	6.5	$0.073	1/2	64.8s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.073 Muda wa majibu (wastani) 64.8s
#109	Mimo V2 PRO medium	Xiaomi	1	2.3	$0.333	0/1	64.7s
Jumla ya majaribio 1 Majaribio yenye makosa 1 Jumla ya gharama $0.333 Muda wa majibu (wastani) 64.7s
#111	LongCat 2.0 none	Meituan	1	6.5	$0.044	1/2	28.4s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.044 Muda wa majibu (wastani) 28.4s

1 2 3 4 5

→

Chuja miundo

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa

Mchanganyiko: Jibu lisilo sahihi

Chuja miundo

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa