Orodha ya Mchanganyiko x Jibu lisilo sahihi

Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Jibu lisilo sahihi katika Mchanganyiko, ili uone udhaifu haraka.

Modeli zilizoonyeshwa

Jumla ya kushindwa

Modeli iliyoathirika zaidi

Gemini 3 Flash Preview 2

Sababu za kushindwa

Mwito wa zana si sahihi91 Jibu lisilo sahihi68 Hakuna jibu29 Hitilafu ya API26 Muda umeisha5 Hakufuata maelekezo1 Muundo wa ziada1

Kategoria

Mahususi kwa domeni412 Mbinu za kupinga AI293 Uandishi wa msimbo252 Utatuzi wa mafumbo201 Maarifa ya jumla168 Mchanganyiko68 Ufuataji wa maagizo61 Akili ya jumla59 Uchanganuzi na uchimbaji wa data41 Mwito wa zana3

63/63

Nafasi	Modeli	Kampuni	Idadi ya Jibu lisilo sahihi	Alama ya kategoria	Jumla ya gharama	Majaribio sahihi	Muda wa majibu (wastani)
#61	Gemini 3 Flash Preview low	Google	2	3.0	$0.177	0/2	10.2s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.177 Muda wa majibu (wastani) 10.2s
#139	GPT-5.4 none	OpenAI	2	3.0	$0.397	0/2	9.26s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.397 Muda wa majibu (wastani) 9.26s
#165	Mistral Small 4 none	Mistral	2	3.0	$0.022	0/2	7.44s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.022 Muda wa majibu (wastani) 7.44s
#177	Nemotron 3 Super none	NVIDIA	2	3.0	$0.008	0/2	18.2s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.008 Muda wa majibu (wastani) 18.2s
#189	Mercury 2 none	Inception	2	3.0	$0.030	0/2	2.56s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.030 Muda wa majibu (wastani) 2.56s
#20	Grok 4.5 low	X AI	1	6.5	$0.935	1/2	12.8s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.935 Muda wa majibu (wastani) 12.8s
#52	Kimi K2.7 Code medium	Moonshot AI	1	7.3	$0.751	1/2	66.0s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.751 Muda wa majibu (wastani) 66.0s
#59	Qwen3.7 Max none	Qwen	1	6.5	$0.197	1/2	37.2s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.197 Muda wa majibu (wastani) 37.2s
#83	GPT-5.6 Sol none	OpenAI	1	6.5	$0.524	1/2	8.37s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.524 Muda wa majibu (wastani) 8.37s
#87	GPT-5.5 none	OpenAI	1	6.5	$0.544	1/2	8.90s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.544 Muda wa majibu (wastani) 8.90s
#89	Gemini 3 Flash Preview none	Google	1	3.8	$0.085	0/2	12.4s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.085 Muda wa majibu (wastani) 12.4s
#92	KAT-Coder-Pro V2.5 none	Kwaipilot	1	4.1	$0.476	0/2	183.1s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.476 Muda wa majibu (wastani) 183.1s
#98	Qwen3.6 Max Preview none	Qwen	1	6.5	$0.231	1/2	61.6s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.231 Muda wa majibu (wastani) 61.6s
#103	Qwen3.5-27B none	Qwen	1	6.4	$0.090	1/2	39.4s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.090 Muda wa majibu (wastani) 39.4s
#104	Gemini 3.1 Flash Lite Preview low	Google	1	3.0	$0.646	0/2	160.6s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.646 Muda wa majibu (wastani) 160.6s

1 2 3 4 5

→

Chuja miundo

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa

Mchanganyiko: Jibu lisilo sahihi

Chuja miundo

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa