Orodha ya Mchanganyiko x Jibu lisilo sahihi

Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Jibu lisilo sahihi katika Mchanganyiko, ili uone udhaifu haraka. Panga kwa: Muda wa majibu (wastani) ↓.

Modeli zilizoonyeshwa

Jumla ya kushindwa

Modeli iliyoathirika zaidi

Qwen3.5-Flash 1

Sababu za kushindwa

Mwito wa zana si sahihi91 Jibu lisilo sahihi68 Hakuna jibu29 Hitilafu ya API26 Muda umeisha5 Hakufuata maelekezo1 Muundo wa ziada1

Kategoria

Mahususi kwa domeni412 Mbinu za kupinga AI293 Uandishi wa msimbo252 Utatuzi wa mafumbo201 Maarifa ya jumla168 Mchanganyiko68 Ufuataji wa maagizo61 Akili ya jumla59 Uchanganuzi na uchimbaji wa data41 Mwito wa zana3

63/63

Nafasi	Modeli	Kampuni	Idadi ya Jibu lisilo sahihi	Alama ya kategoria	Jumla ya gharama	Majaribio sahihi	Muda wa majibu (wastani)
#125	Qwen3.5-Flash none	Qwen	1	2.9	$0.073	0/2	243.6s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.073 Muda wa majibu (wastani) 243.6s
#92	KAT-Coder-Pro V2.5 none	Kwaipilot	1	4.1	$0.476	0/2	183.1s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.476 Muda wa majibu (wastani) 183.1s
#105	Gemini 3.1 Flash Lite low	Google	1	3.2	$0.621	0/2	161.2s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.621 Muda wa majibu (wastani) 161.2s
#104	Gemini 3.1 Flash Lite Preview low	Google	1	3.0	$0.646	0/2	160.6s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.646 Muda wa majibu (wastani) 160.6s
#142	Qwen3.5-122B-A10B none	Qwen	1	5.2	$0.247	0/2	129.3s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.247 Muda wa majibu (wastani) 129.3s
#127	Qwen3.5-35B-A3B none	Qwen	1	3.8	$0.106	0/2	128.3s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.106 Muda wa majibu (wastani) 128.3s
#126	Qwen3.5 Plus 2026-04-20 none	Qwen	1	6.4	$0.122	1/2	109.7s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.122 Muda wa majibu (wastani) 109.7s
#138	Kimi K2.6 none	Moonshot AI	1	3.0	$0.184	0/2	77.8s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.184 Muda wa majibu (wastani) 77.8s
#182	KAT-Coder-Air V2.5 none	Kwaipilot	1	3.8	$0.067	0/2	73.0s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.067 Muda wa majibu (wastani) 73.0s
#52	Kimi K2.7 Code medium	Moonshot AI	1	7.3	$0.751	1/2	66.0s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.751 Muda wa majibu (wastani) 66.0s
#107	Qwen3.5 Plus 2026-02-15 none	Qwen	1	6.5	$0.073	1/2	64.8s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.073 Muda wa majibu (wastani) 64.8s
#109	Mimo V2 PRO medium	Xiaomi	1	2.3	$0.333	0/1	64.7s
Jumla ya majaribio 1 Majaribio yenye makosa 1 Jumla ya gharama $0.333 Muda wa majibu (wastani) 64.7s
#98	Qwen3.6 Max Preview none	Qwen	1	6.5	$0.231	1/2	61.6s
Jumla ya majaribio 2 Majaribio yenye makosa 1 Jumla ya gharama $0.231 Muda wa majibu (wastani) 61.6s
#118	Gemini 2.5 Flash none	Google	1	3.0	$0.017	0/2	61.2s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.017 Muda wa majibu (wastani) 61.2s
#155	Kimi K2.5 none	Moonshot AI	1	2.8	$0.127	0/2	61.0s
Jumla ya majaribio 2 Majaribio yenye makosa 2 Jumla ya gharama $0.127 Muda wa majibu (wastani) 61.0s

1 2 3 4 5

→

Chuja miundo

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa

Mchanganyiko: Jibu lisilo sahihi

Chuja miundo

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa