Orodha ya kushindwa kwa Muundo wa ziada

Ona ni modeli gani za AI hukutana na Muundo wa ziada mara nyingi zaidi ili utambue hatari za utegemevu kabla ya kuchagua. Panga kwa: Majaribio sahihi ↑.

Modeli zilizoonyeshwa

Jumla ya kushindwa

Modeli iliyoathirika zaidi

Granite 4.1 8B 1

Kategoria

Katika kategoria Mbinu za kupinga AI20 Katika kategoria Uandishi wa msimbo18 Katika kategoria Mahususi kwa domeni17 Katika kategoria Utatuzi wa mafumbo8 Katika kategoria Uchanganuzi na uchimbaji wa data6 Katika kategoria Ufuataji wa maagizo3 Katika kategoria Mchanganyiko1

42/42

Nafasi	Modeli	Kampuni	Idadi ya Muundo wa ziada	Alama	Jumla ya gharama	Majaribio sahihi	Muda wa majibu (wastani)
#201	Granite 4.1 8B none	IBM Granite	1	4.0	$0.007	2/22	1.45s
Jumla ya majaribio 22 Majaribio yenye makosa 20 Jumla ya gharama $0.007 Muda wa majibu (wastani) 1.45s
#204	Qwen3.5-9B medium	Qwen	1	3.8	$0.036	3/22	82.2s
Jumla ya majaribio 22 Majaribio yenye makosa 19 Jumla ya gharama $0.036 Muda wa majibu (wastani) 82.2s
#171	North Mini Code none	Cohere	2	5.1	$0.000	4/22	29.9s
Jumla ya majaribio 22 Majaribio yenye makosa 18 Jumla ya gharama $0.000 Muda wa majibu (wastani) 29.9s
#199	Hy3 preview none	Tencent	1	4.0	$0.003	4/21	12.9s
Jumla ya majaribio 21 Majaribio yenye makosa 17 Jumla ya gharama $0.003 Muda wa majibu (wastani) 12.9s
#200	MiMo-V2-Flash none	Xiaomi	1	4.0	$0.025	4/21	2.76s
Jumla ya majaribio 21 Majaribio yenye makosa 17 Jumla ya gharama $0.025 Muda wa majibu (wastani) 2.76s
#150	DeepSeek V4 Flash none	DeepSeek	2	5.6	$0.044	5/22	36.8s
Jumla ya majaribio 22 Majaribio yenye makosa 17 Jumla ya gharama $0.044 Muda wa majibu (wastani) 36.8s
#166	Qwen3 Coder Next none	Qwen	1	5.1	$0.025	5/22	9.12s
Jumla ya majaribio 22 Majaribio yenye makosa 17 Jumla ya gharama $0.025 Muda wa majibu (wastani) 9.12s
#168	MiMo-V2.5 none	Xiaomi	1	5.1	$0.025	5/22	4.62s
Jumla ya majaribio 22 Majaribio yenye makosa 17 Jumla ya gharama $0.025 Muda wa majibu (wastani) 4.62s
#182	KAT-Coder-Air V2.5 none	Kwaipilot	3	4.8	$0.067	5/22	12.2s
Jumla ya majaribio 22 Majaribio yenye makosa 17 Jumla ya gharama $0.067 Muda wa majibu (wastani) 12.2s
#159	GPT-5.6 Luna none	OpenAI	1	5.4	$0.142	6/22	1.50s
Jumla ya majaribio 22 Majaribio yenye makosa 16 Jumla ya gharama $0.142 Muda wa majibu (wastani) 1.50s
#164	Inkling none	Thinkingmachines	1	5.2	$0.147	6/22	3.50s
Jumla ya majaribio 22 Majaribio yenye makosa 16 Jumla ya gharama $0.147 Muda wa majibu (wastani) 3.50s
#173	DeepSeek V3.2 none	DeepSeek	2	5.0	$0.054	6/22	18.3s
Jumla ya majaribio 22 Majaribio yenye makosa 16 Jumla ya gharama $0.054 Muda wa majibu (wastani) 18.3s
#111	LongCat 2.0 none	Meituan	1	6.3	$0.044	7/22	5.18s
Jumla ya majaribio 22 Majaribio yenye makosa 15 Jumla ya gharama $0.044 Muda wa majibu (wastani) 5.18s
#144	KAT-Coder-Air V2.5 high	Kwaipilot	3	5.6	$0.077	7/22	15.9s
Jumla ya majaribio 22 Majaribio yenye makosa 15 Jumla ya gharama $0.077 Muda wa majibu (wastani) 15.9s
#158	KAT-Coder-Air V2.5 low	Kwaipilot	4	5.4	$0.041	7/22	10.1s
Jumla ya majaribio 22 Majaribio yenye makosa 15 Jumla ya gharama $0.041 Muda wa majibu (wastani) 10.1s

Kushindwa kwa Muundo wa ziada

Chuja miundo

Modeli bora kwa Idadi ya Muundo wa ziada

Idadi ya Muundo wa ziada dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)