Orodha ya Utatuzi wa mafumbo x Hakufuata maelekezo

Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Hakufuata maelekezo katika Utatuzi wa mafumbo, ili uone udhaifu haraka. Panga kwa: Majaribio sahihi ↑.

Modeli zilizoonyeshwa

Jumla ya kushindwa

Modeli iliyoathirika zaidi

GPT-5.4 Nano 1

Sababu za kushindwa

Jibu lisilo sahihi201 Hakufuata maelekezo90 Hitilafu ya API12 Muundo wa ziada8 Muda umeisha5 Hakuna jibu3

Kategoria

Utatuzi wa mafumbo90 Akili ya jumla78 Mbinu za kupinga AI33 Ufuataji wa maagizo18 Uandishi wa msimbo16 Mwito wa zana8 Mahususi kwa domeni1 Mchanganyiko1

86/86

Nafasi	Modeli	Kampuni	Idadi ya Hakufuata maelekezo	Alama ya kategoria	Jumla ya gharama	Majaribio sahihi	Muda wa majibu (wastani)
#53	GPT-5.4 Nano medium	OpenAI	1	4.1	$0.138	0/3	3.79s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.138 Muda wa majibu (wastani) 3.79s
#91	LongCat 2.0 low	Meituan	1	3.1	$0.391	0/3	8.15s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.391 Muda wa majibu (wastani) 8.15s
#97	LongCat 2.0 high	Meituan	1	3.1	$0.469	0/3	9.18s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.469 Muda wa majibu (wastani) 9.18s
#124	Qwen3.6 Flash none	Qwen	1	3.5	$0.062	0/3	1.21s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.062 Muda wa majibu (wastani) 1.21s
#127	Qwen3.5-35B-A3B none	Qwen	1	3.7	$0.106	0/3	1.35s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.106 Muda wa majibu (wastani) 1.35s
#138	Kimi K2.6 none	Moonshot AI	1	3.1	$0.184	0/3	1.40s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.184 Muda wa majibu (wastani) 1.40s
#140	Nemotron 3 Super medium	NVIDIA	1	3.0	$0.050	0/3	3.15s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.050 Muda wa majibu (wastani) 3.15s
#142	Qwen3.5-122B-A10B none	Qwen	1	3.8	$0.247	0/3	1.00s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.247 Muda wa majibu (wastani) 1.00s
#150	DeepSeek V4 Flash none	DeepSeek	1	3.1	$0.044	0/3	23.7s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.044 Muda wa majibu (wastani) 23.7s
#158	KAT-Coder-Air V2.5 low	Kwaipilot	1	3.1	$0.041	0/3	1.57s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.041 Muda wa majibu (wastani) 1.57s
#161	Qwen3.6 35B A3B none	Qwen	2	3.2	$0.061	0/3	1.07s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.061 Muda wa majibu (wastani) 1.07s
#162	Ling-2.6-1T none	Inclusionai	1	3.1	$0.016	0/3	5.36s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.016 Muda wa majibu (wastani) 5.36s
#165	Mistral Small 4 none	Mistral	1	3.1	$0.022	0/3	399ms
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.022 Muda wa majibu (wastani) 399ms
#167	Mistral Small 4 medium	Mistral	1	3.4	$0.096	0/3	2.17s
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.096 Muda wa majibu (wastani) 2.17s
#169	Qwen3.5-9B none	Qwen	1	3.2	$0.021	0/3	621ms
Jumla ya majaribio 3 Majaribio yenye makosa 3 Jumla ya gharama $0.021 Muda wa majibu (wastani) 621ms

1 2 3 4 5 6

→

Chuja miundo

Modeli bora kwa Idadi ya Hakufuata maelekezo

Idadi ya Hakufuata maelekezo dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa

Utatuzi wa mafumbo: Hakufuata maelekezo

Chuja miundo

Modeli bora kwa Idadi ya Hakufuata maelekezo

Idadi ya Hakufuata maelekezo dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa