Orodha ya kushindwa kwa Hakufuata maelekezo

Ona ni modeli gani za AI hukutana na Hakufuata maelekezo mara nyingi zaidi ili utambue hatari za utegemevu kabla ya kuchagua. Panga kwa: Muda wa majibu (wastani) ↓.

Modeli zilizoonyeshwa

Jumla ya kushindwa

246

Modeli iliyoathirika zaidi

Step 3.5 Flash 3

Kategoria

Katika kategoria Utatuzi wa mafumbo90 Katika kategoria Akili ya jumla78 Katika kategoria Mbinu za kupinga AI33 Katika kategoria Ufuataji wa maagizo19 Katika kategoria Uandishi wa msimbo16 Katika kategoria Mwito wa zana8 Katika kategoria Mahususi kwa domeni1 Katika kategoria Mchanganyiko1

141/141

Nafasi	Modeli	Kampuni	Idadi ya Hakufuata maelekezo	Alama	Jumla ya gharama	Majaribio sahihi	Muda wa majibu (wastani)
#175	Qwen3.5-9B none	Qwen	2	5.1	$0.021	4/22	19.2s
Jumla ya majaribio 22 Majaribio yenye makosa 18 Jumla ya gharama $0.021 Muda wa majibu (wastani) 19.2s
#179	DeepSeek V3.2 none	DeepSeek	1	5.0	$0.054	6/22	18.3s
Jumla ya majaribio 22 Majaribio yenye makosa 16 Jumla ya gharama $0.054 Muda wa majibu (wastani) 18.3s
#213	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	1	3.4	$0.000	4/19	17.1s
Jumla ya majaribio 19 Majaribio yenye makosa 15 Jumla ya gharama $0.000 Muda wa majibu (wastani) 17.1s
#16	GPT-5.3-Codex medium	OpenAI	2	8.9	$0.920	16/22	17.0s
Jumla ya majaribio 22 Majaribio yenye makosa 6 Jumla ya gharama $0.920 Muda wa majibu (wastani) 17.0s
#110	Gemini 3.1 Flash Lite Preview low	Google	1	6.5	$0.646	13/22	16.7s
Jumla ya majaribio 22 Majaribio yenye makosa 9 Jumla ya gharama $0.646 Muda wa majibu (wastani) 16.7s
#106	Hy3 preview medium	Tencent	1	6.5	$0.018	14/21	16.3s
Jumla ya majaribio 21 Majaribio yenye makosa 7 Jumla ya gharama $0.018 Muda wa majibu (wastani) 16.3s
#192	Laguna M.1 medium	Poolside	1	4.7	$0.033	9/19	14.7s
Jumla ya majaribio 19 Majaribio yenye makosa 10 Jumla ya gharama $0.033 Muda wa majibu (wastani) 14.7s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	2	6.1	$0.122	8/22	13.6s
Jumla ya majaribio 22 Majaribio yenye makosa 14 Jumla ya gharama $0.122 Muda wa majibu (wastani) 13.6s
#57	GPT-5.4 Nano medium	OpenAI	2	7.5	$0.138	12/22	13.2s
Jumla ya majaribio 22 Majaribio yenye makosa 10 Jumla ya gharama $0.138 Muda wa majibu (wastani) 13.2s
#205	Hy3 preview none	Tencent	4	4.0	$0.003	4/21	12.9s
Jumla ya majaribio 21 Majaribio yenye makosa 17 Jumla ya gharama $0.003 Muda wa majibu (wastani) 12.9s
#148	Qwen3.5-122B-A10B none	Qwen	2	5.7	$0.247	6/22	12.9s
Jumla ya majaribio 22 Majaribio yenye makosa 16 Jumla ya gharama $0.247 Muda wa majibu (wastani) 12.9s
#133	Qwen3.5-35B-A3B none	Qwen	2	6.1	$0.106	7/22	12.7s
Jumla ya majaribio 22 Majaribio yenye makosa 15 Jumla ya gharama $0.106 Muda wa majibu (wastani) 12.7s
#26	Claude Sonnet 5 medium	Anthropic	1	8.3	$0.922	16/22	12.5s
Jumla ya majaribio 22 Majaribio yenye makosa 6 Jumla ya gharama $0.922 Muda wa majibu (wastani) 12.5s
#75	Qwen3.7 Plus none	Qwen	1	7.2	$0.106	11/22	12.1s
Jumla ya majaribio 22 Majaribio yenye makosa 11 Jumla ya gharama $0.106 Muda wa majibu (wastani) 12.1s
#152	Owl Alpha medium	Openrouter	2	5.6	$0.000	8/21	11.9s
Jumla ya majaribio 21 Majaribio yenye makosa 13 Jumla ya gharama $0.000 Muda wa majibu (wastani) 11.9s

Kushindwa kwa Hakufuata maelekezo

Chuja miundo

Modeli bora kwa Idadi ya Hakufuata maelekezo

Idadi ya Hakufuata maelekezo dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)