Peringkat kegagalan Tidak mengikuti instruksi

Lihat model AI mana yang paling sering mengalami Tidak mengikuti instruksi, agar Anda bisa melihat risiko keandalan sebelum memilih. Urutkan berdasarkan: Tes benar ↑.

Model yang ditampilkan

Total kegagalan

246

Model yang paling terdampak

Granite 4.1 8B 4

Kategori

Dalam kategori Pemecahan teka-teki90 Dalam kategori Kecerdasan umum78 Dalam kategori Trik anti-AI33 Dalam kategori Kepatuhan instruksi19 Dalam kategori Pemrograman16 Dalam kategori Pemanggilan alat8 Dalam kategori Gabungan1 Dalam kategori Spesifik domain1

141/141

Peringkat	Model	Perusahaan	Jumlah Tidak mengikuti instruksi	Skor	Total Biaya	Tes benar	Waktu respons (rata-rata)
#136	Step 3.5 Flash medium	Stepfun	3	6.0	$0.108	11/21	174.2s
Total Tes 21 Tes Salah 10 Total Biaya $0.108 Waktu respons (rata-rata) 174.2s
#29	GPT-5 Mini medium	OpenAI	3	8.1	$0.237	12/22	27.6s
Total Tes 22 Tes Salah 10 Total Biaya $0.237 Waktu respons (rata-rata) 27.6s
#30	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
Total Tes 22 Tes Salah 10 Total Biaya $1.694 Waktu respons (rata-rata) 31.5s
#51	MiniMax M3 medium	Minimax	2	7.6	$0.286	12/22	75.0s
Total Tes 22 Tes Salah 10 Total Biaya $0.286 Waktu respons (rata-rata) 75.0s
#56	Kimi K2.7 Code medium	Moonshot AI	1	7.5	$0.740	12/22	84.2s
Total Tes 22 Tes Salah 10 Total Biaya $0.740 Waktu respons (rata-rata) 84.2s
#57	GPT-5.4 Nano medium	OpenAI	2	7.5	$0.138	12/22	13.2s
Total Tes 22 Tes Salah 10 Total Biaya $0.138 Waktu respons (rata-rata) 13.2s
#60	GPT-5.4 Mini medium	OpenAI	3	7.5	$0.756	12/22	25.9s
Total Tes 22 Tes Salah 10 Total Biaya $0.756 Waktu respons (rata-rata) 25.9s
#67	Claude Sonnet 4.6 none	Anthropic	1	7.3	$0.661	12/22	8.12s
Total Tes 22 Tes Salah 10 Total Biaya $0.661 Waktu respons (rata-rata) 8.12s
#72	Kimi K2.6 medium	Moonshot AI	2	7.2	$1.036	12/22	110.0s
Total Tes 22 Tes Salah 10 Total Biaya $1.036 Waktu respons (rata-rata) 110.0s
#79	Grok 4.20 medium	X AI	2	7.1	$0.777	12/22	29.5s
Total Tes 22 Tes Salah 10 Total Biaya $0.777 Waktu respons (rata-rata) 29.5s
#88	MiMo-V2.5-Pro medium	Xiaomi	2	6.9	$0.187	12/22	33.9s
Total Tes 22 Tes Salah 10 Total Biaya $0.187 Waktu respons (rata-rata) 33.9s
#89	Qwen3.6 Flash medium	Qwen	1	6.9	$0.738	12/22	44.7s
Total Tes 22 Tes Salah 10 Total Biaya $0.738 Waktu respons (rata-rata) 44.7s
#101	GLM 5.2 none	Z.ai	1	6.6	$0.128	12/22	9.34s
Total Tes 22 Tes Salah 10 Total Biaya $0.128 Waktu respons (rata-rata) 9.34s
#107	MiMo-V2.5 medium	Xiaomi	1	6.5	$0.082	12/22	32.2s
Total Tes 22 Tes Salah 10 Total Biaya $0.082 Waktu respons (rata-rata) 32.2s
#112	Gemini 3.1 Flash Lite Preview none	Google	2	6.4	$0.052	12/22	1.58s
Total Tes 22 Tes Salah 10 Total Biaya $0.052 Waktu respons (rata-rata) 1.58s

Kegagalan Tidak mengikuti instruksi

Filter model

Model teratas menurut Jumlah Tidak mengikuti instruksi

Jumlah Tidak mengikuti instruksi vs Skor

Model teratas menurut Waktu respons (rata-rata)