指示に従っていない失敗ランキング

どのAIモデルで指示に従っていないが起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。並び替え: 応答時間（平均） ↑.

表示モデル数

総失敗数

245

最も影響を受けたモデル

Nemotron 3 Nano Omni 30b A3b Reasoning 2

カテゴリ

パズル解決カテゴリで90 汎用知能カテゴリで78 反AIトリックカテゴリで33 指示追従カテゴリで18 コーディングカテゴリで16 ツール呼び出しカテゴリで8 ドメイン特化カテゴリで1 複合カテゴリで1

140/140

順位	モデル	企業	指示に従っていない件数	スコア	合計コスト	正解テスト	応答時間（平均）
#208	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	2	3.2	$0.000	2/19	728ms
合計テスト数 19 誤答テスト数 17 合計コスト $0.000 応答時間（平均） 728ms
#210	LFM2-24B-A2B none	Liquid	1	2.2	$0.001	2/16	782ms
合計テスト数 16 誤答テスト数 14 合計コスト $0.001 応答時間（平均） 782ms
#205	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
合計テスト数 19 誤答テスト数 14 合計コスト $0.004 応答時間（平均） 806ms
#189	Mercury 2 none	Inception	1	4.6	$0.030	4/22	829ms
合計テスト数 22 誤答テスト数 18 合計コスト $0.030 応答時間（平均） 829ms
#191	Grok 4.20 Beta none	X AI	1	4.4	$0.087	6/18	1.19s
合計テスト数 18 誤答テスト数 12 合計コスト $0.087 応答時間（平均） 1.19s
#165	Mistral Small 4 none	Mistral	1	5.1	$0.022	5/22	1.20s
合計テスト数 22 誤答テスト数 17 合計コスト $0.022 応答時間（平均） 1.20s
#193	Elephant Alpha none	Openrouter	3	4.3	$0.000	5/21	1.22s
合計テスト数 21 誤答テスト数 16 合計コスト $0.000 応答時間（平均） 1.22s
#195	Elephant Alpha medium	Openrouter	2	4.3	$0.000	6/21	1.27s
合計テスト数 21 誤答テスト数 15 合計コスト $0.000 応答時間（平均） 1.27s
#201	Granite 4.1 8B none	IBM Granite	4	4.0	$0.007	2/22	1.45s
合計テスト数 22 誤答テスト数 20 合計コスト $0.007 応答時間（平均） 1.45s
#136	GPT-5.4 Mini none	OpenAI	3	5.9	$0.095	6/22	1.53s
合計テスト数 22 誤答テスト数 16 合計コスト $0.095 応答時間（平均） 1.53s
#160	Laguna XS 2.1 none	Poolside	1	5.3	$0.008	5/22	1.55s
合計テスト数 22 誤答テスト数 17 合計コスト $0.008 応答時間（平均） 1.55s
#106	Gemini 3.1 Flash Lite Preview none	Google	2	6.4	$0.052	12/22	1.58s
合計テスト数 22 誤答テスト数 10 合計コスト $0.052 応答時間（平均） 1.58s
#203	Grok 4.1 Fast none	X AI	3	3.8	$0.008	3/19	1.62s
合計テスト数 19 誤答テスト数 16 合計コスト $0.008 応答時間（平均） 1.62s
#132	GPT-5.6 Terra none	OpenAI	1	6.0	$0.349	8/22	1.65s
合計テスト数 22 誤答テスト数 14 合計コスト $0.349 応答時間（平均） 1.65s
#122	Gemini 3.1 Flash Lite none	Google	1	6.1	$0.046	9/22	1.75s
合計テスト数 22 誤答テスト数 13 合計コスト $0.046 応答時間（平均） 1.75s

指示に従っていないの失敗

モデルを絞り込む

指示に従っていない件数上位モデル

指示に従っていない件数対スコア

応答時間（平均）上位モデル

指示に従っていない の失敗

モデルを絞り込む

指示に従っていない 件数 上位モデル

指示に従っていない 件数 対 スコア

応答時間（平均） 上位モデル

指示に従っていないの失敗

指示に従っていない件数上位モデル

指示に従っていない件数対スコア

応答時間（平均）上位モデル