指示に従っていない失敗ランキング

どのAIモデルで指示に従っていないが起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。並び替え: 失敗数 ↑.

表示モデル数

総失敗数

246

最も影響を受けたモデル

Gemini 3.5 Flash 1

カテゴリ

パズル解決カテゴリで90 汎用知能カテゴリで78 反AIトリックカテゴリで33 指示追従カテゴリで19 コーディングカテゴリで16 ツール呼び出しカテゴリで8 ドメイン特化カテゴリで1 複合カテゴリで1

141/141

順位	モデル	企業	指示に従っていない件数	スコア	合計コスト	正解テスト	応答時間（平均）
#210	Qwen3.5-9B medium	Qwen	1	3.8	$0.036	3/22	82.2s
合計テスト数 22 誤答テスト数 19 合計コスト $0.036 応答時間（平均） 82.2s
#211	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
合計テスト数 19 誤答テスト数 14 合計コスト $0.004 応答時間（平均） 806ms
#213	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	1	3.4	$0.000	4/19	17.1s
合計テスト数 19 誤答テスト数 15 合計コスト $0.000 応答時間（平均） 17.1s
#215	Step 3.5 Flash none	Stepfun	1	2.3	$0.020	6/12	39.0s
合計テスト数 12 誤答テスト数 6 合計コスト $0.020 応答時間（平均） 39.0s
#216	LFM2-24B-A2B none	Liquid	1	2.2	$0.001	2/16	782ms
合計テスト数 16 誤答テスト数 14 合計コスト $0.001 応答時間（平均） 782ms
#16	GPT-5.3-Codex medium	OpenAI	2	8.9	$0.920	16/22	17.0s
合計テスト数 22 誤答テスト数 6 合計コスト $0.920 応答時間（平均） 17.0s
#19	Muse Spark 1.1 medium	Meta	2	8.6	$1.357	15/22	25.0s
合計テスト数 22 誤答テスト数 7 合計コスト $1.357 応答時間（平均） 25.0s
#21	GPT-5.4 medium	OpenAI	2	8.5	$1.533	15/22	23.1s
合計テスト数 22 誤答テスト数 7 合計コスト $1.533 応答時間（平均） 23.1s
#27	Muse Spark 1.1 low	Meta	2	8.3	$0.647	13/22	11.5s
合計テスト数 22 誤答テスト数 9 合計コスト $0.647 応答時間（平均） 11.5s
#30	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
合計テスト数 22 誤答テスト数 10 合計コスト $1.694 応答時間（平均） 31.5s
#39	Seed-2.0-Lite medium	Bytedance Seed	2	7.9	$0.234	14/22	48.5s
合計テスト数 22 誤答テスト数 8 合計コスト $0.234 応答時間（平均） 48.5s
#49	DeepSeek V4 Flash high	DeepSeek	2	7.7	$0.041	13/22	49.7s
合計テスト数 22 誤答テスト数 9 合計コスト $0.041 応答時間（平均） 49.7s
#50	DeepSeek V4 Pro high	DeepSeek	2	7.7	$0.200	10/22	79.1s
合計テスト数 22 誤答テスト数 12 合計コスト $0.200 応答時間（平均） 79.1s
#51	MiniMax M3 medium	Minimax	2	7.6	$0.286	12/22	75.0s
合計テスト数 22 誤答テスト数 10 合計コスト $0.286 応答時間（平均） 75.0s
#57	GPT-5.4 Nano medium	OpenAI	2	7.5	$0.138	12/22	13.2s
合計テスト数 22 誤答テスト数 10 合計コスト $0.138 応答時間（平均） 13.2s

指示に従っていないの失敗

モデルを絞り込む

指示に従っていない件数上位モデル

指示に従っていない件数対スコア

応答時間（平均）上位モデル

指示に従っていない の失敗

モデルを絞り込む

指示に従っていない 件数 上位モデル

指示に従っていない 件数 対 スコア

応答時間（平均） 上位モデル

指示に従っていないの失敗

指示に従っていない件数上位モデル

指示に従っていない件数対スコア

応答時間（平均）上位モデル