不正解失敗ランキング

どのAIモデルで不正解が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。並び替え: 正解テスト ↓.

表示モデル数

総失敗数

1585

最も影響を受けたモデル

カテゴリ

ドメイン特化カテゴリで421 反AIトリックカテゴリで293 コーディングカテゴリで259 パズル解決カテゴリで204 雑学カテゴリで172 複合カテゴリで69 汎用知能カテゴリで62 指示追従カテゴリで61 データ解析と抽出カテゴリで41 ツール呼び出しカテゴリで3

215/215

順位	モデル	企業	不正解件数	スコア	合計コスト	正解テスト	応答時間（平均）
#47	Claude Opus 4.6 medium	Anthropic	3	7.7	$3.059	13/22	34.3s
合計テスト数 22 誤答テスト数 9 合計コスト $3.059 応答時間（平均） 34.3s
#49	DeepSeek V4 Flash high	DeepSeek	6	7.7	$0.041	13/22	49.7s
合計テスト数 22 誤答テスト数 9 合計コスト $0.041 応答時間（平均） 49.7s
#55	Nemotron 3 Ultra medium	NVIDIA	7	7.5	$0.774	13/22	32.2s
合計テスト数 22 誤答テスト数 9 合計コスト $0.774 応答時間（平均） 32.2s
#58	GPT-5.3 Chat none	OpenAI	7	7.5	$0.571	13/22	6.88s
合計テスト数 22 誤答テスト数 9 合計コスト $0.571 応答時間（平均） 6.88s
#59	GPT-5.6 Terra low	OpenAI	8	7.5	$0.519	13/22	5.31s
合計テスト数 22 誤答テスト数 9 合計コスト $0.519 応答時間（平均） 5.31s
#62	Qwen3.5-27B medium	Qwen	4	7.4	$1.627	13/22	111.9s
合計テスト数 22 誤答テスト数 9 合計コスト $1.627 応答時間（平均） 111.9s
#68	Gemini 3.1 Flash Lite Preview medium	Google	7	7.3	$0.115	13/22	4.61s
合計テスト数 22 誤答テスト数 9 合計コスト $0.115 応答時間（平均） 4.61s
#69	Gemini 3.1 Flash Lite medium	Google	7	7.3	$0.117	13/22	4.27s
合計テスト数 22 誤答テスト数 9 合計コスト $0.117 応答時間（平均） 4.27s
#70	Claude Opus 4.8 none	Anthropic	4	7.3	$1.166	13/22	4.91s
合計テスト数 22 誤答テスト数 9 合計コスト $1.166 応答時間（平均） 4.91s
#74	Qwen3.5 Plus 2026-04-20 medium	Qwen	8	7.2	$0.317	13/22	46.4s
合計テスト数 22 誤答テスト数 9 合計コスト $0.317 応答時間（平均） 46.4s
#77	Grok 4.3 medium	X AI	5	7.1	$0.779	13/22	47.4s
合計テスト数 22 誤答テスト数 9 合計コスト $0.779 応答時間（平均） 47.4s
#78	GLM 5.1 medium	Z.ai	4	7.1	$0.535	13/22	46.8s
合計テスト数 22 誤答テスト数 9 合計コスト $0.535 応答時間（平均） 46.8s
#93	Gemini 3 Flash Preview none	Google	8	6.8	$0.085	13/22	2.95s
合計テスト数 22 誤答テスト数 9 合計コスト $0.085 応答時間（平均） 2.95s
#94	Qwen3.6 35B A3B medium	Qwen	4	6.7	$0.746	13/22	58.1s
合計テスト数 22 誤答テスト数 9 合計コスト $0.746 応答時間（平均） 58.1s
#110	Gemini 3.1 Flash Lite Preview low	Google	7	6.5	$0.646	13/22	16.7s
合計テスト数 22 誤答テスト数 9 合計コスト $0.646 応答時間（平均） 16.7s

不正解の失敗

モデルを絞り込む

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

不正解 の失敗

モデルを絞り込む

不正解 件数 上位モデル

不正解 件数 対 スコア

応答時間（平均） 上位モデル

不正解の失敗

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル