不正解失敗ランキング

どのAIモデルで不正解が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。並び替え: 正解テスト ↓.

表示モデル数

総失敗数

1642

最も影響を受けたモデル

カテゴリ

ドメイン特化カテゴリで433 反AIトリックカテゴリで306 コーディングカテゴリで266 パズル解決カテゴリで214 雑学カテゴリで176 複合カテゴリで71 汎用知能カテゴリで66 指示追従カテゴリで65 データ解析と抽出カテゴリで41 ツール呼び出しカテゴリで4

219/219

順位	モデル	企業	不正解件数	スコア	合計コスト	正解テスト	応答時間（平均）
#19	Muse Spark 1.1 medium	Meta	4	8.6	$1.357	15/22	25.0s
合計テスト数 22 誤答テスト数 7 合計コスト $1.357 応答時間（平均） 25.0s
#21	GPT-5.4 medium	OpenAI	5	8.5	$1.533	15/22	23.1s
合計テスト数 22 誤答テスト数 7 合計コスト $1.533 応答時間（平均） 23.1s
#28	Gemini 2.5 Flash medium	Google	6	8.2	$0.643	15/22	21.2s
合計テスト数 22 誤答テスト数 7 合計コスト $0.643 応答時間（平均） 21.2s
#32	Inkling high	Thinkingmachines	4	8.0	$1.006	15/22	64.2s
合計テスト数 22 誤答テスト数 7 合計コスト $1.006 応答時間（平均） 64.2s
#36	Inkling medium	Thinkingmachines	4	8.0	$0.391	15/22	16.2s
合計テスト数 22 誤答テスト数 7 合計コスト $0.391 応答時間（平均） 16.2s
#40	Qwen3.7 Plus medium	Qwen	5	7.9	$0.267	15/22	51.5s
合計テスト数 22 誤答テスト数 7 合計コスト $0.267 応答時間（平均） 51.5s
#41	Qwen3.6 Plus medium	Qwen	5	7.8	$0.405	15/22	43.1s
合計テスト数 22 誤答テスト数 7 合計コスト $0.405 応答時間（平均） 43.1s
#48	GPT-5.6 Luna high	OpenAI	7	7.7	$1.017	15/22	18.7s
合計テスト数 22 誤答テスト数 7 合計コスト $1.017 応答時間（平均） 18.7s
#63	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
合計テスト数 22 誤答テスト数 7 合計コスト $0.197 応答時間（平均） 4.52s
#83	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
合計テスト数 22 誤答テスト数 7 合計コスト $1.079 応答時間（平均） 9.93s
#53	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
合計テスト数 21 誤答テスト数 7 合計コスト $0.323 応答時間（平均） 23.0s
#106	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
合計テスト数 21 誤答テスト数 7 合計コスト $0.018 応答時間（平均） 16.3s
#139	Gemini 3 PRO Preview medium	Google	3	6.0	$0.385	14/21	9.05s
合計テスト数 21 誤答テスト数 7 合計コスト $0.385 応答時間（平均） 9.05s
#24	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
合計テスト数 22 誤答テスト数 8 合計コスト $0.951 応答時間（平均） 22.6s
#31	Gemini 3.5 Flash-Lite high	Google	6	8.1	$0.584	14/22	9.48s
合計テスト数 22 誤答テスト数 8 合計コスト $0.584 応答時間（平均） 9.48s

不正解の失敗

モデルを絞り込む

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

不正解 の失敗

モデルを絞り込む

不正解 件数 上位モデル

不正解 件数 対 スコア

応答時間（平均） 上位モデル

不正解の失敗

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル