不正解失敗ランキング

どのAIモデルで不正解が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。

表示モデル数

総失敗数

1585

最も影響を受けたモデル

カテゴリ

ドメイン特化カテゴリで421 反AIトリックカテゴリで293 コーディングカテゴリで259 パズル解決カテゴリで204 雑学カテゴリで172 複合カテゴリで69 汎用知能カテゴリで62 指示追従カテゴリで61 データ解析と抽出カテゴリで41 ツール呼び出しカテゴリで3

215/215

順位	モデル	企業	不正解件数	スコア	合計コスト	正解テスト	応答時間（平均）
#93	Gemini 3 Flash Preview none	Google	8	6.8	$0.085	13/22	2.95s
合計テスト数 22 誤答テスト数 9 合計コスト $0.085 応答時間（平均） 2.95s
#96	LongCat 2.0 low	Meituan	8	6.7	$0.391	10/22	100.3s
合計テスト数 22 誤答テスト数 12 合計コスト $0.391 応答時間（平均） 100.3s
#101	GLM 5.2 none	Z.ai	8	6.6	$0.128	12/22	9.34s
合計テスト数 22 誤答テスト数 10 合計コスト $0.128 応答時間（平均） 9.34s
#126	Gemini 3.1 Flash Lite minimal	Google	8	6.1	$0.047	10/22	1.86s
合計テスト数 22 誤答テスト数 12 合計コスト $0.047 応答時間（平均） 1.86s
#129	Inkling low	Thinkingmachines	8	6.1	$0.187	10/22	5.15s
合計テスト数 22 誤答テスト数 12 合計コスト $0.187 応答時間（平均） 5.15s
#205	Hy3 preview none	Tencent	8	4.0	$0.003	4/21	12.9s
合計テスト数 21 誤答テスト数 17 合計コスト $0.003 応答時間（平均） 12.9s
#211	Laguna Xs.2 none	Poolside	8	3.8	$0.004	5/19	806ms
合計テスト数 19 誤答テスト数 14 合計コスト $0.004 応答時間（平均） 806ms
#212	gpt-oss-120b none	OpenAI	8	3.7	$0.010	6/19	21.6s
合計テスト数 19 誤答テスト数 13 合計コスト $0.010 応答時間（平均） 21.6s
#38	GPT-5.6 Terra high	OpenAI	7	8.0	$1.055	14/22	11.3s
合計テスト数 22 誤答テスト数 8 合計コスト $1.055 応答時間（平均） 11.3s
#48	GPT-5.6 Luna high	OpenAI	7	7.7	$1.017	15/22	18.7s
合計テスト数 22 誤答テスト数 7 合計コスト $1.017 応答時間（平均） 18.7s
#55	Nemotron 3 Ultra medium	NVIDIA	7	7.5	$0.774	13/22	32.2s
合計テスト数 22 誤答テスト数 9 合計コスト $0.774 応答時間（平均） 32.2s
#58	GPT-5.3 Chat none	OpenAI	7	7.5	$0.571	13/22	6.88s
合計テスト数 22 誤答テスト数 9 合計コスト $0.571 応答時間（平均） 6.88s
#63	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
合計テスト数 22 誤答テスト数 7 合計コスト $0.197 応答時間（平均） 4.52s
#64	LongCat 2.0 medium	Meituan	7	7.4	$0.478	12/22	136.6s
合計テスト数 22 誤答テスト数 10 合計コスト $0.478 応答時間（平均） 136.6s
#68	Gemini 3.1 Flash Lite Preview medium	Google	7	7.3	$0.115	13/22	4.61s
合計テスト数 22 誤答テスト数 9 合計コスト $0.115 応答時間（平均） 4.61s

不正解の失敗

モデルを絞り込む

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

不正解 の失敗

モデルを絞り込む

不正解 件数 上位モデル

不正解 件数 対 スコア

応答時間（平均） 上位モデル

不正解の失敗

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル