反AIトリック x 不正解ランキング

反AIトリックで不正解が起きやすいAIモデルを確認し、弱点を早く見つけられます。

表示モデル数

総失敗数

293

最も影響を受けたモデル

Seed-2.0-Lite 4

失敗理由

不正解293 指示に従っていない33 余分な書式20 API エラー14 タイムアウト4 回答なし4

カテゴリ

ドメイン特化421 反AIトリック293 コーディング259 パズル解決204 雑学172 複合69 汎用知能62 指示追従61 データ解析と抽出41 ツール呼び出し3

140/140

順位	モデル	企業	不正解件数	カテゴリスコア	合計コスト	正解テスト	応答時間（平均）
#188	KAT-Coder-Air V2.5 none	Kwaipilot	3	5.3	$0.067	1/4	2.68s
合計テスト数 4 誤答テスト数 3 合計コスト $0.067 応答時間（平均） 2.68s
#193	Qwen3 Coder Next medium	Qwen	3	3.5	$0.032	0/4	8.64s
合計テスト数 4 誤答テスト数 4 合計コスト $0.032 応答時間（平均） 8.64s
#198	Laguna M.1 none	Poolside	3	3.4	$0.009	0/4	705ms
合計テスト数 4 誤答テスト数 4 合計コスト $0.009 応答時間（平均） 705ms
#203	Grok 4.20 none	X AI	3	4.8	$0.057	1/4	501ms
合計テスト数 4 誤答テスト数 3 合計コスト $0.057 応答時間（平均） 501ms
#209	Grok 4.1 Fast none	X AI	3	3.2	$0.008	0/4	1.07s
合計テスト数 4 誤答テスト数 4 合計コスト $0.008 応答時間（平均） 1.07s
#216	LFM2-24B-A2B none	Liquid	3	2.5	$0.001	0/3	471ms
合計テスト数 3 誤答テスト数 3 合計コスト $0.001 応答時間（平均） 471ms
#27	Muse Spark 1.1 low	Meta	2	7.9	$0.647	2/4	4.36s
合計テスト数 4 誤答テスト数 2 合計コスト $0.647 応答時間（平均） 4.36s
#50	DeepSeek V4 Pro high	DeepSeek	2	5.7	$0.200	1/4	25.7s
合計テスト数 4 誤答テスト数 3 合計コスト $0.200 応答時間（平均） 25.7s
#51	MiniMax M3 medium	Minimax	2	5.5	$0.286	1/4	14.9s
合計テスト数 4 誤答テスト数 3 合計コスト $0.286 応答時間（平均） 14.9s
#56	Kimi K2.7 Code medium	Moonshot AI	2	7.3	$0.740	2/4	11.6s
合計テスト数 4 誤答テスト数 2 合計コスト $0.740 応答時間（平均） 11.6s
#63	Qwen3.7 Max none	Qwen	2	6.5	$0.197	2/4	1.08s
合計テスト数 4 誤答テスト数 2 合計コスト $0.197 応答時間（平均） 1.08s
#66	KAT-Coder-Pro V2.5 low	Kwaipilot	2	6.9	$0.387	2/4	4.20s
合計テスト数 4 誤答テスト数 2 合計コスト $0.387 応答時間（平均） 4.20s
#73	KAT-Coder-Pro V2.5 high	Kwaipilot	2	7.0	$0.482	2/4	3.17s
合計テスト数 4 誤答テスト数 2 合計コスト $0.482 応答時間（平均） 3.17s
#75	Qwen3.7 Plus none	Qwen	2	6.5	$0.106	2/4	1.38s
合計テスト数 4 誤答テスト数 2 合計コスト $0.106 応答時間（平均） 1.38s
#86	DeepSeek V4 Pro none	DeepSeek	2	3.2	$0.096	0/4	4.02s
合計テスト数 4 誤答テスト数 4 合計コスト $0.096 応答時間（平均） 4.02s

モデルを絞り込む

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

推定無駄コスト上位モデル

反AIトリック: 不正解

モデルを絞り込む

不正解 件数 上位モデル

不正解 件数 対 スコア

応答時間（平均） 上位モデル

推定無駄コスト 上位モデル

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

推定無駄コスト上位モデル