コーディング x 不正解ランキング

AI BENCHY カテゴリ別失敗

コーディングで不正解が起きやすいAIモデルを確認し、弱点を早く見つけられます。並び替え: 正解テスト ↑.

表示モデル数

総失敗数

230

最も影響を受けたモデル

Qwen3.6 Flash 3

失敗理由

不正解230 API エラー43 タイムアウト25 回答なし18 指示に従っていない16 余分な書式12

カテゴリ

ドメイン特化368 反AIトリック270 コーディング230 パズル解決173 雑学150 複合58 指示追従56 汎用知能49 データ解析と抽出36 ツール呼び出し3

134/134

順位	モデル	企業	不正解件数	カテゴリスコア	合計コスト	正解テスト	応答時間（平均）
#60	Qwen3.6 Flash medium	Qwen	3	5.0	$0.288	0/3	42.9s
合計テスト数 3 誤答テスト数 3 合計コスト $0.288 応答時間（平均） 42.9s
#74	GLM 5.2 none	Z.ai	2	3.7	$0.042	0/3	7.55s
合計テスト数 3 誤答テスト数 3 合計コスト $0.042 応答時間（平均） 7.55s
#76	Step 3.7 Flash high	Stepfun	1	4.0	$1.148	0/3	206.2s
合計テスト数 3 誤答テスト数 3 合計コスト $1.148 応答時間（平均） 206.2s
#84	Qwen3.5-Flash medium	Qwen	2	3.7	$0.080	0/3	58.9s
合計テスト数 3 誤答テスト数 3 合計コスト $0.080 応答時間（平均） 58.9s
#87	Mimo V2 Omni medium	Xiaomi	1	3.3	$0.683	0/3	183.9s
合計テスト数 3 誤答テスト数 3 合計コスト $0.683 応答時間（平均） 183.9s
#116	Qwen3.6 Max Preview none	Qwen	3	3.8	$0.075	0/3	3.12s
合計テスト数 3 誤答テスト数 3 合計コスト $0.075 応答時間（平均） 3.12s
#118	GLM 5 none	Z.ai	3	4.0	$0.027	0/3	5.12s
合計テスト数 3 誤答テスト数 3 合計コスト $0.027 応答時間（平均） 5.12s
#123	Qwen3.5 Plus 2026-02-15 none	Qwen	3	4.3	$0.016	0/3	2.05s
合計テスト数 3 誤答テスト数 3 合計コスト $0.016 応答時間（平均） 2.05s
#124	North Mini Code medium	Cohere	3	4.5	$0.000	0/3	320.4s
合計テスト数 3 誤答テスト数 3 合計コスト $0.000 応答時間（平均） 320.4s
#131	Mimo V2 Omni none	Xiaomi	1	4.4	$0.021	0/3	2.75s
合計テスト数 3 誤答テスト数 3 合計コスト $0.021 応答時間（平均） 2.75s
#132	Claude Sonnet 5 none	Anthropic	3	4.6	$0.287	0/3	3.67s
合計テスト数 3 誤答テスト数 3 合計コスト $0.287 応答時間（平均） 3.67s
#134	GLM 5.1 none	Z.ai	3	3.9	$0.057	0/3	4.96s
合計テスト数 3 誤答テスト数 3 合計コスト $0.057 応答時間（平均） 4.96s
#135	DeepSeek V4 Flash none	DeepSeek	3	4.2	$0.007	0/3	17.1s
合計テスト数 3 誤答テスト数 3 合計コスト $0.007 応答時間（平均） 17.1s
#137	MiMo-V2.5-Pro none	Xiaomi	2	4.3	$0.017	0/3	1.41s
合計テスト数 3 誤答テスト数 3 合計コスト $0.017 応答時間（平均） 1.41s
#139	Gemma 4 26B A4B none	Google	2	3.7	$0.004	0/3	4.16s
合計テスト数 3 誤答テスト数 3 合計コスト $0.004 応答時間（平均） 4.16s

モデルを絞り込む

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

推定無駄コスト上位モデル

コーディング: 不正解

モデルを絞り込む

不正解 件数 上位モデル

不正解 件数 対 スコア

応答時間（平均） 上位モデル

推定無駄コスト 上位モデル

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

推定無駄コスト上位モデル