コーディング x 不正解ランキング

AI BENCHY カテゴリ別失敗

コーディングで不正解が起きやすいAIモデルを確認し、弱点を早く見つけられます。

表示モデル数

総失敗数

230

最も影響を受けたモデル

Qwen3.6 Flash 3

失敗理由

不正解230 API エラー43 タイムアウト25 回答なし18 指示に従っていない16 余分な書式12

カテゴリ

ドメイン特化368 反AIトリック270 コーディング230 パズル解決173 雑学150 複合58 指示追従56 汎用知能49 データ解析と抽出36 ツール呼び出し3

134/134

順位	モデル	企業	不正解件数	カテゴリスコア	合計コスト	正解テスト	応答時間（平均）
#60	Qwen3.6 Flash medium	Qwen	3	5.0	$0.288	0/3	42.9s
合計テスト数 3 誤答テスト数 3 合計コスト $0.288 応答時間（平均） 42.9s
#116	Qwen3.6 Max Preview none	Qwen	3	3.8	$0.075	0/3	3.12s
合計テスト数 3 誤答テスト数 3 合計コスト $0.075 応答時間（平均） 3.12s
#118	GLM 5 none	Z.ai	3	4.0	$0.027	0/3	5.12s
合計テスト数 3 誤答テスト数 3 合計コスト $0.027 応答時間（平均） 5.12s
#123	Qwen3.5 Plus 2026-02-15 none	Qwen	3	4.3	$0.016	0/3	2.05s
合計テスト数 3 誤答テスト数 3 合計コスト $0.016 応答時間（平均） 2.05s
#124	North Mini Code medium	Cohere	3	4.5	$0.000	0/3	320.4s
合計テスト数 3 誤答テスト数 3 合計コスト $0.000 応答時間（平均） 320.4s
#132	Claude Sonnet 5 none	Anthropic	3	4.6	$0.287	0/3	3.67s
合計テスト数 3 誤答テスト数 3 合計コスト $0.287 応答時間（平均） 3.67s
#134	GLM 5.1 none	Z.ai	3	3.9	$0.057	0/3	4.96s
合計テスト数 3 誤答テスト数 3 合計コスト $0.057 応答時間（平均） 4.96s
#135	DeepSeek V4 Flash none	DeepSeek	3	4.2	$0.007	0/3	17.1s
合計テスト数 3 誤答テスト数 3 合計コスト $0.007 応答時間（平均） 17.1s
#141	GLM 5 Turbo none	Z.ai	3	3.9	$0.047	0/3	2.41s
合計テスト数 3 誤答テスト数 3 合計コスト $0.047 応答時間（平均） 2.41s
#142	Laguna XS 2.1 none	Poolside	3	4.3	$0.003	0/3	623ms
合計テスト数 3 誤答テスト数 3 合計コスト $0.003 応答時間（平均） 623ms
#143	GPT-5.6 Luna none	OpenAI	3	3.8	$0.047	0/3	980ms
合計テスト数 3 誤答テスト数 3 合計コスト $0.047 応答時間（平均） 980ms
#145	Qwen3.5-122B-A10B none	Qwen	3	3.7	$0.020	0/3	2.77s
合計テスト数 3 誤答テスト数 3 合計コスト $0.020 応答時間（平均） 2.77s
#149	Mistral Small 4 none	Mistral	3	3.7	$0.007	0/3	901ms
合計テスト数 3 誤答テスト数 3 合計コスト $0.007 応答時間（平均） 901ms
#150	Qwen3 Coder Next none	Qwen	3	4.6	$0.009	0/3	2.22s
合計テスト数 3 誤答テスト数 3 合計コスト $0.009 応答時間（平均） 2.22s
#151	North Mini Code none	Cohere	3	3.9	$0.000	0/3	22.0s
合計テスト数 3 誤答テスト数 3 合計コスト $0.000 応答時間（平均） 22.0s

モデルを絞り込む

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

推定無駄コスト上位モデル

コーディング: 不正解

モデルを絞り込む

不正解 件数 上位モデル

不正解 件数 対 スコア

応答時間（平均） 上位モデル

推定無駄コスト 上位モデル

不正解件数上位モデル

不正解件数対スコア

応答時間（平均）上位モデル

推定無駄コスト上位モデル