コーディングモデルランキング

AI BENCHY カテゴリ

コーディングでどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。並び替え: 正解テスト ↑.

表示モデル数

平均コーディングスコア

5.7

最良モデル

Qwen3.6 Flash 5.0

失敗理由

失敗理由不正解で230 失敗理由 API エラーで43 失敗理由タイムアウトで25 失敗理由回答なしで18 失敗理由指示に従っていないで16 失敗理由余分な書式で12

189/189

順位	モデル	企業	コーディングスコア	スコア	合計コスト	正解テスト	応答時間（平均）
#60	Qwen3.6 Flash medium	Qwen	5.0	7.5	$0.288	0/3	42.9s
合計テスト数 3 誤答テスト数 3 合計コスト $0.288 応答時間（平均） 42.9s
#72	Gemma 4 26B A4B medium	Google	2.9	7.2	$0.045	0/3	272.5s
合計テスト数 3 誤答テスト数 3 合計コスト $0.045 応答時間（平均） 272.5s
#74	GLM 5.2 none	Z.ai	3.7	7.1	$0.042	0/3	7.55s
合計テスト数 3 誤答テスト数 3 合計コスト $0.042 応答時間（平均） 7.55s
#76	Step 3.7 Flash high	Stepfun	4.0	7.1	$1.148	0/3	206.2s
合計テスト数 3 誤答テスト数 3 合計コスト $1.148 応答時間（平均） 206.2s
#77	GLM 5.1 medium	Z.ai	4.6	7.1	$0.288	0/3	109.6s
合計テスト数 3 誤答テスト数 3 合計コスト $0.288 応答時間（平均） 109.6s
#84	Qwen3.5-Flash medium	Qwen	3.7	6.8	$0.080	0/3	58.9s
合計テスト数 3 誤答テスト数 3 合計コスト $0.080 応答時間（平均） 58.9s
#87	Mimo V2 Omni medium	Xiaomi	3.3	6.8	$0.683	0/3	183.9s
合計テスト数 3 誤答テスト数 3 合計コスト $0.683 応答時間（平均） 183.9s
#94	Step 3.5 Flash medium	Stepfun	2.4	6.6	$0.070	0/2	258.4s
合計テスト数 2 誤答テスト数 2 合計コスト $0.070 応答時間（平均） 258.4s
#101	Nemotron 3 Super medium	NVIDIA	3.1	6.3	$0.020	0/3	147.3s
合計テスト数 3 誤答テスト数 3 合計コスト $0.020 応答時間（平均） 147.3s
#103	Gemma 4 31B medium	Google	4.3	6.3	$0.033	0/3	219.8s
合計テスト数 3 誤答テスト数 3 合計コスト $0.033 応答時間（平均） 219.8s
#106	Gemini 3 PRO Preview medium	Google	3.0	6.2	$0.385	0/3	0ms
合計テスト数 3 誤答テスト数 3 合計コスト $0.385 応答時間（平均） 0ms
#111	Gemini 3.1 Flash Lite Preview high	Google	0.0	6.1	$2.310	0/0	0ms
合計テスト数 0 誤答テスト数 0 合計コスト $2.310 応答時間（平均） 0ms
#116	Qwen3.6 Max Preview none	Qwen	3.8	6.0	$0.075	0/3	3.12s
合計テスト数 3 誤答テスト数 3 合計コスト $0.075 応答時間（平均） 3.12s
#118	GLM 5 none	Z.ai	4.0	6.0	$0.027	0/3	5.12s
合計テスト数 3 誤答テスト数 3 合計コスト $0.027 応答時間（平均） 5.12s
#123	Qwen3.5 Plus 2026-02-15 none	Qwen	4.3	5.8	$0.016	0/3	2.05s
合計テスト数 3 誤答テスト数 3 合計コスト $0.016 応答時間（平均） 2.05s

コーディングランキング

モデルを絞り込む

コーディングスコア上位モデル

コーディングスコア vs 合計コスト

応答時間（平均）上位モデル

コーディング ランキング

モデルを絞り込む

コーディング スコア 上位モデル

コーディング スコア vs 合計コスト

応答時間（平均） 上位モデル

コーディングランキング

コーディングスコア上位モデル

コーディングスコア vs 合計コスト

応答時間（平均）上位モデル