AI BENCHY
Advertise here

AI BENCHY 失敗分析

不正解 の失敗

どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 失敗数 ↑.

表示モデル数

15

総失敗数

1204

最も影響を受けたモデル

Gemini 3 Flash Preview 1
順位 モデル 企業 不正解 件数 スコア 正解テスト 応答時間(平均)
#119 Cobuddy medium Baidu 9 5.6 7/21 39.9s
#136 Elephant Alpha medium Openrouter 9 5.1 6/21 1.27s
#137 Elephant Alpha none Openrouter 9 5.1 5/21 1.22s
#138 Ling-2.6-flash none Inclusionai 9 5.0 6/21 9.34s
#158 GLM 4.7 Flash medium Z.ai 9 4.4 4/21 35.1s
#160 LFM2-24B-A2B none Liquid 9 4.2 2/16 782ms
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 9 4.1 2/19 728ms
#74 Qwen3.6 Max Preview none Qwen 10 6.9 11/21 3.30s
#88 Qwen3.7 Plus none Qwen 10 6.4 10/21 2.85s
#101 Mimo V2 Omni none Xiaomi 10 6.0 8/21 2.44s
#102 Gemma 4 26B A4B none Google 10 6.0 8/21 5.91s
#106 Grok 4.20 Beta none X AI 10 5.8 6/18 1.19s
#111 Owl Alpha medium Openrouter 10 5.7 8/21 11.9s
#113 DeepSeek V4 Pro none DeepSeek 10 5.7 7/21 12.4s
#121 Owl Alpha none Openrouter 10 5.5 7/21 9.88s

不正解 件数 上位モデル

不正解 件数 対 スコア

応答時間(平均) 上位モデル