AI BENCHY カテゴリ別失敗
複合: 不正解
複合
不正解
複合 で 不正解 が起きやすいAIモデルを確認し、弱点を早く見つけられます。
60/60
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | カテゴリスコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #41 | Grok 4.5 low | X AI | 1 | 3.0 | $0.760 | 0/1 | 8.16s |
| #68 | Gemini 3 Flash Preview low | 1 | 3.0 | $0.111 | 0/1 | 3.27s | |
| #82 | Kimi K2.7 Code medium | Moonshot AI | 1 | 4.7 | $0.581 | 0/1 | 34.8s |
| #84 | Gemini 3 Flash Preview none | 1 | 4.7 | $0.025 | 0/1 | 3.56s | |
| #85 | Qwen3.7 Max none | Qwen | 1 | 3.0 | $0.054 | 0/1 | 2.17s |
| #89 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 4.7 | $0.220 | 0/1 | 30.8s |
| #95 | Mimo V2 PRO medium | Xiaomi | 1 | 4.7 | $0.333 | 0/1 | 64.7s |
| #100 | Gemini 3.1 Flash Lite Preview low | 1 | 3.0 | $0.026 | 0/1 | 11.9s | |
| #102 | Gemini 3.1 Flash Lite Preview none | 1 | 3.0 | $0.018 | 0/1 | 3.20s | |
| #103 | Gemini 3.1 Flash Lite low | 1 | 3.0 | $0.028 | 0/1 | 4.48s | |
| #106 | GPT-5.6 Sol none | OpenAI | 1 | 3.0 | $0.225 | 0/1 | 3.93s |
| #109 | GPT-5.5 none | OpenAI | 1 | 3.0 | $0.231 | 0/1 | 5.56s |
| #111 | Gemini 3 PRO Preview medium | 1 | 3.0 | $0.385 | 0/1 | 10.4s | |
| #112 | Seed-2.0-Lite none | Bytedance Seed | 1 | 3.0 | $0.019 | 0/1 | 6.59s |
| #113 | GPT-5.6 Luna low | OpenAI | 1 | 2.8 | $0.141 | 0/1 | 7.99s |