不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #244 | GPT-5.6 Luna none | OpenAI | 14 | 5.4 | $0.029 | 6/22 | 1.50s |
| #250 | Laguna XS 2.1 none | Poolside | 14 | 5.3 | $0.008 | 5/22 | 1.55s |
| #262 | Qwen3 Coder Next none | Qwen | 14 | 5.1 | $0.026 | 5/22 | 8.63s |
| #263 | MiMo-V2.5 none | Xiaomi | 14 | 5.1 | $0.025 | 5/22 | 4.68s |
| #264 | Qwen3.5-9B none | Qwen | 14 | 5.1 | $0.021 | 4/22 | 19.2s |
| #278 | Nemotron 3.5 Lightning low | NVIDIA | 14 | 4.8 | $0.140 | 5/22 | 59.8s |
| #283 | GLM 4.7 Flash none | Z.ai | 14 | 4.8 | $0.016 | 5/22 | 8.81s |
| #291 | Qwen3 Coder Next medium | Qwen | 14 | 4.6 | $0.034 | 3/22 | 9.07s |
| #180 | LongCat 2.0 none | Meituan | 13 | 6.4 | $0.044 | 8/22 | 5.17s |
| #186 | Seed-2.0-Lite none | Bytedance Seed | 13 | 6.2 | $0.066 | 8/22 | 4.37s |
| #193 | Qwen3.7 Flash none | Qwen | 13 | 6.1 | $0.019 | 7/22 | 10.1s |
| #203 | Gemini 2.5 Flash none | 13 | 6.0 | $0.017 | 8/22 | 6.19s | |
| #209 | Qwen3.5-35B-A3B none | Qwen | 13 | 5.9 | $0.151 | 6/22 | 12.7s |
| #215 | GPT-5.4 Mini none | OpenAI | 13 | 5.9 | $0.095 | 6/22 | 1.58s |
| #223 | Ling-3.0-flash none | Inclusionai | 13 | 5.7 | $0.004 | 6/22 | 3.56s |