不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 失敗数 ↑.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #297 | GLM 4.7 Flash medium | Z.ai | 9 | 4.3 | $0.168 | 4/22 | 134.3s |
| #298 | Elephant Alpha medium | Openrouter | 9 | 4.3 | $0.000 | 6/21 | 1.27s |
| #300 | Hunter Alpha none | OpenRouter | 9 | 4.2 | $0.000 | 6/18 | 4.70s |
| #317 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 9 | 3.2 | $0.000 | 2/19 | 728ms |
| #319 | LFM2-24B-A2B none | Liquid | 9 | 2.2 | $0.001 | 2/16 | 782ms |
| #118 | KAT-Coder-Pro V2.5 low | Kwaipilot | 10 | 7.3 | $0.400 | 11/22 | 20.2s |
| #125 | KAT-Coder-Pro V2.5 high | Kwaipilot | 10 | 7.2 | $0.506 | 11/22 | 22.1s |
| #138 | GPT-5.5 none | OpenAI | 10 | 7.0 | $0.544 | 12/22 | 2.35s |
| #159 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10 | 6.7 | $0.487 | 11/22 | 26.0s |
| #174 | Laguna XS 2.1 medium | Poolside | 10 | 6.5 | $0.068 | 9/22 | 48.2s |
| #188 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.051 | 10/22 | 5.20s |
| #199 | Gemma 4 31B none | 10 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #207 | GPT-5 Nano medium | OpenAI | 10 | 6.0 | $0.118 | 8/22 | 54.2s |
| #230 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #233 | Owl Alpha none | Openrouter | 10 | 5.6 | $0.000 | 7/21 | 9.88s |