不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #199 | Gemma 4 31B none | 10 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #207 | GPT-5 Nano medium | OpenAI | 10 | 6.0 | $0.118 | 8/22 | 54.2s |
| #230 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #233 | Owl Alpha none | Openrouter | 10 | 5.6 | $0.000 | 7/21 | 9.88s |
| #234 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10 | 5.6 | $0.048 | 8/22 | 8.65s |
| #240 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |
| #261 | Granite 4.2 8B low | IBM Granite | 10 | 5.1 | $0.012 | 7/22 | 54.4s |
| #280 | Trinity Large Thinking high | Arcee AI | 10 | 4.8 | $0.592 | 5/22 | 75.9s |
| #294 | Grok 4.20 Beta none | X AI | 10 | 4.4 | $0.087 | 6/18 | 1.19s |
| #295 | Laguna M.1 none | Poolside | 10 | 4.4 | $0.009 | 4/19 | 2.89s |
| #301 | Grok 4.20 none | X AI | 10 | 4.1 | $0.057 | 6/18 | 1.11s |
| #111 | GPT-5.6 Luna medium | OpenAI | 9 | 7.4 | $0.072 | 13/22 | 7.43s |
| #121 | Qwen3.7 Plus none | Qwen | 9 | 7.3 | $0.106 | 12/22 | 12.1s |
| #129 | Muse Glimmer 30B medium | Meta | 9 | 7.2 | $0.211 | 11/22 | 30.6s |
| #132 | Step 3.7 Flash low | Stepfun | 9 | 7.1 | $0.390 | 11/22 | 17.9s |