不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 応答時間(平均) ↓.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #261 | Granite 4.2 8B low | IBM Granite | 10 | 5.1 | $0.012 | 7/22 | 54.4s |
| #207 | GPT-5 Nano medium | OpenAI | 10 | 6.0 | $0.118 | 8/22 | 54.2s |
| #78 | Qwen3.7 Plus medium | Qwen | 5 | 7.9 | $0.277 | 15/22 | 53.5s |
| #33 | Muse Spark 1.3 high | Meta | 3 | 8.9 | $1.653 | 16/22 | 52.5s |
| #220 | Nemotron 3 Super medium | NVIDIA | 5 | 5.7 | $0.050 | 8/22 | 52.3s |
| #42 | GLM 5.3 Flash max | Z.ai | 2 | 8.7 | $0.059 | 16/22 | 52.1s |
| #277 | Ring-2.6-1T none | Inclusionai | 5 | 4.8 | $0.026 | 9/22 | 52.0s |
| #92 | DeepSeek V4 Flash 0423 high | DeepSeek | 6 | 7.6 | $0.042 | 13/22 | 51.8s |
| #155 | MiMo-V2.5-Pro medium | Xiaomi | 3 | 6.8 | $0.221 | 11/22 | 48.7s |
| #174 | Laguna XS 2.1 medium | Poolside | 10 | 6.5 | $0.068 | 9/22 | 48.2s |
| #85 | Seed-2.0-Lite medium | Bytedance Seed | 6 | 7.8 | $0.236 | 13/22 | 47.9s |
| #145 | Qwen3.7 Flash medium | Qwen | 8 | 6.9 | $0.065 | 10/22 | 47.4s |
| #127 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 8 | 7.2 | $0.323 | 13/22 | 47.0s |
| #181 | MiMo-V2.5 medium | Xiaomi | 5 | 6.4 | $0.104 | 11/22 | 46.3s |
| #257 | Granite 4.2 8B medium | IBM Granite | 9 | 5.2 | $0.009 | 7/22 | 46.0s |