不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 応答時間(平均) ↓.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #105 | GPT-5.4 Mini medium | OpenAI | 6 | 7.5 | $0.786 | 12/22 | 26.7s |
| #44 | Muse Spark 1.2 high | Meta | 4 | 8.7 | $1.771 | 14/22 | 26.6s |
| #46 | Muse Spark 1.1 medium | Meta | 4 | 8.6 | $1.420 | 15/22 | 26.2s |
| #159 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10 | 6.7 | $0.487 | 11/22 | 26.0s |
| #36 | Qwen3.8 Max (0902) medium | Qwen | 5 | 8.8 | $0.677 | 17/22 | 26.0s |
| #119 | GLM 5.3 Flash high | Z.ai | 4 | 7.3 | $0.029 | 13/22 | 25.4s |
| #208 | Qwen3.5-Flash none | Qwen | 14 | 6.0 | $0.073 | 7/22 | 25.3s |
| #143 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 9 | 6.9 | $0.478 | 11/22 | 24.9s |
| #238 | Hy3 preview low | Tencent | 4 | 5.5 | $0.042 | 10/21 | 24.6s |
| #23 | Qwen3.8 Max (0902) low | Qwen | 4 | 9.1 | $0.664 | 18/22 | 24.2s |
| #286 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #76 | Step 3.7 Flash medium | Stepfun | 6 | 7.9 | $0.495 | 13/22 | 23.5s |
| #29 | Qwen3.8 Max medium | Qwen | 4 | 9.0 | $0.771 | 17/22 | 23.3s |
| #81 | GLM 5.2 medium | Z.ai | 3 | 7.8 | $0.224 | 15/21 | 23.3s |
| #162 | GLM 5V Turbo medium | Z.ai | 7 | 6.7 | $0.457 | 11/21 | 23.1s |