不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 正解テスト ↑.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #242 | Laguna S 2.1 medium | Poolside | 13 | 5.4 | $0.053 | 4/22 | 58.4s |
| #247 | DeepSeek V4 Flash 0731 none | DeepSeek | 13 | 5.4 | $0.021 | 4/22 | 20.7s |
| #248 | Laguna S 2.1 high | Poolside | 11 | 5.4 | $0.114 | 4/22 | 111.6s |
| #252 | Ling-2.6-1T none | Inclusionai | 12 | 5.3 | $0.016 | 4/22 | 8.59s |
| #254 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.051 | 4/22 | 5.57s |
| #264 | Qwen3.5-9B none | Qwen | 14 | 5.1 | $0.021 | 4/22 | 19.2s |
| #266 | North Mini Code none | Cohere | 12 | 5.1 | $0.000 | 4/22 | 29.9s |
| #273 | Mercury 2.5 Preview none | Inception | 16 | 4.9 | $0.018 | 4/22 | 3.51s |
| #279 | GPT-5.4 Nano none | OpenAI | 15 | 4.8 | $0.041 | 4/22 | 2.56s |
| #289 | Mercury 2 none | Inception | 17 | 4.7 | $0.030 | 4/22 | 825ms |
| #290 | Granite 4.2 8B high | IBM Granite | 6 | 4.6 | $0.084 | 4/22 | 235.9s |
| #297 | GLM 4.7 Flash medium | Z.ai | 9 | 4.3 | $0.168 | 4/22 | 134.3s |
| #309 | Ling 3.0 Tiny high | Inclusionai | 6 | 3.8 | $0.000 | 4/22 | 75.7s |
| #310 | Ling 3.0 Tiny low | Inclusionai | 5 | 3.8 | $0.000 | 4/22 | 66.2s |
| #313 | Ling 3.0 Tiny medium | Inclusionai | 5 | 3.8 | $0.000 | 4/22 | 68.1s |