不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 正解テスト ↑.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #200 | Qwen3.5 Plus 2026-04-20 none | Qwen | 12 | 6.1 | $0.122 | 8/22 | 13.1s |
| #201 | Nemotron 3 Ultra none | NVIDIA | 11 | 6.1 | $0.093 | 8/22 | 3.88s |
| #202 | Trinity Large Thinking low | Arcee AI | 7 | 6.0 | $0.625 | 8/22 | 96.6s |
| #203 | Gemini 2.5 Flash none | 13 | 6.0 | $0.017 | 8/22 | 6.19s | |
| #205 | GPT-5.6 Terra none | OpenAI | 11 | 6.0 | $0.280 | 8/22 | 1.66s |
| #207 | GPT-5 Nano medium | OpenAI | 10 | 6.0 | $0.118 | 8/22 | 54.2s |
| #211 | Dots 3 Note Preview medium | Dots Studio | 9 | 5.9 | $0.000 | 8/22 | 67.1s |
| #219 | North Mini Code medium | Cohere | 9 | 5.7 | $0.000 | 8/22 | 142.0s |
| #220 | Nemotron 3 Super medium | NVIDIA | 5 | 5.7 | $0.050 | 8/22 | 52.3s |
| #224 | GLM 5.1 none | Z.ai | 12 | 5.7 | $0.164 | 8/22 | 6.74s |
| #234 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10 | 5.6 | $0.048 | 8/22 | 8.65s |
| #308 | Grok Build 0.1 none | X AI | 7 | 4.0 | $0.547 | 7/19 | 28.7s |
| #229 | GLM 5V Turbo none | Z.ai | 11 | 5.6 | $0.052 | 8/21 | 2.99s |
| #230 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #240 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |