不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: スコア ↓.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #184 | Mimo V2 PRO medium | Xiaomi | 5 | 6.3 | $0.333 | 12/21 | 22.2s |
| #185 | MiMo-V2-Flash medium | Xiaomi | 5 | 6.3 | $0.043 | 12/21 | 20.1s |
| #186 | Seed-2.0-Lite none | Bytedance Seed | 13 | 6.2 | $0.066 | 8/22 | 4.37s |
| #187 | Gemma 4 31B medium | 3 | 6.2 | $0.100 | 13/22 | 78.6s | |
| #188 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.051 | 10/22 | 5.20s |
| #189 | Claude Sonnet 5 none | Anthropic | 8 | 6.1 | $0.548 | 7/22 | 6.05s |
| #190 | Gemini 3.1 Flash Lite minimal | 8 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #191 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.1 | $1.148 | 11/22 | 110.8s |
| #192 | gpt-oss-120b medium | OpenAI | 9 | 6.1 | $0.020 | 9/22 | 20.8s |
| #193 | Qwen3.7 Flash none | Qwen | 13 | 6.1 | $0.019 | 7/22 | 10.1s |
| #194 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #195 | Qwen3.5-Flash medium | Qwen | 5 | 6.1 | $0.142 | 11/22 | 84.4s |
| #196 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.11s |
| #197 | Trinity Large Thinking medium | Arcee AI | 8 | 6.1 | $0.756 | 8/22 | 85.4s |
| #198 | Qwen3.6 Flash none | Qwen | 12 | 6.1 | $0.062 | 7/22 | 3.73s |