不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 正解テスト ↓.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #26 | Claude Fable 5.1 high | Anthropic | 3 | 9.0 | $3.364 | 19/22 | 13.6s |
| #164 | Claude Opus 4.7 none | Anthropic | 3 | 6.6 | $0.505 | 16/19 | 3.02s |
| #8 | GPT-5.6 Sol low | OpenAI | 4 | 9.5 | $0.357 | 18/22 | 9.04s |
| #13 | GPT-5.6 Sol medium | OpenAI | 4 | 9.4 | $0.508 | 18/22 | 12.6s |
| #15 | GPT-5.6 Sol high | OpenAI | 4 | 9.4 | $0.446 | 18/22 | 11.5s |
| #20 | Claude Opus 5 high | Anthropic | 2 | 9.2 | $3.070 | 18/22 | 22.5s |
| #21 | Claude Opus 5 medium | Anthropic | 3 | 9.2 | $1.586 | 18/22 | 10.3s |
| #23 | Qwen3.8 Max (0902) low | Qwen | 4 | 9.1 | $0.664 | 18/22 | 24.2s |
| #27 | Gemini 3.5 Flash medium | 3 | 9.0 | $0.665 | 18/22 | 8.48s | |
| #28 | GPT-5.5 medium | OpenAI | 4 | 9.0 | $4.163 | 18/22 | 39.0s |
| #35 | Gemini 3.5 Flash low | 3 | 8.8 | $0.449 | 18/22 | 5.76s | |
| #40 | Claude Opus 5 low | Anthropic | 4 | 8.7 | $1.121 | 18/22 | 6.99s |
| #41 | Gemini 3.6 Flash low | 4 | 8.7 | $0.251 | 18/22 | 4.92s | |
| #43 | Claude Opus 4.7 medium | Anthropic | 3 | 8.7 | $1.476 | 18/22 | 7.62s |
| #253 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s |