不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 合計コスト ↑.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #30 | Grok 4.5 high | X AI | 2 | 9.0 | $2.252 | 17/22 | 72.3s |
| #68 | Muse Spark 1.1 high | Meta | 3 | 8.0 | $2.253 | 12/22 | 36.9s |
| #253 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #113 | Qwen3.8 2.4T A95B high | Qwen | 3 | 7.4 | $2.357 | 14/22 | 120.6s |
| #144 | Claude Fable 5.1 low | Anthropic | 4 | 6.9 | $2.565 | 11/22 | 10.3s |
| #64 | Qwen3.8 2.4T A95B low | Qwen | 4 | 8.1 | $2.672 | 15/22 | 119.0s |
| #31 | Qwen3.8 Max (0902) high | Qwen | 2 | 8.9 | $2.736 | 17/22 | 185.6s |
| #60 | Claude Fable 5.1 medium | Anthropic | 3 | 8.3 | $2.909 | 15/22 | 11.7s |
| #90 | Claude Opus 4.6 medium | Anthropic | 4 | 7.7 | $2.961 | 13/22 | 32.2s |
| #47 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.004 | 17/22 | 15.0s |
| #20 | Claude Opus 5 high | Anthropic | 2 | 9.2 | $3.070 | 18/22 | 22.5s |
| #26 | Claude Fable 5.1 high | Anthropic | 3 | 9.0 | $3.364 | 19/22 | 13.6s |
| #4 | GPT-6 Astra high | OpenAI | 1 | 9.9 | $3.474 | 21/22 | 18.6s |
| #28 | GPT-5.5 medium | OpenAI | 4 | 9.0 | $4.163 | 18/22 | 39.0s |
| #5 | GPT-6 Astra xhigh | OpenAI | 1 | 9.9 | $5.156 | 21/22 | 28.4s |