不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #22 | Gemini 3.8 Flash medium | 2 | 9.1 | $0.653 | 19/22 | 14.5s | |
| #30 | Grok 4.5 high | X AI | 2 | 9.0 | $2.252 | 17/22 | 72.3s |
| #31 | Qwen3.8 Max (0902) high | Qwen | 2 | 8.9 | $2.736 | 17/22 | 185.6s |
| #42 | GLM 5.3 Flash max | Z.ai | 2 | 8.7 | $0.059 | 16/22 | 52.1s |
| #56 | Qwen3.8 27B high | Qwen | 2 | 8.4 | ~$0.287 | 16/22 | 167.9s |
| #71 | GLM 5.2 high | Z.ai | 2 | 8.0 | $1.188 | 14/22 | 69.9s |
| #157 | Gemma 4 26B A4B medium | 2 | 6.8 | $0.092 | 15/22 | 104.9s | |
| #191 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.1 | $1.148 | 11/22 | 110.8s |
| #253 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #272 | Qwen3.6 Plus Preview medium | Qwen | 2 | 4.9 | $0.000 | 9/19 | 15.2s |
| #312 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.062 | 3/22 | 107.5s |
| #1 | Gemini 3.6 Flash high | 1 | 9.9 | $0.699 | 21/22 | 16.8s | |
| #4 | GPT-6 Astra high | OpenAI | 1 | 9.9 | $3.474 | 21/22 | 18.6s |
| #5 | GPT-6 Astra xhigh | OpenAI | 1 | 9.9 | $5.156 | 21/22 | 28.4s |
| #47 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.004 | 17/22 | 15.0s |