不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 応答時間(平均) ↓.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #79 | Qwen3.6 Plus medium | Qwen | 5 | 7.8 | $0.418 | 15/22 | 45.5s |
| #148 | Qwen3.6 Flash medium | Qwen | 8 | 6.8 | $0.741 | 12/22 | 45.0s |
| #25 | Qwen3.7 Max medium | Qwen | 4 | 9.1 | $1.157 | 17/22 | 44.3s |
| #134 | Grok 4.3 medium | X AI | 6 | 7.0 | $0.741 | 12/22 | 44.2s |
| #267 | MiniMax M2.7 medium | Minimax | 6 | 5.0 | $0.208 | 5/22 | 43.2s |
| #87 | Qwen3.7 Flash high | Qwen | 7 | 7.8 | $0.052 | 13/22 | 41.4s |
| #212 | Mimo V2 Omni medium | Xiaomi | 5 | 5.9 | $0.683 | 10/21 | 41.2s |
| #288 | Cobuddy medium | Baidu | 9 | 4.7 | $0.000 | 7/21 | 39.9s |
| #276 | Hy4 preview none | Tencent | 9 | 4.8 | $0.041 | 3/22 | 39.2s |
| #77 | Qwen3.8 27B low | Qwen | 4 | 7.9 | ~$0.071 | 15/22 | 39.1s |
| #318 | Step 3.5 Flash none | Stepfun | 1 | 2.3 | $0.020 | 6/12 | 39.0s |
| #28 | GPT-5.5 medium | OpenAI | 4 | 9.0 | $4.163 | 18/22 | 39.0s |
| #37 | Muse Spark 1.3 medium | Meta | 4 | 8.8 | $1.469 | 17/22 | 38.6s |
| #128 | Qwen3.7 Flash low | Qwen | 7 | 7.2 | $0.043 | 11/22 | 38.0s |
| #68 | Muse Spark 1.1 high | Meta | 3 | 8.0 | $2.253 | 12/22 | 36.9s |