不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 失敗数 ↑.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #76 | Step 3.7 Flash medium | Stepfun | 6 | 7.9 | $0.495 | 13/22 | 23.5s |
| #80 | Gemini 3.5 Flash Lite medium | 6 | 7.8 | $0.272 | 14/22 | 5.12s | |
| #85 | Seed-2.0-Lite medium | Bytedance Seed | 6 | 7.8 | $0.236 | 13/22 | 47.9s |
| #89 | Seed-2.0-Code low | Bytedance Seed | 6 | 7.7 | $0.767 | 13/22 | 72.2s |
| #92 | DeepSeek V4 Flash 0423 high | DeepSeek | 6 | 7.6 | $0.042 | 13/22 | 51.8s |
| #97 | Claude Opus 5 none | Anthropic | 6 | 7.5 | $1.550 | 12/22 | 7.65s |
| #101 | GPT 5.3 Chat none | OpenAI | 6 | 7.5 | $0.533 | 13/22 | 6.56s |
| #105 | GPT-5.4 Mini medium | OpenAI | 6 | 7.5 | $0.786 | 12/22 | 26.7s |
| #106 | Grok Build 0.1 medium | X AI | 6 | 7.5 | $1.130 | 13/22 | 54.5s |
| #108 | Gemini 3.1 Flash Lite Preview medium | 6 | 7.4 | $0.117 | 14/22 | 4.59s | |
| #110 | Kimi K2.7 Code medium | Moonshot AI | 6 | 7.4 | $0.687 | 11/22 | 80.1s |
| #115 | Gemini 3 Flash Preview low | 6 | 7.4 | $0.185 | 16/22 | 6.51s | |
| #117 | GLM 5.3 high | Z.ai | 6 | 7.3 | $0.403 | 13/22 | 27.8s |
| #131 | Muse Glimmer 30B low | Meta | 6 | 7.1 | $0.143 | 11/22 | 18.6s |
| #134 | Grok 4.3 medium | X AI | 6 | 7.0 | $0.741 | 12/22 | 44.2s |