不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 正解テスト ↓.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #214 | GLM 5.3 Flash low | Z.ai | 8 | 5.9 | $0.015 | 10/22 | 9.65s |
| #216 | Seed 2.1 Turbo none | Bytedance Seed | 11 | 5.9 | $0.092 | 10/22 | 6.84s |
| #281 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 4.8 | $5.599 | 8/18 | 9.69s |
| #285 | Hunter Alpha medium | OpenRouter | 4 | 4.7 | $0.000 | 8/18 | 10.3s |
| #221 | GLM 5 none | Z.ai | 12 | 5.7 | $0.027 | 9/21 | 4.03s |
| #153 | DeepSeek V4 Pro none | DeepSeek | 9 | 6.8 | $0.210 | 9/22 | 11.7s |
| #163 | LongCat 2.0 high | Meituan | 7 | 6.7 | $0.492 | 9/22 | 153.3s |
| #166 | Qwen3.5-27B none | Qwen | 11 | 6.6 | $0.058 | 9/22 | 4.77s |
| #174 | Laguna XS 2.1 medium | Poolside | 10 | 6.5 | $0.068 | 9/22 | 48.2s |
| #192 | gpt-oss-120b medium | OpenAI | 9 | 6.1 | $0.020 | 9/22 | 20.8s |
| #194 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #199 | Gemma 4 31B none | 10 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #222 | Inkling Small low | Thinkingmachines | 9 | 5.7 | $0.055 | 9/22 | 2.07s |
| #231 | Gemma 4 26B A4B none | 9 | 5.6 | $0.015 | 9/22 | 7.58s | |
| #239 | Qwen3.8 27B none | Qwen | 11 | 5.5 | ~$0.006 | 9/22 | 3.12s |