不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: 失敗数 ↑.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #165 | Gemini 3.5 Flash Lite low | 8 | 6.6 | $0.138 | 12/22 | 2.56s | |
| #169 | Gemini 3.1 Flash Lite low | 8 | 6.6 | $0.621 | 13/22 | 16.2s | |
| #179 | Dots 3 Note Preview high | Dots Studio | 8 | 6.4 | $0.000 | 10/22 | 67.8s |
| #189 | Claude Sonnet 5 none | Anthropic | 8 | 6.1 | $0.548 | 7/22 | 6.05s |
| #190 | Gemini 3.1 Flash Lite minimal | 8 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #196 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.11s |
| #197 | Trinity Large Thinking medium | Arcee AI | 8 | 6.1 | $0.756 | 8/22 | 85.4s |
| #214 | GLM 5.3 Flash low | Z.ai | 8 | 5.9 | $0.015 | 10/22 | 9.65s |
| #270 | DeepSeek V3.2 none | DeepSeek | 8 | 5.0 | $0.054 | 6/22 | 17.9s |
| #303 | Hy3 preview none | Tencent | 8 | 4.0 | $0.007 | 4/21 | 12.9s |
| #314 | Laguna Xs.2 none | Poolside | 8 | 3.8 | $0.004 | 5/19 | 806ms |
| #315 | gpt-oss-120b none | OpenAI | 8 | 3.7 | $0.010 | 6/19 | 21.6s |
| #111 | GPT-5.6 Luna medium | OpenAI | 9 | 7.4 | $0.072 | 13/22 | 7.43s |
| #121 | Qwen3.7 Plus none | Qwen | 9 | 7.3 | $0.106 | 12/22 | 12.1s |
| #129 | Muse Glimmer 30B medium | Meta | 9 | 7.2 | $0.211 | 11/22 | 30.6s |