不正解 の失敗
どのAIモデルで 不正解 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 不正解 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #169 | Gemini 3.1 Flash Lite low | 8 | 6.6 | $0.621 | 13/22 | 16.2s | |
| #179 | Dots 3 Note Preview high | Dots Studio | 8 | 6.4 | $0.000 | 10/22 | 67.8s |
| #189 | Claude Sonnet 5 none | Anthropic | 8 | 6.1 | $0.548 | 7/22 | 6.05s |
| #190 | Gemini 3.1 Flash Lite minimal | 8 | 6.1 | $0.047 | 10/22 | 1.85s | |
| #196 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.11s |
| #197 | Trinity Large Thinking medium | Arcee AI | 8 | 6.1 | $0.756 | 8/22 | 85.4s |
| #214 | GLM 5.3 Flash low | Z.ai | 8 | 5.9 | $0.015 | 10/22 | 9.65s |
| #270 | DeepSeek V3.2 none | DeepSeek | 8 | 5.0 | $0.054 | 6/22 | 17.9s |
| #303 | Hy3 preview none | Tencent | 8 | 4.0 | $0.007 | 4/21 | 12.9s |
| #314 | Laguna Xs.2 none | Poolside | 8 | 3.8 | $0.004 | 5/19 | 806ms |
| #315 | gpt-oss-120b none | OpenAI | 8 | 3.7 | $0.010 | 6/19 | 21.6s |
| #69 | DeepSeek V4 Flash 0731 low | DeepSeek | 7 | 8.0 | $0.072 | 13/22 | 77.6s |
| #73 | GPT-5.6 Terra high | OpenAI | 7 | 8.0 | $0.836 | 14/22 | 11.2s |
| #87 | Qwen3.7 Flash high | Qwen | 7 | 7.8 | $0.052 | 13/22 | 41.4s |
| #91 | DeepSeek V4 Pro high | DeepSeek | 7 | 7.7 | $0.454 | 10/22 | 92.5s |