गलत उत्तर विफलताएँ
देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #11 | Qwen3.7 Max medium | Qwen | 3 | 9.2 | $1.116 | 18/22 | 40.6s |
| #140 | Mimo V2 Omni medium | Xiaomi | 5 | 5.9 | $0.683 | 10/21 | 41.2s |
| #178 | MiniMax M2.7 medium | Minimax | 6 | 5.0 | $0.163 | 5/22 | 41.3s |
| #41 | Qwen3.6 Plus medium | Qwen | 5 | 7.8 | $0.405 | 15/22 | 43.1s |
| #89 | Qwen3.6 Flash medium | Qwen | 8 | 6.9 | $0.738 | 12/22 | 44.7s |
| #74 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 8 | 7.2 | $0.317 | 13/22 | 46.4s |
| #78 | GLM 5.1 medium | Z.ai | 4 | 7.1 | $0.535 | 13/22 | 46.8s |
| #77 | Grok 4.3 medium | X AI | 5 | 7.1 | $0.779 | 13/22 | 47.4s |
| #108 | Laguna XS 2.1 medium | Poolside | 11 | 6.5 | $0.068 | 9/22 | 47.9s |
| #39 | Seed-2.0-Lite medium | Bytedance Seed | 5 | 7.9 | $0.234 | 14/22 | 48.5s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 6 | 7.7 | $0.041 | 13/22 | 49.7s |
| #40 | Qwen3.7 Plus medium | Qwen | 5 | 7.9 | $0.267 | 15/22 | 51.5s |
| #146 | Nemotron 3 Super medium | NVIDIA | 5 | 5.7 | $0.055 | 8/22 | 52.0s |
| #52 | Grok Build 0.1 medium | X AI | 5 | 7.6 | $1.097 | 14/22 | 52.1s |
| #134 | GPT-5 Nano medium | OpenAI | 9 | 6.1 | $0.114 | 9/22 | 54.9s |