गलत उत्तर विफलताएँ
देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें।
309/309
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #63 | GLM 5.2 high | Z.ai | 2 | 8.0 | $1.188 | 14/22 | 69.9s |
| #149 | Gemma 4 26B A4B medium | 2 | 6.8 | $0.092 | 15/22 | 104.9s | |
| #183 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.1 | $1.140 | 11/22 | 110.8s |
| #245 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #264 | Qwen3.6 Plus Preview medium | Qwen | 2 | 4.9 | $0.000 | 9/19 | 15.2s |
| #304 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.062 | 3/22 | 107.5s |
| #1 | Gemini 3.6 Flash high | 1 | 9.9 | $0.699 | 21/22 | 16.8s | |
| #39 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.004 | 17/22 | 15.0s |
| #310 | Step 3.5 Flash none | Stepfun | 1 | 2.3 | $0.020 | 6/12 | 39.0s |