गलत उत्तर विफलताएँ
देखें कि किन AI मॉडलों में गलत उत्तर सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: स्कोर ↑.
215/215
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #5 | GPT-5.6 Sol low | OpenAI | 4 | 9.5 | $0.971 | 18/22 | 8.79s |
| #4 | Gemini 3.5 Flash high | 1 | 9.5 | $1.976 | 20/22 | 15.1s | |
| #3 | Gemini 3 Flash Preview medium | 1 | 9.6 | $0.742 | 21/22 | 19.2s | |
| #2 | Gemini 3.6 Flash high | 1 | 9.7 | $1.785 | 21/22 | 14.9s | |
| #1 | Gemini 3.6 Flash medium | 1 | 9.9 | $0.831 | 21/22 | 10.1s |