पहेली समाधान: गलत उत्तर
पहेली समाधान
गलत उत्तर
देखें कि पहेली समाधान में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
186/186
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #265 | Mercury 2.5 Preview none | Inception | 1 | 5.6 | $0.018 | 1/3 | 684ms |
| #267 | Nemotron 3 Super none | NVIDIA | 1 | 5.5 | $0.008 | 1/3 | 2.36s |
| #268 | Hy4 preview none | Tencent | 1 | 4.6 | $0.041 | 0/3 | 24.1s |
| #271 | GPT-5.4 Nano none | OpenAI | 1 | 5.4 | $0.041 | 1/3 | 1.25s |
| #272 | Trinity Large Thinking high | Arcee AI | 1 | 4.7 | $0.592 | 0/3 | 3.84s |
| #273 | Grok 4.20 Multi Agent Beta medium | X AI | 1 | 6.7 | $5.599 | 1/3 | 5.19s |
| #275 | GLM 4.7 Flash none | Z.ai | 1 | 6.4 | $0.016 | 1/3 | 1.20s |
| #277 | Hunter Alpha medium | OpenRouter | 1 | 6.1 | $0.000 | 1/3 | 5.35s |
| #278 | Grok 4.1 Fast medium | X AI | 1 | 5.3 | $0.069 | 1/3 | 7.40s |
| #279 | Laguna M.1 medium | Poolside | 1 | 5.3 | $0.033 | 1/3 | 10.2s |
| #284 | MiniMax M2.5 medium | Minimax | 1 | 5.3 | $0.327 | 1/3 | 11.2s |
| #286 | Grok 4.20 Beta none | X AI | 1 | 7.7 | $0.087 | 2/3 | 586ms |
| #290 | Elephant Alpha medium | Openrouter | 1 | 5.3 | $0.000 | 1/3 | 868ms |
| #291 | Granite 4.2 8B none | IBM Granite | 1 | 3.0 | $0.026 | 0/3 | 107.6s |
| #292 | Hunter Alpha none | OpenRouter | 1 | 5.8 | $0.000 | 1/3 | 3.71s |