पहेली समाधान: गलत उत्तर
पहेली समाधान
गलत उत्तर
देखें कि पहेली समाधान में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: सही परीक्षण ↓.
विफलता के कारण
186/186
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #5 | GPT-5.6 Sol low | OpenAI | 1 | 8.2 | $0.357 | 2/3 | 3.44s |
| #9 | GPT-5.6 Sol medium | OpenAI | 1 | 8.2 | $0.508 | 2/3 | 2.98s |
| #21 | Gemini 3.5 Flash medium | 1 | 7.7 | $0.665 | 2/3 | 2.38s | |
| #53 | Gemini 2.5 Flash medium | 1 | 7.7 | $0.644 | 2/3 | 3.18s | |
| #55 | Claude Sonnet 5 medium | Anthropic | 1 | 7.7 | $0.922 | 2/3 | 2.98s |
| #65 | GPT-5.6 Terra high | OpenAI | 1 | 7.7 | $0.836 | 2/3 | 5.45s |
| #67 | GPT-5.2 Chat none | OpenAI | 1 | 7.7 | $0.594 | 2/3 | 4.10s |
| #69 | Qwen3.8 27B low | Qwen | 1 | 7.7 | ~$0.071 | 2/3 | 4.91s |
| #72 | Gemini 3.5 Flash Lite medium | 1 | 8.2 | $0.272 | 2/3 | 1.82s | |
| #73 | GLM 5.2 medium | Z.ai | 1 | 8.2 | $0.224 | 2/3 | 13.1s |
| #74 | GPT-5.6 Terra medium | OpenAI | 1 | 8.4 | $0.523 | 2/3 | 3.78s |
| #82 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $2.961 | 2/3 | 4.71s |
| #86 | GPT-5.6 Luna high | OpenAI | 1 | 7.6 | $0.179 | 2/3 | 14.6s |
| #92 | MiniMax M3 medium | Minimax | 1 | 7.9 | $0.300 | 2/3 | 49.9s |
| #98 | Grok Build 0.1 medium | X AI | 1 | 7.7 | $1.130 | 2/3 | 18.3s |