पहेली समाधान: गलत उत्तर
पहेली समाधान
गलत उत्तर
देखें कि पहेली समाधान में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: विफलता संख्या ↑.
विफलता के कारण
142/142
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #3 | GPT-5.6 Sol low | OpenAI | 1 | 8.2 | $0.971 | 2/3 | 3.44s |
| #4 | GPT-5.6 Sol medium | OpenAI | 1 | 8.2 | $1.316 | 2/3 | 2.98s |
| #9 | Gemini 3.5 Flash medium | 1 | 7.7 | $0.642 | 2/3 | 2.38s | |
| #23 | Claude Sonnet 5 medium | Anthropic | 1 | 7.7 | $0.922 | 2/3 | 2.98s |
| #25 | Gemini 2.5 Flash medium | 1 | 7.7 | $0.643 | 2/3 | 3.18s | |
| #26 | GPT-5 Mini medium | OpenAI | 1 | 5.6 | $0.237 | 1/3 | 15.2s |
| #28 | Inkling high | Thinkingmachines | 1 | 6.9 | $1.006 | 1/3 | 10.7s |
| #30 | GPT-5.2 Chat none | OpenAI | 1 | 7.7 | $0.604 | 2/3 | 4.10s |
| #31 | GLM 5.2 high | Z.ai | 1 | 6.0 | $0.970 | 1/3 | 33.7s |
| #34 | GPT-5.6 Terra high | OpenAI | 1 | 7.7 | $1.055 | 2/3 | 5.45s |
| #38 | GLM 5.2 medium | Z.ai | 1 | 8.2 | $0.222 | 2/3 | 13.1s |
| #39 | GPT-5.6 Terra medium | OpenAI | 1 | 8.4 | $0.676 | 2/3 | 3.78s |
| #43 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $3.059 | 2/3 | 4.71s |
| #44 | GPT-5.6 Luna high | OpenAI | 1 | 7.6 | $1.017 | 2/3 | 14.6s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 1 | 6.9 | $0.200 | 1/3 | 56.8s |