पहेली समाधान: गलत उत्तर
पहेली समाधान
गलत उत्तर
देखें कि पहेली समाधान में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
145/145
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #206 | MiMo-V2-Flash none | Xiaomi | 2 | 5.3 | $0.025 | 1/3 | 1.86s |
| #207 | Granite 4.1 8B none | IBM Granite | 2 | 3.2 | $0.007 | 0/3 | 608ms |
| #213 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 2 | 2.9 | $0.000 | 0/3 | 1.40s |
| #216 | LFM2-24B-A2B none | Liquid | 2 | 3.8 | $0.001 | 0/3 | 1.78s |
| #5 | GPT-5.6 Sol low | OpenAI | 1 | 8.2 | $0.971 | 2/3 | 3.44s |
| #7 | GPT-5.6 Sol medium | OpenAI | 1 | 8.2 | $1.316 | 2/3 | 2.98s |
| #12 | Gemini 3.5 Flash medium | 1 | 7.7 | $0.642 | 2/3 | 2.38s | |
| #26 | Claude Sonnet 5 medium | Anthropic | 1 | 7.7 | $0.922 | 2/3 | 2.98s |
| #28 | Gemini 2.5 Flash medium | 1 | 7.7 | $0.643 | 2/3 | 3.18s | |
| #29 | GPT-5 Mini medium | OpenAI | 1 | 5.6 | $0.237 | 1/3 | 15.2s |
| #31 | Gemini 3.5 Flash-Lite high | 1 | 8.2 | $0.584 | 2/3 | 1.85s | |
| #32 | Inkling high | Thinkingmachines | 1 | 6.9 | $1.006 | 1/3 | 10.7s |
| #34 | GPT-5.2 Chat none | OpenAI | 1 | 7.7 | $0.604 | 2/3 | 4.10s |
| #35 | GLM 5.2 high | Z.ai | 1 | 6.0 | $0.817 | 1/3 | 33.7s |
| #38 | GPT-5.6 Terra high | OpenAI | 1 | 7.7 | $1.055 | 2/3 | 5.45s |