निर्देश पालन: गलत उत्तर
निर्देश पालन
गलत उत्तर
देखें कि निर्देश पालन में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: विफलता संख्या ↑.
विफलता के कारण
61/61
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #60 | LongCat 2.0 medium | Meituan | 1 | 6.5 | $0.478 | 1/2 | 7.38s |
| #63 | Claude Sonnet 4.6 none | Anthropic | 1 | 6.5 | $0.661 | 1/2 | 1.96s |
| #71 | Qwen3.7 Plus none | Qwen | 1 | 6.3 | $0.106 | 1/2 | 929ms |
| #74 | GLM 5.1 medium | Z.ai | 1 | 6.4 | $0.535 | 1/2 | 7.47s |
| #82 | DeepSeek V4 Pro none | DeepSeek | 1 | 6.3 | $0.096 | 1/2 | 4.12s |
| #87 | GPT-5.5 none | OpenAI | 1 | 6.2 | $0.544 | 1/2 | 1.15s |
| #88 | Gemini 3.5 Flash minimal | 1 | 6.4 | $0.300 | 1/2 | 893ms | |
| #89 | Gemini 3 Flash Preview none | 1 | 6.4 | $0.085 | 1/2 | 1.58s | |
| #91 | LongCat 2.0 low | Meituan | 1 | 6.5 | $0.391 | 1/2 | 6.39s |
| #97 | LongCat 2.0 high | Meituan | 1 | 6.5 | $0.469 | 1/2 | 6.96s |
| #103 | Qwen3.5-27B none | Qwen | 1 | 6.3 | $0.090 | 1/2 | 1.03s |
| #111 | LongCat 2.0 none | Meituan | 1 | 6.5 | $0.044 | 1/2 | 2.82s |
| #115 | Gemma 4 31B none | 1 | 6.5 | $0.035 | 1/2 | 2.84s | |
| #124 | Qwen3.6 Flash none | Qwen | 1 | 6.3 | $0.062 | 1/2 | 1.10s |
| #125 | Qwen3.5-Flash none | Qwen | 1 | 6.3 | $0.073 | 1/2 | 8.81s |