निर्देश पालन: गलत उत्तर
निर्देश पालन
गलत उत्तर
देखें कि निर्देश पालन में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
82/82
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #247 | Dots 3 Note Preview none | Dots Studio | 1 | 4.8 | $0.000 | 0/2 | 1.06s |
| #248 | Inkling none | Thinkingmachines | 1 | 6.3 | $0.147 | 1/2 | 1.72s |
| #249 | Granite 4.2 8B medium | IBM Granite | 1 | 3.8 | $0.009 | 0/2 | 36.9s |
| #251 | Mistral Small 4 none | Mistral | 1 | 6.5 | $0.022 | 1/2 | 380ms |
| #252 | Mistral Small 4 medium | Mistral | 1 | 7.3 | $0.097 | 1/2 | 1.38s |
| #253 | Granite 4.2 8B low | IBM Granite | 1 | 3.0 | $0.012 | 0/2 | 75.8s |
| #254 | Qwen3 Coder Next none | Qwen | 1 | 6.3 | $0.026 | 1/2 | 7.78s |
| #255 | MiMo-V2.5 none | Xiaomi | 1 | 6.5 | $0.025 | 1/2 | 751ms |
| #256 | Qwen3.5-9B none | Qwen | 1 | 6.5 | $0.021 | 1/2 | 514ms |
| #257 | GLM 5 Turbo none | Z.ai | 1 | 6.5 | $0.047 | 1/2 | 2.13s |
| #258 | North Mini Code none | Cohere | 1 | 6.5 | $0.000 | 1/2 | 30.7s |
| #259 | MiniMax M2.7 medium | Minimax | 1 | 3.8 | $0.208 | 0/2 | 12.8s |
| #260 | Mercury 2.5 Preview low | Inception | 1 | 6.3 | $0.011 | 1/2 | 1.60s |
| #261 | Laguna S 2.1 low | Poolside | 1 | 4.3 | $0.082 | 0/2 | 423ms |
| #263 | GPT-4o-mini none | OpenAI | 1 | 6.3 | $0.010 | 1/2 | 1.11s |