निर्देश पालन: गलत उत्तर
निर्देश पालन
गलत उत्तर
देखें कि निर्देश पालन में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
82/82
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #297 | Ling 3.0 Tiny none | Inclusionai | 1 | 3.1 | $0.000 | 0/2 | 2.44s |
| #298 | Granite 4.1 8B none | IBM Granite | 1 | 3.6 | $0.007 | 0/2 | 344ms |
| #299 | Nemotron 3.5 Lightning none | NVIDIA | 1 | 6.5 | $0.007 | 1/2 | 511ms |
| #303 | Grok 4.1 Fast none | X AI | 1 | 3.0 | $0.008 | 0/2 | 685ms |
| #306 | Laguna Xs.2 none | Poolside | 1 | 6.5 | $0.004 | 1/2 | 439ms |
| #309 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 1 | 4.8 | $0.000 | 0/2 | 541ms |
| #311 | LFM2-24B-A2B none | Liquid | 1 | 6.3 | $0.001 | 1/2 | 752ms |