स्वायत्त एजेंट कार्य: गलत उत्तर
स्वायत्त एजेंट कार्य
गलत उत्तर
देखें कि स्वायत्त एजेंट कार्य में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
विफलता के कारण
108/108
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #316 | North Mini Code none | Cohere | 1 | 3.0 | $0.000 | 0/1 | 18.9s |
| #333 | Nemotron 3 Super none | NVIDIA | 1 | 2.8 | $0.016 | 0/1 | 30.5s |
| #188 | Mercury 2 medium | Inception | 1 | 4.7 | $0.121 | 0/1 | 34.9s |
| #300 | GPT-4o-mini none | OpenAI | 1 | 5.0 | $0.024 | 0/1 | 40.0s |
| #255 | GPT-5.4 Mini none | OpenAI | 1 | 5.0 | $0.170 | 0/1 | 42.0s |
| #260 | GPT-5.4 none | OpenAI | 1 | 5.0 | $0.690 | 0/1 | 43.7s |
| #244 | Gemini 3.1 Flash Lite none | 1 | 5.0 | $0.069 | 0/1 | 43.8s | |
| #258 | Gemma 4 31B none | 1 | 3.9 | $0.030 | 0/1 | 44.7s | |
| #321 | GPT-5.4 Nano none | OpenAI | 1 | 3.9 | $0.068 | 0/1 | 45.4s |
| #292 | Mistral Small 4 none | Mistral | 1 | 5.0 | $0.047 | 0/1 | 45.5s |
| #299 | Dots 3 Note Preview none | Dots Studio | 1 | 3.9 | $0.000 | 0/1 | 45.7s |
| #272 | Qwen3.8 27B none | Qwen | 1 | 5.0 | ~$0.010 | 0/1 | 47.4s |
| #163 | Gemini 3.1 Flash Lite medium | 1 | 5.0 | $0.153 | 0/1 | 47.8s | |
| #230 | Gemini 3.1 Flash Lite Preview none | 1 | 5.0 | $0.090 | 0/1 | 48.6s | |
| #208 | Gemini 3.5 Flash minimal | 1 | 5.0 | $0.508 | 0/1 | 49.2s |