स्वायत्त एजेंट कार्य: गलत उत्तर
स्वायत्त एजेंट कार्य
गलत उत्तर
देखें कि स्वायत्त एजेंट कार्य में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
108/108
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #174 | Solar Pro 4 xhigh | Upstage | 1 | 3.0 | $0.167 | 0/1 | 316.6s |
| #178 | Solar Pro 4 low | Upstage | 1 | 6.1 | $0.174 | 0/1 | 345.4s |
| #180 | MiniMax M3 medium | Minimax | 1 | 3.0 | $0.372 | 0/1 | 116.5s |
| #183 | GPT-5.6 Sol none | OpenAI | 1 | 5.0 | $0.472 | 0/1 | 58.3s |
| #185 | GPT-5.5 none | OpenAI | 1 | 5.0 | $1.212 | 0/1 | 57.5s |
| #187 | LongCat 2.0 low | Meituan | 1 | 6.1 | $0.495 | 0/1 | 145.6s |
| #188 | Mercury 2 medium | Inception | 1 | 4.7 | $0.121 | 0/1 | 34.9s |
| #189 | Step 3.7 Flash high | Stepfun | 1 | 5.4 | $1.350 | 0/1 | 130.4s |
| #192 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.1 | $0.812 | 0/1 | 88.5s |
| #194 | Mercury 2.5 high | Inception | 1 | 3.9 | $0.044 | 0/1 | 80.3s |
| #202 | Gemini 3 Flash Preview none | 1 | 5.0 | $0.155 | 0/1 | 57.8s | |
| #204 | Solar Pro 4 medium | Upstage | 1 | 4.7 | $0.174 | 0/1 | 272.3s |
| #208 | Gemini 3.5 Flash minimal | 1 | 5.0 | $0.508 | 0/1 | 49.2s | |
| #209 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 4.7 | $0.502 | 0/1 | 233.5s |
| #210 | Dots 3 Note Preview high | Dots Studio | 1 | 6.1 | $0.000 | 0/1 | 129.1s |