स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: मेट्रिक ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #314 | Mercury 2.5 Preview none | Inception | 3.9 | 4.7 | $0.023 | 0/1 | 85.0s |
| #321 | GPT-5.4 Nano none | OpenAI | 3.9 | 4.6 | $0.068 | 0/1 | 45.4s |
| #341 | GLM 4.7 Flash medium | Z.ai | 3.9 | 4.2 | $0.193 | 0/1 | 399.2s |
| #368 | Command A+ high | Cohere | 3.9 | 3.2 | $0.079 | 0/1 | 156.0s |
| #71 | Gemini 3.1 Pro Preview medium | 4.7 | 8.4 | $1.585 | 0/1 | 56.2s | |
| #124 | DeepSeek V4 Flash 0731 low | DeepSeek | 4.7 | 7.4 | $0.307 | 0/1 | 321.2s |
| #130 | Inkling medium | Thinkingmachines | 4.7 | 7.4 | $0.540 | 0/1 | 45.9s |
| #141 | Qwen3.8 27B medium | Qwen | 4.7 | 7.2 | ~$0.073 | 0/1 | 187.9s |
| #144 | Qwen3.7 Flash high | Qwen | 4.7 | 7.2 | $0.063 | 0/1 | 135.9s |
| #151 | MiMo-V2.6-Flash low | Xiaomi | 4.7 | 7.1 | $0.200 | 0/1 | 107.9s |
| #189 | Mercury 2 medium | Inception | 4.7 | 6.6 | $0.121 | 0/1 | 34.9s |
| #208 | MiMo-V2.5-Pro medium | Xiaomi | 4.7 | 6.4 | $0.502 | 0/1 | 233.5s |
| #257 | Dots 3 Note Preview medium | Dots Studio | 4.7 | 5.7 | $0.000 | 0/1 | 140.5s |
| #264 | Nemotron 3 Super medium | NVIDIA | 4.7 | 5.5 | $0.081 | 0/1 | 138.3s |
| #274 | Hy4 preview low | Tencent | 4.7 | 5.4 | $1.670 | 0/1 | 52.4s |