स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: मेट्रिक ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #256 | Seed 2.1 Turbo none | Bytedance Seed | 5.0 | 5.7 | $0.182 | 0/1 | 71.4s |
| #260 | GPT-5.4 none | OpenAI | 5.0 | 5.6 | $0.690 | 0/1 | 43.7s |
| #261 | Solar Pro 4 none | Upstage | 5.0 | 5.6 | $0.033 | 0/1 | 69.2s |
| #262 | GLM 5 none | Z.ai | 5.0 | 5.6 | $0.126 | 0/1 | 74.8s |
| #267 | GPT-6 Luna none | OpenAI | 5.0 | 5.5 | $0.026 | 0/1 | 51.1s |
| #268 | Gemma 4 26B A4B none | 5.0 | 5.5 | $0.026 | 0/1 | 75.8s | |
| #272 | Qwen3.8 27B none | Qwen | 5.0 | 5.4 | ~$0.010 | 0/1 | 47.4s |
| #275 | MiMo-V2.6-Flash none | Xiaomi | 5.0 | 5.4 | $0.060 | 0/1 | 62.6s |
| #279 | GPT-5.6 Luna none | OpenAI | 5.0 | 5.3 | $0.056 | 0/1 | 53.8s |
| #281 | Kimi K2.5 none | Moonshot AI | 5.0 | 5.3 | $0.236 | 0/1 | 321.2s |
| #283 | Laguna XS 2.1 none | Poolside | 5.0 | 5.3 | $0.019 | 0/1 | 70.8s |
| #291 | Mistral Small 4 medium | Mistral | 5.0 | 5.1 | $0.126 | 0/1 | 54.1s |
| #292 | Mistral Small 4 none | Mistral | 5.0 | 5.1 | $0.047 | 0/1 | 45.5s |
| #293 | Mercury 2.5 low | Inception | 5.0 | 5.1 | $0.020 | 0/1 | 47.1s |
| #297 | Mercury 2.5 Preview low | Inception | 5.0 | 5.0 | $0.015 | 0/1 | 84.5s |