स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #342 | gpt-oss-120b none | OpenAI | 6.1 | 4.2 | $0.016 | 0/1 | 140.9s |
| #333 | Nemotron 3 Super none | NVIDIA | 2.8 | 4.5 | $0.016 | 0/1 | 30.5s |
| #266 | Gemini 2.5 Flash none | 3.0 | 5.5 | $0.017 | 0/1 | 1.81s | |
| #283 | Laguna XS 2.1 none | Poolside | 5.0 | 5.3 | $0.019 | 0/1 | 70.8s |
| #293 | Mercury 2.5 low | Inception | 5.0 | 5.1 | $0.020 | 0/1 | 47.1s |
| #377 | Step 3.5 Flash none | Stepfun | 0.0 | 1.9 | $0.020 | 0/0 | 0ms |
| #332 | Mimo V2 Omni none | Xiaomi | 0.0 | 4.5 | $0.021 | 0/0 | 0ms |
| #314 | Mercury 2.5 Preview none | Inception | 3.9 | 4.7 | $0.023 | 0/1 | 85.0s |
| #300 | GPT-4o-mini none | OpenAI | 5.0 | 5.0 | $0.024 | 0/1 | 40.0s |
| #366 | MiMo-V2-Flash none | Xiaomi | 0.0 | 3.3 | $0.025 | 0/0 | 0ms |
| #267 | GPT-6 Luna none | OpenAI | 5.0 | 5.5 | $0.026 | 0/1 | 51.1s |
| #268 | Gemma 4 26B A4B none | 5.0 | 5.5 | $0.026 | 0/1 | 75.8s | |
| #344 | Mercury 2.5 none | Inception | 5.0 | 4.1 | $0.026 | 0/1 | 63.4s |
| #313 | GLM 4.7 Flash none | Z.ai | 5.0 | 4.8 | $0.027 | 0/1 | 80.7s |
| #248 | Qwen3.7 Flash none | Qwen | 4.7 | 5.9 | $0.028 | 0/1 | 117.0s |