स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #94 | Gemini 3.8 Flash medium | 2.8 | 8.0 | $0.769 | 0/1 | 63.7s | |
| #344 | Mercury 2.5 none | Inception | 5.0 | 4.1 | $0.026 | 0/1 | 63.4s |
| #222 | Trinity Large Thinking low | Arcee AI | 7.4 | 6.3 | $0.700 | 0/1 | 63.2s |
| #29 | Claude Opus 5.5 medium | Anthropic | 10.0 | 9.2 | $1.804 | 1/1 | 62.6s |
| #275 | MiMo-V2.6-Flash none | Xiaomi | 5.0 | 5.4 | $0.060 | 0/1 | 62.6s |
| #181 | Ember-1 max | Fireworks | 10.0 | 6.7 | $3.264 | 1/1 | 62.5s |
| #45 | Muse Spark 1.2 high | Meta | 10.0 | 8.9 | $2.018 | 1/1 | 62.5s |
| #34 | GPT-5.3-Codex medium | OpenAI | 10.0 | 9.1 | $1.318 | 1/1 | 61.9s |
| #10 | Gemini 3.6 Flash medium | 10.0 | 9.8 | $0.970 | 1/1 | 61.8s | |
| #109 | Grok 4.5 low | X AI | 5.0 | 7.8 | $1.345 | 0/1 | 61.5s |
| #35 | Muse Spark 1.3 high | Meta | 10.0 | 9.1 | $1.891 | 1/1 | 61.3s |
| #91 | GPT-5.6 Luna high | OpenAI | 10.0 | 8.0 | $0.207 | 1/1 | 60.2s |
| #21 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.5 | $0.712 | 1/1 | 60.0s |
| #184 | GLM 5.3 Flash low | Z.ai | 10.0 | 6.6 | $0.052 | 1/1 | 59.7s |
| #30 | GPT-5.5 medium | OpenAI | 10.0 | 9.2 | $4.809 | 1/1 | 59.4s |