स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: मेट्रिक ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #277 | Ember-1 none | Fireworks | 6.1 | 5.4 | $0.786 | 0/1 | 92.9s |
| #280 | Granite 4.2 8B low | IBM Granite | 6.1 | 5.3 | $0.036 | 0/1 | 142.7s |
| #342 | gpt-oss-120b none | OpenAI | 6.1 | 4.2 | $0.016 | 0/1 | 140.9s |
| #106 | Step 3.7 Flash medium | Stepfun | 7.4 | 7.8 | $0.571 | 0/1 | 93.9s |
| #122 | GPT-5.6 Luna medium | OpenAI | 7.4 | 7.4 | $0.101 | 0/1 | 58.1s |
| #132 | GLM 5.3 Flash high | Z.ai | 7.4 | 7.3 | $0.084 | 0/1 | 111.5s |
| #147 | Step 3.7 Flash low | Stepfun | 7.4 | 7.2 | $0.449 | 0/1 | 83.6s |
| #212 | Qwen3.5-35B-A3B medium | Qwen | 7.4 | 6.3 | $1.249 | 0/1 | 126.8s |
| #222 | Trinity Large Thinking low | Arcee AI | 7.4 | 6.3 | $0.700 | 0/1 | 63.2s |
| #250 | DeepSeek V4.1 Flash none | DeepSeek | 7.4 | 5.8 | $0.123 | 0/1 | 55.8s |
| #1 | Gemini 3.6 Flash high | 10.0 | 9.9 | $1.512 | 1/1 | 65.6s | |
| #2 | Gemini 3.8 Flash high | 10.0 | 9.9 | $1.927 | 1/1 | 115.5s | |
| #3 | GPT-6 Sol high | OpenAI | 10.0 | 9.9 | $0.921 | 1/1 | 53.3s |
| #4 | GPT-6.1 Sol max | OpenAI | 10.0 | 9.9 | $1.006 | 1/1 | 80.2s |
| #5 | GPT-6 Astra max | OpenAI | 10.0 | 9.9 | $5.044 | 1/1 | 69.6s |