स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #164 | Gemma 4 31B medium | 10.0 | 6.9 | $0.117 | 1/1 | 82.1s | |
| #111 | GPT-6 Luna high | OpenAI | 5.2 | 7.7 | $0.074 | 0/1 | 82.8s |
| #147 | Step 3.7 Flash low | Stepfun | 7.4 | 7.2 | $0.449 | 0/1 | 83.6s |
| #101 | Gemini 3.5 Flash medium | 2.8 | 7.9 | $1.316 | 0/1 | 84.5s | |
| #297 | Mercury 2.5 Preview low | Inception | 5.0 | 5.0 | $0.015 | 0/1 | 84.5s |
| #314 | Mercury 2.5 Preview none | Inception | 3.9 | 4.7 | $0.023 | 0/1 | 85.0s |
| #231 | Gemini 3.5 Flash none | 2.8 | 6.1 | $1.752 | 0/1 | 85.3s | |
| #194 | Mercury 2.5 Preview high | Inception | 6.1 | 6.5 | $0.039 | 0/1 | 86.8s |
| #138 | Gemini 3.5 Flash Lite medium | 4.7 | 7.3 | $0.440 | 0/1 | 86.9s | |
| #26 | Claude Opus 5 high | Anthropic | 10.0 | 9.4 | $4.524 | 1/1 | 87.0s |
| #77 | Gemini 3.5 Flash high | 3.4 | 8.3 | $2.737 | 0/1 | 87.3s | |
| #163 | Ember-1 high | Fireworks | 6.1 | 6.9 | $2.405 | 0/1 | 88.3s |
| #193 | Qwen3.6 35B A3B medium | Qwen | 6.1 | 6.5 | $0.812 | 0/1 | 88.5s |
| #259 | Space Bunny Alpha low | Stealth | 4.7 | 5.7 | $0.000 | 0/1 | 89.0s |
| #103 | MiMo-V2.6-Flash medium | Xiaomi | 10.0 | 7.9 | $0.218 | 1/1 | 90.1s |