स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #7 | GPT-6 Astra high | OpenAI | 10.0 | 9.9 | $4.458 | 1/1 | 53.4s |
| #38 | Gemini 3.5 Flash low | 10.0 | 9.0 | $0.752 | 1/1 | 53.7s | |
| #279 | GPT-5.6 Luna none | OpenAI | 5.0 | 5.3 | $0.056 | 0/1 | 53.8s |
| #177 | Qwen3.5-Flash none | Qwen | 10.0 | 6.7 | $0.089 | 1/1 | 53.8s |
| #214 | Gemini 3.5 Flash Lite low | 5.0 | 6.3 | $0.183 | 0/1 | 53.9s | |
| #291 | Mistral Small 4 medium | Mistral | 5.0 | 5.1 | $0.126 | 0/1 | 54.1s |
| #95 | GPT-5.6 Terra low | OpenAI | 10.0 | 7.9 | $0.645 | 1/1 | 54.6s |
| #12 | GPT-6.1 Sol high | OpenAI | 10.0 | 9.6 | $0.755 | 1/1 | 54.6s |
| #84 | GPT-5.6 Terra medium | OpenAI | 10.0 | 8.2 | $0.744 | 1/1 | 54.7s |
| #155 | Gemini 3.1 Flash Lite Preview medium | 5.0 | 7.0 | $0.158 | 0/1 | 54.9s | |
| #61 | Claude Sonnet 5.5 xhigh | Anthropic | 10.0 | 8.6 | $1.516 | 1/1 | 54.9s |
| #65 | Muse Spark 1.3 low | Meta | 10.0 | 8.5 | $0.911 | 1/1 | 55.1s |
| #250 | DeepSeek V4.1 Flash none | DeepSeek | 7.4 | 5.8 | $0.123 | 0/1 | 55.8s |
| #201 | Qwen3.5-122B-A10B none | Qwen | 10.0 | 6.4 | $0.308 | 1/1 | 55.9s |
| #90 | DeepSeek V4.1 Flash low | DeepSeek | 6.1 | 8.0 | $0.153 | 0/1 | 56.0s |