स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #124 | DeepSeek V4 Flash 0731 low | DeepSeek | 4.7 | 7.4 | $0.307 | 0/1 | 321.2s |
| #127 | Grok 4.7 low | X AI | 5.0 | 7.4 | $2.263 | 0/1 | 154.9s |
| #128 | Inkling Small high | Thinkingmachines | 3.0 | 7.4 | $0.402 | 0/1 | 23ms |
| #130 | Inkling medium | Thinkingmachines | 4.7 | 7.4 | $0.540 | 0/1 | 45.9s |
| #132 | GLM 5.3 Flash high | Z.ai | 7.4 | 7.3 | $0.084 | 0/1 | 111.5s |
| #133 | Claude Fable 5.1 medium | Anthropic | 3.0 | 7.3 | $3.197 | 0/1 | 16.2s |
| #134 | Grok 4.7 medium | X AI | 3.9 | 7.3 | $3.501 | 0/1 | 372.1s |
| #135 | Gemini 2.5 Flash medium | 3.0 | 7.3 | $0.644 | 0/1 | 6.54s | |
| #137 | Qwen3.6 Plus medium | Qwen | 4.7 | 7.3 | $0.391 | 0/1 | 307.1s |
| #138 | Gemini 3.5 Flash Lite medium | 4.7 | 7.3 | $0.440 | 0/1 | 86.9s | |
| #140 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 6.1 | 7.2 | $0.567 | 0/1 | 186.4s |
| #141 | Qwen3.8 27B medium | Qwen | 4.7 | 7.2 | ~$0.073 | 0/1 | 187.9s |
| #142 | Gemini 3.8 Flash low | 6.1 | 7.2 | $0.323 | 0/1 | 67.2s | |
| #143 | Claude Opus 4.8 low | Anthropic | 4.7 | 7.2 | $3.787 | 0/1 | 110.7s |
| #144 | Qwen3.7 Flash high | Qwen | 4.7 | 7.2 | $0.063 | 0/1 | 135.9s |