Рейтинг Агентные задачи
Посмотрите, какие AI-модели лучше всего справляются с Агентные задачи, какие остаются надежными и где заметнее всего разница. Сортировать по: Тестов верно ↑.
380/380
Фильтровать модели
Нет моделей, соответствующих текущему поиску и фильтрам.
| Ранг | Модель | Компания | Оценка Агентные задачи | Оценка | Общая стоимость | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|---|
| #150 | GLM 5.3 FlashX medium | Z.ai | 10.0 | 7.1 | $0.114 | 1/1 | 74.4s |
| #152 | MiMo-V2.5 medium | Xiaomi | 10.0 | 7.1 | $0.419 | 1/1 | 113.6s |
| #165 | Gemma 4 31B medium | 10.0 | 6.9 | $0.117 | 1/1 | 82.1s | |
| #166 | GPT-5.6 Luna low | OpenAI | 10.0 | 6.9 | $0.075 | 1/1 | 45.7s |
| #167 | Claude Sonnet 5.5 low | Anthropic | 10.0 | 6.9 | $0.909 | 1/1 | 46.6s |
| #169 | Qwen3.5-Flash medium | Qwen | 10.0 | 6.8 | $0.184 | 1/1 | 67.7s |
| #170 | Inkling low | Thinkingmachines | 10.0 | 6.8 | $0.304 | 1/1 | 44.2s |
| #177 | Qwen3.5-Flash none | Qwen | 10.0 | 6.7 | $0.089 | 1/1 | 53.8s |
| #181 | Ember-1 max | Fireworks | 10.0 | 6.7 | $3.264 | 1/1 | 62.5s |
| #184 | GLM 5.3 Flash low | Z.ai | 10.0 | 6.6 | $0.052 | 1/1 | 59.7s |
| #191 | Claude Sonnet 5.5 medium | Anthropic | 10.0 | 6.5 | $1.100 | 1/1 | 51.2s |
| #196 | GLM 5.1 none | Z.ai | 10.0 | 6.5 | $0.311 | 1/1 | 107.2s |
| #201 | Qwen3.5-122B-A10B none | Qwen | 10.0 | 6.4 | $0.308 | 1/1 | 55.9s |
| #214 | Qwen3.6 27B none | Qwen | 10.0 | 6.3 | $0.147 | 1/1 | 58.6s |
| #223 | DeepSeek V4 Flash 0423 none | DeepSeek | 10.0 | 6.3 | $0.050 | 1/1 | 92.9s |