Рейтинг Агентные задачи
Посмотрите, какие AI-модели лучше всего справляются с Агентные задачи, какие остаются надежными и где заметнее всего разница. Сортировать по: Общая стоимость ↓.
Показано моделей
15
Среднее значение Оценка Агентные задачи
5.8
Лучшая модель
Claude Sonnet 5.5 10.0
380/380
Фильтровать модели
Нет моделей, соответствующих текущему поиску и фильтрам.
| Ранг | Модель | Компания | Оценка Агентные задачи | Оценка | Общая стоимость | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|---|
| #350 | Laguna M.1 medium | Poolside | 0.0 | 3.9 | $0.033 | 0/0 | 0ms |
| #116 | GPT-6 Luna low | OpenAI | 10.0 | 7.6 | $0.033 | 1/1 | 51.0s |
| #258 | Gemma 4 31B none | 3.9 | 5.7 | $0.030 | 0/1 | 44.7s | |
| #243 | gpt-oss-120b medium | OpenAI | 5.0 | 5.9 | $0.030 | 0/1 | 203.9s |
| #235 | Granite 4.2 8B medium | IBM Granite | 10.0 | 6.1 | $0.029 | 1/1 | 149.5s |
| #248 | Qwen3.7 Flash none | Qwen | 4.7 | 5.9 | $0.028 | 0/1 | 117.0s |
| #313 | GLM 4.7 Flash none | Z.ai | 5.0 | 4.8 | $0.027 | 0/1 | 80.7s |
| #344 | Mercury 2.5 none | Inception | 5.0 | 4.1 | $0.026 | 0/1 | 63.4s |
| #268 | Gemma 4 26B A4B none | 5.0 | 5.5 | $0.026 | 0/1 | 75.8s | |
| #267 | GPT-6 Luna none | OpenAI | 5.0 | 5.5 | $0.026 | 0/1 | 51.1s |
| #366 | MiMo-V2-Flash none | Xiaomi | 0.0 | 3.3 | $0.025 | 0/0 | 0ms |
| #300 | GPT-4o-mini none | OpenAI | 5.0 | 5.0 | $0.024 | 0/1 | 40.0s |
| #314 | Mercury 2.5 Preview none | Inception | 3.9 | 4.7 | $0.023 | 0/1 | 85.0s |
| #332 | Mimo V2 Omni none | Xiaomi | 0.0 | 4.5 | $0.021 | 0/0 | 0ms |
| #377 | Step 3.5 Flash none | Stepfun | 0.0 | 1.9 | $0.020 | 0/0 | 0ms |