Рейтинг Решение головоломок
Посмотрите, какие AI-модели лучше всего справляются с Решение головоломок, какие остаются надежными и где заметнее всего разница. Сортировать по: Метрика ↑.
Показано моделей
15
Среднее значение Оценка Решение головоломок
6.9
Лучшая модель
Step 3.5 Flash 0.0
330/330
Фильтровать модели
Нет моделей, соответствующих текущему поиску и фильтрам.
| Ранг | Модель | Компания | Оценка Решение головоломок | Оценка | Общая стоимость | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|---|
| #48 | Claude Fable 5 medium | Anthropic | 7.7 | 8.6 | $3.004 | 2/3 | 5.18s |
| #66 | Gemini 2.5 Flash medium | 7.7 | 8.2 | $0.644 | 2/3 | 3.18s | |
| #68 | Claude Sonnet 5 medium | Anthropic | 7.7 | 8.2 | $0.922 | 2/3 | 2.98s |
| #78 | GPT-5.6 Terra high | OpenAI | 7.7 | 8.0 | $0.836 | 2/3 | 5.45s |
| #80 | GPT-5.2 Chat none | OpenAI | 7.7 | 7.9 | $0.594 | 2/3 | 4.10s |
| #82 | Qwen3.8 27B low | Qwen | 7.7 | 7.9 | ~$0.071 | 2/3 | 4.91s |
| #95 | Claude Opus 4.6 medium | Anthropic | 7.7 | 7.7 | $2.961 | 2/3 | 4.71s |
| #102 | Claude Opus 5 none | Anthropic | 7.7 | 7.5 | $1.550 | 2/3 | 3.66s |
| #111 | Grok Build 0.1 medium | X AI | 7.7 | 7.5 | $1.130 | 2/3 | 18.3s |
| #113 | Gemini 3.1 Flash Lite Preview medium | 7.7 | 7.4 | $0.117 | 2/3 | 5.30s | |
| #121 | Claude Sonnet 4.6 none | Anthropic | 7.7 | 7.3 | $0.661 | 2/3 | 2.53s |
| #126 | Qwen3.7 Plus none | Qwen | 7.7 | 7.3 | $0.106 | 2/3 | 1.71s |
| #128 | Claude Opus 4.8 none | Anthropic | 7.7 | 7.3 | $1.166 | 2/3 | 2.74s |
| #136 | Muse Glimmer 30B low | Meta | 7.7 | 7.1 | $0.143 | 2/3 | 5.06s |
| #141 | GPT-5.6 Sol none | OpenAI | 7.7 | 7.0 | $0.201 | 2/3 | 1.49s |