AI BENCHY
Advertise here

Сбои AI BENCHY

Сбои: Лишнее форматирование

Посмотрите, какие AI-модели чаще всего сталкиваются с Лишнее форматирование, чтобы заранее заметить риски надежности. Сортировать по: Число сбоев ↑.

Показано моделей

15

Всего сбоев

48

Наиболее затронутая модель

Qwen3.5-27B 1
Ранг Модель Компания Количество Лишнее форматирование Оценка Тестов верно Время ответа (среднее)
#30 Qwen3.5-27B medium Qwen 1 7.8 13/21 68.4s
#38 Grok 4.3 medium X AI 1 7.6 13/21 47.5s
#51 Mimo V2 PRO medium Xiaomi 1 7.4 12/21 22.2s
#55 GLM 5.1 medium Z.ai 1 7.3 12/21 33.7s
#64 MiMo-V2-Flash medium Xiaomi 1 7.2 12/21 20.1s
#65 Grok 4.20 medium X AI 1 7.1 12/21 27.7s
#67 MiniMax M3 medium Minimax 1 7.1 11/21 68.2s
#79 Hunter Alpha medium OpenRouter 1 6.7 8/18 10.3s
#80 Mimo V2 Omni medium Xiaomi 1 6.7 10/21 41.2s
#101 Mimo V2 Omni none Xiaomi 1 6.0 8/21 2.44s
#113 DeepSeek V4 Pro none DeepSeek 1 5.7 7/21 12.4s
#121 Owl Alpha none Openrouter 1 5.5 7/21 9.88s
#127 Grok 4.20 none X AI 1 5.4 6/18 1.11s
#140 Qwen3 Coder Next none Qwen 1 4.9 5/21 8.62s
#143 MiMo-V2.5 none Xiaomi 1 4.9 5/21 2.20s

Лучшие модели по Количество Лишнее форматирование

Количество Лишнее форматирование против Оценка

Лучшие модели по Время ответа (среднее)