AI BENCHY
Your ad here

Kegagalan kategori AI BENCHY

Spesifik domain: Format tambahan

Spesifik domain
Format tambahan

Lihat model AI mana yang paling mungkin mengalami Format tambahan di Spesifik domain, agar Anda bisa menemukan titik lemahnya lebih cepat. Urutkan berdasarkan: Tes benar ↓.

Model yang ditampilkan

7

Total kegagalan

8

Model yang paling terdampak

Grok 4.20 1
Peringkat Model Perusahaan Jumlah Format tambahan Skor kategori Tes benar Waktu respons (rata-rata)
#47 Grok 4.20 medium X AI 1 5.3 1/3 27.0s
#26 Claude Sonnet 4.6 medium Anthropic 1 2.9 0/3 0ms
#35 MiMo-V2-Omni medium Xiaomi 1 3.0 0/3 55.1s
#37 Claude Opus 4.6 medium Anthropic 2 3.0 0/3 83.4s
#50 Hunter Alpha medium OpenRouter 1 3.0 0/3 10.5s
#56 Grok 4.20 Multi Agent Beta medium X AI 1 2.9 0/3 24.7s
#82 Grok 4.20 none X AI 1 3.0 0/3 687ms

Model teratas menurut Jumlah Format tambahan

Jumlah Format tambahan vs Skor

Model teratas menurut Waktu respons (rata-rata)

Model teratas menurut Perkiraan biaya terbuang