AI BENCHY
Your ad here

Kegagalan kategori AI BENCHY

Pemrograman: Jawaban salah

Pemrograman
Jawaban salah

Lihat model AI mana yang paling mungkin mengalami Jawaban salah di Pemrograman, agar Anda bisa menemukan titik lemahnya lebih cepat.

Model yang ditampilkan

11

Total kegagalan

26

Model yang paling terdampak

MiMo-V2-Omni 1
Peringkat Model Perusahaan Jumlah Jawaban salah Skor kategori Tes benar Waktu respons (rata-rata)
#77 Grok 4.20 none X AI 1 3.4 0/1 1.22s
#78 Mistral Small 4 none Mistral 1 4.5 0/1 1.28s
#79 gpt-oss-120b none OpenAI 1 4.3 0/1 9.57s
#81 Qwen3 Coder Next none Qwen 1 7.3 0/1 3.14s
#82 Nemotron 3 Super none NVIDIA 1 3.3 0/1 2.99s
#83 GPT-4o-mini none OpenAI 1 3.0 0/1 2.55s
#84 Qwen3.5-9B none Qwen 1 5.2 0/1 5.69s
#85 Mercury 2 none Inception 1 3.6 0/1 969ms
#88 MiMo-V2-Flash none Xiaomi 1 6.3 0/1 2.79s
#89 Grok 4.1 Fast none X AI 1 5.3 0/1 1.79s
#90 GPT-5.4 Nano none OpenAI 1 7.1 0/1 1.43s

Model teratas menurut Jumlah Jawaban salah

Jumlah Jawaban salah vs Skor

Model teratas menurut Waktu respons (rata-rata)

Model teratas menurut Perkiraan biaya terbuang