AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Kegagalan kategori AI BENCHY

Trik anti-AI: Jawaban salah

Trik anti-AI
Jawaban salah

Lihat model AI mana yang paling mungkin mengalami Jawaban salah di Trik anti-AI, agar Anda bisa menemukan titik lemahnya lebih cepat.

Model yang ditampilkan

15

Total kegagalan

165

Model yang paling terdampak

Qwen3.5-Flash 4
Peringkat Model Perusahaan Jumlah Jawaban salah Skor kategori Tes benar Waktu respons (rata-rata)
#15 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#16 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#21 Gemini 3 Flash Preview none Google 1 8.3 3/4 1.25s
#22 Gemini 3.1 Flash Lite Preview low Google 1 8.3 3/4 2.12s
#25 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#26 Claude Sonnet 4.6 medium Anthropic 1 6.5 2/4 2.98s
#27 DeepSeek V3.2 medium DeepSeek 1 8.4 3/4 30.7s
#28 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#29 Gemini 3.1 Flash Lite Preview none Google 1 7.5 2/4 1.04s
#31 GLM 5V Turbo medium Z.ai 1 7.2 2/4 10.8s
#34 Kimi K2.6 medium Moonshot AI 1 7.0 2/4 11.6s
#36 GPT-5.3 Chat none OpenAI 1 6.7 2/4 3.86s
#38 GPT-5.4 Nano medium OpenAI 1 8.3 3/4 4.52s
#39 Seed-2.0-Mini medium Bytedance Seed 1 6.6 2/4 74.7s
#40 GPT-5.2 medium OpenAI 1 6.5 2/4 7.81s

Model teratas menurut Jumlah Jawaban salah

Jumlah Jawaban salah vs Skor

Model teratas menurut Waktu respons (rata-rata)

Model teratas menurut Perkiraan biaya terbuang