Pemecahan teka-teki: Jawaban salah
Pemecahan teka-teki
Jawaban salah
Lihat model AI mana yang paling mungkin mengalami Jawaban salah di Pemecahan teka-teki, agar Anda bisa menemukan titik lemahnya lebih cepat. Urutkan berdasarkan: Total Biaya ↓.
Model yang ditampilkan
15
Total kegagalan
275
Model yang paling terdampak
Grok 4.20 Multi Agent Beta 1Alasan kegagalan
186/186
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Jumlah Jawaban salah | Skor kategori | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 1 | 6.7 | $5.599 | 1/3 | 5.19s |
| #87 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $2.961 | 2/3 | 4.71s |
| #233 | Hy4 preview low | Tencent | 1 | 5.3 | $1.745 | 0/3 | 238.0s |
| #121 | Kimi K2.6 medium | Moonshot AI | 1 | 6.0 | $1.247 | 1/3 | 25.1s |
| #146 | Step 3.7 Flash high | Stepfun | 2 | 5.3 | $1.229 | 1/3 | 10.2s |
| #68 | GLM 5.2 high | Z.ai | 1 | 6.0 | $1.188 | 1/3 | 33.7s |
| #103 | Grok Build 0.1 medium | X AI | 1 | 7.7 | $1.130 | 2/3 | 18.3s |
| #64 | Inkling high | Thinkingmachines | 1 | 6.9 | $1.046 | 1/3 | 10.7s |
| #60 | Claude Sonnet 5 medium | Anthropic | 1 | 7.7 | $0.922 | 2/3 | 2.98s |
| #70 | GPT-5.6 Terra high | OpenAI | 1 | 7.7 | $0.836 | 2/3 | 5.45s |
| #137 | Grok 4.20 medium | X AI | 1 | 7.7 | $0.805 | 2/3 | 6.22s |
| #194 | Trinity Large Thinking medium | Arcee AI | 1 | 5.2 | $0.756 | 0/3 | 2.90s |
| #131 | Grok 4.3 medium | X AI | 1 | 5.9 | $0.741 | 1/3 | 22.5s |
| #134 | GLM 5.1 medium | Z.ai | 1 | 8.2 | $0.727 | 2/3 | 31.6s |
| #93 | Nemotron 3 Ultra medium | NVIDIA | 2 | 5.5 | $0.701 | 1/3 | 3.54s |