Uandishi wa msimbo: Jibu lisilo sahihi
Uandishi wa msimbo
Jibu lisilo sahihi
Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Jibu lisilo sahihi katika Uandishi wa msimbo, ili uone udhaifu haraka. Panga kwa: Majaribio sahihi ↓.
Sababu za kushindwa
197/197
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Kampuni | Idadi ya Jibu lisilo sahihi | Alama ya kategoria | Jumla ya gharama | Majaribio sahihi | Muda wa majibu (wastani) |
|---|---|---|---|---|---|---|---|
| #5 | Gemini 3 Flash Preview medium | 1 | 8.6 | $0.763 | 2/3 | 84.4s | |
| #7 | Gemini 3.7 Flash medium | 1 | 8.4 | $0.155 | 2/3 | 8.86s | |
| #12 | Gemini 3.1 Pro Preview medium | 1 | 7.9 | $1.352 | 2/3 | 40.2s | |
| #13 | Gemini 3.7 Flash low | 1 | 7.6 | $0.104 | 2/3 | 6.20s | |
| #19 | GPT-5.5 medium | OpenAI | 1 | 8.8 | $4.163 | 2/3 | 59.8s |
| #24 | Gemini 3.5 Flash low | 1 | 7.8 | $0.449 | 2/3 | 6.71s | |
| #25 | Gemini 3.5 Flash Lite high | 1 | 8.4 | $0.540 | 2/3 | 16.6s | |
| #27 | Claude Opus 5 low | Anthropic | 1 | 7.8 | $1.121 | 2/3 | 6.70s |
| #28 | Gemini 3.6 Flash low | 1 | 7.8 | $0.251 | 2/3 | 6.95s | |
| #29 | Claude Opus 4.7 medium | Anthropic | 1 | 7.6 | $1.476 | 2/3 | 13.0s |
| #34 | Qwen3.6 Max Preview medium | Qwen | 1 | 8.8 | $1.132 | 2/3 | 146.5s |
| #35 | Qwen3.8 Max low | Qwen | 1 | 8.4 | $0.702 | 2/3 | 28.7s |
| #36 | GPT-5.4 medium | OpenAI | 1 | 8.8 | $1.560 | 2/3 | 44.4s |
| #37 | Grok 4.5 medium | X AI | 1 | 7.6 | $2.042 | 2/3 | 155.7s |
| #38 | Muse Spark 1.2 low | Meta | 1 | 8.4 | $0.655 | 2/3 | 10.1s |