Resolución de acertijos: Formato extra
Resolución de acertijos
Formato extra
Mira qué modelos de IA tienen más probabilidades de caer en Formato extra dentro de Resolución de acertijos, para detectar puntos débiles más rápido.
Motivos de fallo
14/14
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de Formato extra | Puntuación de categoría | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #89 | Claude Opus 5 none | Anthropic | 1 | 7.7 | $1.550 | 2/3 | 3.66s |
| #108 | Claude Sonnet 4.6 none | Anthropic | 1 | 7.7 | $0.661 | 2/3 | 2.53s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.7 | $1.166 | 2/3 | 2.74s |
| #142 | Seed-2.0-Code medium | Bytedance Seed | 1 | 8.2 | $1.153 | 2/3 | 34.3s |
| #172 | LongCat 2.0 none | Meituan | 1 | 4.0 | $0.044 | 0/3 | 2.74s |
| #176 | Mimo V2 PRO medium | Xiaomi | 1 | 6.4 | $0.333 | 1/3 | 5.08s |
| #181 | Claude Sonnet 5 none | Anthropic | 1 | 6.0 | $0.548 | 1/3 | 3.22s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 1 | 3.1 | $0.037 | 0/3 | 23.7s |
| #236 | GPT-5.6 Luna none | OpenAI | 1 | 5.3 | $0.029 | 1/3 | 790ms |
| #239 | DeepSeek V4 Flash 0731 none | DeepSeek | 1 | 3.2 | $0.011 | 0/3 | 2.74s |
| #240 | Laguna S 2.1 high | Poolside | 1 | 2.9 | $0.114 | 0/3 | 1.62s |
| #248 | Inkling none | Thinkingmachines | 1 | 5.6 | $0.147 | 1/3 | 931ms |
| #261 | Laguna S 2.1 low | Poolside | 1 | 3.1 | $0.082 | 0/3 | 2.70s |
| #291 | Granite 4.2 8B none | IBM Granite | 1 | 3.0 | $0.026 | 0/3 | 107.6s |