Domain specific: Extra formatting
Domain specific
Extra formatting
See which AI models are most likely to hit Extra formatting on Domain specific, so you can spot weak points faster.
Failure Reasons
18/18
Filter models
No models match the current search and filters.
| Rank | Model | Company | Extra formatting Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #121 | GLM 5.3 high | Z.ai | 2 | 2.9 | $0.403 | 0/3 | 112.3s |
| #145 | Grok 4.20 medium | X AI | 2 | 2.9 | $0.805 | 0/3 | 49.7s |
| #160 | MiMo-V2.5-Pro medium | Xiaomi | 2 | 2.9 | $0.221 | 0/3 | 146.1s |
| #234 | KAT-Coder-Air V2.5 high | Kwaipilot | 2 | 3.0 | $0.077 | 0/3 | 7.28s |
| #250 | KAT-Coder-Air V2.5 low | Kwaipilot | 2 | 3.0 | $0.046 | 0/3 | 8.91s |
| #20 | Claude Opus 5 high | Anthropic | 1 | 3.0 | $3.070 | 0/3 | 104.2s |
| #42 | GLM 5.3 Flash max | Z.ai | 1 | 3.6 | $0.117 | 0/3 | 203.3s |
| #72 | Muse Spark 1.1 high | Meta | 1 | 2.9 | $2.253 | 0/3 | 94.7s |
| #87 | Claude Sonnet 4.6 medium | Anthropic | 1 | 3.0 | $2.126 | 0/3 | 58.4s |
| #94 | Claude Opus 4.6 medium | Anthropic | 1 | 3.0 | $2.961 | 0/3 | 42.5s |
| #110 | Grok Build 0.1 medium | X AI | 1 | 2.9 | $1.130 | 0/3 | 175.9s |
| #123 | GLM 5.3 Flash high | Z.ai | 1 | 3.0 | $0.057 | 0/3 | 85.9s |
| #179 | Qwen3.6 27B medium | Qwen | 1 | 2.9 | $0.577 | 0/3 | 71.5s |
| #187 | MiMo-V2.5 medium | Xiaomi | 1 | 3.6 | $0.104 | 0/3 | 137.7s |
| #218 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/3 | 47.9s |