Combined: Invalid tool call
Combined
Invalid tool call
See which AI models are most likely to hit Invalid tool call on Combined, so you can spot weak points faster.
Failure Reasons
Categories
77/77
Filter models
No models match the current search and filters.
| Rank | Model | Company | Invalid tool call Count | Category Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #58 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $1.627 | 1/2 | 595.2s |
| #64 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.2 | $0.115 | 1/2 | 16.6s | |
| #65 | Gemini 3.1 Flash Lite medium | 1 | 7.2 | $0.117 | 1/2 | 18.5s | |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 1/2 | 66.2s |
| #68 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.036 | 1/2 | 458.6s |
| #69 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.3 | $0.482 | 1/2 | 106.7s |
| #72 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.046 | 1/2 | 313.5s |
| #75 | Grok 4.20 medium | X AI | 1 | 8.7 | $0.777 | 1/2 | 42.2s |
| #76 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.3 | $0.078 | 1/2 | 79.9s |
| #77 | Kimi K2.5 medium | Moonshot AI | 1 | 6.7 | $0.600 | 1/2 | 89.2s |
| #78 | Mercury 2 medium | Inception | 1 | 6.7 | $0.093 | 1/2 | 7.84s |
| #82 | DeepSeek V4 Pro none | DeepSeek | 1 | 7.9 | $0.096 | 1/2 | 71.6s |
| #84 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 6.9 | $0.187 | 1/2 | 125.4s |
| #85 | Qwen3.6 Flash medium | Qwen | 1 | 6.5 | $0.738 | 1/2 | 299.2s |
| #86 | Step 3.7 Flash high | Stepfun | 1 | 8.7 | $1.207 | 1/2 | 41.2s |