- Rank
- #217
- Total Output Tokens
- 69,435
- Response Time (avg)
- 18.33s
- Total Cost
- $0.226
Qwen3.5 Plus 2026-04-20 vs Grok 4.20 (medium)
Qwen3.5 Plus 2026-04-20 leads on average score with 6.3 vs 6.3. Qwen3.5 Plus 2026-04-20 has the lower benchmark cost at $0.226 vs $1.582. Qwen3.5 Plus 2026-04-20 is faster at 18.33s vs 36.73s, with pass rates of 44.9% vs 58.0%.
Compared models
- Rank
- #224
- Total Output Tokens
- 302,087
- Response Time (avg)
- 36.73s
- Total Cost
- $1.582
Recommended model
Qwen3.5 Plus 2026-04-20
It has the best score here (6.3), while costing about 7.0x less than Grok 4.20 (medium).
Detailed comparison
| Metric | Qwen3.5 Plus 2026-04-20 Qwen3.5 Plus 2026-04-20 none | Grok 4.20 Grok 4.20 medium |
|---|---|---|
| Score | 6.3 | 6.3 |
| Rank | #217 | #224 |
| Reliability | 10.0 | 10.0 |
| Consistency | 8.4 | 8.2 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 44.9% | 58.0% |
| Flaky tests | 5 | 5 |
| Total Runs | 69 | 69 |
| Cost per result | 2.822 | 14.374 |
| Total Cost | $0.226 | $1.582 |
| Input Price | $0.300 / 1M | $1.250 / 1M |
| Output Price | $1.800 / 1M | $2.500 / 1M |
| Total Input Tokens | 303,051 | 392,127 |
| Output Tokens | 69,435 | 7,754 |
| Reasoning Tokens | 0 | 294,333 |
| Response Time (avg) | 18.33s | 36.73s |
| Response Time (max) | 206.05s | 199.66s |
| Response Time (total) | 421.56s | 844.68s |
| Parameters | ~397B total (~17B active) | ~1T total (~100B active) |
| Availability | Closed | Closed |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#217 Qwen3.5 Plus 2026-04-20
none- Cost
- $0.008
- Time
- 77.0s
- Tokens
- 4,369 tok
#224 SpaceXAI: Grok 4.20
medium- Cost
- $0.041
- Time
- 110.3s
- Tokens
- 16,336 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 7.4 | 3.8 | 66.7% | 1 | 133.33s | 208,574 | 17,948 | 0 | |
| Grok 4.20 | 3.0 | 10.0 | 0.0% | 0 | 128.32s | 289,141 | 1,894 | 29,934 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 4.8 | 10.0 | 25.0% | 0 | 1.88s | 696 | 557 | 0 | |
| Grok 4.20 | 8.2 | 7.9 | 83.3% | 1 | 3.95s | 2,010 | 287 | 8,312 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 3.9 | 7.8 | 11.1% | 1 | 1.69s | 7,913 | 480 | 0 | |
| Grok 4.20 | 6.3 | 6.6 | 55.6% | 1 | 109.93s | 8,307 | 268 | 103,150 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 6.4 | 5.8 | 66.7% | 1 | 109.69s | 66,908 | 42,617 | 0 | |
| Grok 4.20 | 8.7 | 6.9 | 83.3% | 1 | 42.25s | 71,267 | 3,776 | 44,009 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 10.0 | 10.0 | 100.0% | 0 | 2.82s | 7,794 | 243 | 0 | |
| Grok 4.20 | 10.0 | 10.0 | 100.0% | 0 | 4.17s | 7,761 | 180 | 5,333 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 5.3 | 10.0 | 33.3% | 0 | 1.06s | 798 | 18 | 0 | |
| Grok 4.20 | 2.9 | 7.2 | 11.1% | 1 | 49.71s | 1,959 | 872 | 59,761 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 4.8 | 10.0 | 0.0% | 0 | 1.41s | 522 | 119 | 0 | |
| Grok 4.20 | 3.9 | 2.6 | 33.3% | 1 | 24.48s | 825 | 65 | 6,440 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 6.2 | 5.8 | 66.7% | 1 | 1.17s | 711 | 68 | 0 | |
| Grok 4.20 | 9.8 | 10.0 | 100.0% | 0 | 4.26s | 1,362 | 57 | 6,419 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 6.7 | 7.9 | 55.6% | 1 | 1.97s | 714 | 583 | 0 | |
| Grok 4.20 | 7.7 | 10.0 | 66.7% | 0 | 6.22s | 1,689 | 149 | 7,913 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 10.0 | 10.0 | 100.0% | 0 | 4.42s | 8,211 | 297 | 0 | |
| Grok 4.20 | 3.0 | 10.0 | 0.0% | 0 | 13.68s | 7,275 | 197 | 6,620 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5 Plus 2026-04-20 | 3.0 | 10.0 | 0.0% | 0 | 33.34s | 210 | 6,505 | 0 | |
| Grok 4.20 | 3.0 | 10.0 | 0.0% | 0 | 63.48s | 531 | 9 | 16,442 |
Quick Compare
Switch Comparison Pair
Gemini 3.1 Flash LitelowvsQwen3.5 Plus 2026-04-20noneDeepSeek V4 Flash 0423nonevsGrok 4.20mediumQwen3.5 Plus 2026-04-20nonevsSolar Pro 4highGemini 3.5 FlashnonevsGrok 4.20mediumGemini 3.1 Flash Lite PreviewlowvsQwen3.5 Plus 2026-04-20noneGemini 3.5 Flash LitelowvsQwen3.5 Plus 2026-04-20noneQwen3.5 Plus 2026-04-20nonevsSpace Bunny AlphamediumDeepSeek V3.2mediumvsQwen3.5 Plus 2026-04-20noneSpace Bunny AlphaxhighvsGrok 4.20mediumSolar Pro 4highvsGrok 4.20mediumGemini 3.1 Flash LitelowvsGrok 4.20mediumDots 3 Note PreviewlowFree AvailablevsQwen3.5 Plus 2026-04-20none