- Rank
- #70
- Total Output Tokens
- 919,699
- Response Time (avg)
- 61.71s
- Total Cost
- $0.509
Claude Haiku 5.5 (max) vs Gemini 3.1 Pro Preview (medium)
Claude Haiku 5.5 (max) leads on average score with 8.5 vs 8.4. Claude Haiku 5.5 (max) has the lower benchmark cost at $0.509 vs $1.585. Gemini 3.1 Pro Preview (medium) is faster at 22.71s vs 61.71s, with pass rates of 85.5% vs 89.9%.
Compared models
- Rank
- #74
- Total Output Tokens
- 102,691
- Response Time (avg)
- 22.71s
- Total Cost
- $1.585
Recommended model
Claude Haiku 5.5 (max)
It has the best score here (8.5), while costing about 3.1x less than Gemini 3.1 Pro Preview (medium).
Detailed comparison
| Metric | Claude Haiku 5.5 Claude Haiku 5.5 max | Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium |
|---|---|---|
| Score | 8.5 | 8.4 |
| Rank | #70 | #74 |
| Reliability | 10.0 | 9.8 |
| Consistency | 9.6 | 9.6 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 85.5% | 89.9% |
| Flaky tests | 1 | 1 |
| Total Runs | 69 | 69 |
| Cost per result | 2.677 | 7.924 |
| Total Cost | $0.509 | $1.585 |
| Input Price | $0.100 / 1M | $2.000 / 1M |
| Output Price | $0.500 / 1M | $12.000 / 1M |
| Cache Read Price | $0.010 / 1M | $0.200 / 1M |
| Cache Write Price | $0.125 / 1M | $0.375 / 1M |
| Total Input Tokens | 487,516 | 176,208 |
| Output Tokens | 10,212 | 6,093 |
| Reasoning Tokens | 909,487 | 96,598 |
| Response Time (avg) | 61.71s | 22.71s |
| Response Time (max) | 288.94s | 88.68s |
| Response Time (total) | 1419.40s | 386.11s |
| Parameters | ~50B | ~1.2T total (~20B active) |
| Availability | Closed | Closed |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#70 Claude Haiku 5.5
max
OpenRouter returned no showcase content (finish_reason: error).
- Cost
- $0.000
- Time
- 164.5s
- Tokens
- 0 tok
#74 Gemini 3.1 Pro Preview
medium- Cost
- $0.115
- Time
- 87.2s
- Tokens
- 9,629 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 4.7 | 1.6 | 66.7% | 1 | 93.30s | 349,997 | 2,345 | 42,315 | |
| Gemini 3.1 Pro Preview | 4.7 | 1.6 | 66.7% | 1 | 56.17s | 83,912 | 861 | 4,592 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 5.52s | 858 | 401 | 10,159 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 7.90s | 498 | 112 | 3,218 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 55.87s | 10,608 | 532 | 125,988 | |
| Gemini 3.1 Pro Preview | 7.9 | 9.9 | 66.7% | 0 | 40.17s | 8,124 | 435 | 41,247 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 148.38s | 99,980 | 4,909 | 215,518 | |
| Gemini 3.1 Pro Preview | 9.8 | 10.0 | 100.0% | 0 | 40.39s | 67,910 | 3,687 | 23,111 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 11.11s | 10,515 | 311 | 13,476 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 7.72s | 7,265 | 279 | 3,904 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 5.3 | 10.0 | 33.3% | 0 | 228.16s | 990 | 18 | 426,269 | |
| Gemini 3.1 Pro Preview | 7.7 | 10.0 | 66.7% | 0 | 20.29s | 644 | 18 | 11,704 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 42.22s | 714 | 250 | 26,083 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 11.77s | 490 | 108 | 1,179 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.22s | 921 | 99 | 5,965 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 9.56s | 621 | 72 | 2,236 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 16.54s | 912 | 716 | 29,419 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 6.90s | 570 | 235 | 3,128 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 9.86s | 11,757 | 355 | 3,989 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 23.15s | 6,018 | 274 | 982 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 3.0 | 10.0 | 0.0% | 0 | 18.80s | 264 | 276 | 10,306 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 6.27s | 156 | 12 | 1,297 |
Quick Compare
Switch Comparison Pair
Gemini 3.1 Pro PreviewmediumvsInklinghighFree AvailableGemini 3.1 Pro PreviewmediumvsMuse Glimmer 30BxhighGemini 3.1 Pro PreviewmediumvsMuse Spark 1.1highClaude Haiku 5.5maxvsQwen3.7 MaxmediumGemini 3.1 Pro PreviewmediumvsQwen3.8 2.4T A95BlowClaude Haiku 5.5maxvsMuse Spark 1.3lowDeepSeek V4 Flash 0731highvsGemini 3.1 Pro PreviewmediumClaude Haiku 5.5maxvsGrok 4.6highClaude Haiku 5.5maxvsQwen3.8 2.4T A95BlowGemini 3.1 Pro PreviewmediumvsGLM 5.2highClaude Haiku 5.5maxvsGPT-5 MinimediumClaude Haiku 5.5maxvsMuse Glimmer 30Bxhigh