- Rank
- #80
- Total Output Tokens
- 105,640
- Response Time (avg)
- 10.41s
- Total Cost
- $0.088
Claude Haiku 5.5 (high) vs Gemini 3.1 Pro Preview (medium)
Gemini 3.1 Pro Preview (medium) leads on average score with 8.4 vs 8.3. Claude Haiku 5.5 (high) has the lower benchmark cost at $0.088 vs $1.585. Claude Haiku 5.5 (high) is faster at 10.41s vs 22.71s, with pass rates of 76.8% vs 89.9%.
Compared models
- Rank
- #74
- Total Output Tokens
- 102,691
- Response Time (avg)
- 22.71s
- Total Cost
- $1.585
Recommended model
Claude Haiku 5.5 (high)
Its score stays close to the best score here (8.3 vs 8.4), while costing about 18.1x less than Gemini 3.1 Pro Preview (medium).
Detailed comparison
| Metric | Claude Haiku 5.5 Claude Haiku 5.5 high | Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium |
|---|---|---|
| Score | 8.3 | 8.4 |
| Rank | #80 | #74 |
| Reliability | 10.0 | 9.8 |
| Consistency | 8.5 | 9.6 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 76.8% | 89.9% |
| Flaky tests | 4 | 1 |
| Total Runs | 69 | 69 |
| Cost per result | 0.584 | 7.924 |
| Total Cost | $0.088 | $1.585 |
| Input Price | $0.100 / 1M | $2.000 / 1M |
| Output Price | $0.500 / 1M | $12.000 / 1M |
| Cache Read Price | $0.010 / 1M | $0.200 / 1M |
| Cache Write Price | $0.125 / 1M | $0.375 / 1M |
| Total Input Tokens | 346,451 | 176,208 |
| Output Tokens | 10,136 | 6,093 |
| Reasoning Tokens | 95,504 | 96,598 |
| Response Time (avg) | 10.41s | 22.71s |
| Response Time (max) | 52.61s | 88.68s |
| Response Time (total) | 239.38s | 386.11s |
| Parameters | ~50B | ~1.2T total (~20B active) |
| Availability | Closed | Closed |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#80 Claude Haiku 5.5
high- Cost
- $0.003
- Time
- 28.0s
- Tokens
- 5,775 tok
#74 Gemini 3.1 Pro Preview
medium- Cost
- $0.115
- Time
- 87.2s
- Tokens
- 9,629 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 52.61s | 206,189 | 2,382 | 10,134 | |
| Gemini 3.1 Pro Preview | 4.7 | 1.6 | 66.7% | 1 | 56.17s | 83,912 | 861 | 4,592 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 2.70s | 858 | 551 | 2,399 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 7.90s | 498 | 112 | 3,218 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 6.0 | 7.2 | 55.6% | 1 | 9.54s | 10,608 | 503 | 16,741 | |
| Gemini 3.1 Pro Preview | 7.9 | 9.9 | 66.7% | 0 | 40.17s | 8,124 | 435 | 41,247 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 30.00s | 102,723 | 4,896 | 29,883 | |
| Gemini 3.1 Pro Preview | 9.8 | 10.0 | 100.0% | 0 | 40.39s | 67,910 | 3,687 | 23,111 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 3.77s | 10,515 | 312 | 2,031 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 7.72s | 7,265 | 279 | 3,904 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 4.1 | 4.4 | 44.5% | 2 | 16.29s | 990 | 65 | 25,349 | |
| Gemini 3.1 Pro Preview | 7.7 | 10.0 | 66.7% | 0 | 20.29s | 644 | 18 | 11,704 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 4.89s | 714 | 208 | 1,603 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 11.77s | 490 | 108 | 1,179 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 9.9 | 10.0 | 100.0% | 0 | 3.19s | 921 | 99 | 1,723 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 9.56s | 621 | 72 | 2,236 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 5.9 | 7.2 | 55.6% | 1 | 3.28s | 912 | 615 | 3,202 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 6.90s | 570 | 235 | 3,128 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 5.34s | 11,757 | 354 | 849 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 23.15s | 6,018 | 274 | 982 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 3.0 | 10.0 | 0.0% | 0 | 4.49s | 264 | 151 | 1,590 | |
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 6.27s | 156 | 12 | 1,297 |
Quick Compare
Switch Comparison Pair
Claude Haiku 5.5highvsKimi K3maxGemini 3.1 Pro PreviewmediumvsInklinghighFree AvailableGemini 3.1 Pro PreviewmediumvsMuse Glimmer 30BxhighGemini 3.1 Pro PreviewmediumvsMuse Spark 1.1highGemini 3.1 Pro PreviewmediumvsQwen3.8 2.4T A95BlowDeepSeek V4 Flash 0731highvsGemini 3.1 Pro PreviewmediumClaude Haiku 5.5highvsGPT-6 LunamediumGemini 3.1 Pro PreviewmediumvsGLM 5.2highClaude Haiku 5.5highvsLing 3.1 FlashmediumClaude Haiku 5.5highvsQwen3.7 PlusmediumClaude Haiku 5.5maxvsGemini 3.1 Pro PreviewmediumClaude Haiku 5.5highvsGLM 5.2medium