- Rank
- #29
- Total Output Tokens
- 32,127
- Response Time (avg)
- 25.85s
- Total Cost
- $1.804
Claude Opus 5.5 (medium) vs Gemini 3.5 Flash (low)
Claude Opus 5.5 (medium) leads on average score with 9.2 vs 9.0. Gemini 3.5 Flash (low) has the lower benchmark cost at $0.752 vs $1.804. Gemini 3.5 Flash (low) is faster at 7.85s vs 25.85s, with pass rates of 89.9% vs 85.5%.
Compared models
- Rank
- #39
- Total Output Tokens
- 42,730
- Response Time (avg)
- 7.85s
- Total Cost
- $0.752
Recommended model
Gemini 3.5 Flash (low)
Its score stays close to the best score here (9.0 vs 9.2), while costing about 2.4x less than Claude Opus 5.5 (medium).
Detailed comparison
| Metric | Claude Opus 5.5 Claude Opus 5.5 medium | Gemini 3.5 Flash Gemini 3.5 Flash low |
|---|---|---|
| Score | 9.2 | 9.0 |
| Rank | #29 | #39 |
| Reliability | 10.0 | 10.0 |
| Consistency | 9.7 | 9.4 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 89.9% | 85.5% |
| Flaky tests | 1 | 2 |
| Total Runs | 69 | 69 |
| Cost per result | 9.016 | 3.955 |
| Total Cost | $1.804 | $0.752 |
| Input Price | $4.000 / 1M | $1.500 / 1M |
| Output Price | $20.000 / 1M | $9.000 / 1M |
| Cache Read Price | $0.200 / 1M | $0.150 / 1M |
| Cache Write Price | $5.000 / 1M | $0.084 / 1M |
| Total Input Tokens | 290,117 | 244,533 |
| Output Tokens | 9,805 | 3,450 |
| Reasoning Tokens | 22,322 | 39,280 |
| Response Time (avg) | 25.85s | 7.85s |
| Response Time (max) | 90.20s | 53.74s |
| Response Time (total) | 594.63s | 180.45s |
| Parameters | ~5T total (~500B active) | ~500B total (~20B active) |
| Availability | Closed | Closed |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#29 Claude Opus 5.5
medium- Cost
- $0.053
- Time
- 25.6s
- Tokens
- 2,781 tok
#39 Gemini 3.5 Flash
low- Cost
- $0.068
- Time
- 39.1s
- Tokens
- 7,588 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 62.59s | 156,163 | 2,513 | 2,420 | |
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 53.74s | 156,707 | 1,211 | 6,324 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 12.42s | 858 | 321 | 657 | |
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.52s | 494 | 209 | 2,536 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 8.4 | 7.4 | 88.9% | 1 | 13.50s | 10,608 | 636 | 4,341 | |
| Gemini 3.5 Flash | 7.8 | 10.0 | 66.7% | 0 | 6.71s | 8,118 | 458 | 13,420 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 55.69s | 96,679 | 4,639 | 4,527 | |
| Gemini 3.5 Flash | 8.2 | 6.9 | 66.7% | 1 | 29.99s | 63,752 | 557 | 3,713 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 12.65s | 10,515 | 312 | 277 | |
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 1.81s | 7,548 | 279 | 1,164 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 7.7 | 10.0 | 66.7% | 0 | 21.35s | 990 | 61 | 8,360 | |
| Gemini 3.5 Flash | 5.3 | 7.2 | 44.4% | 1 | 4.89s | 642 | 12 | 6,312 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.17s | 714 | 273 | 326 | |
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.27s | 486 | 119 | 916 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 21.33s | 921 | 96 | 336 | |
| Gemini 3.5 Flash | 9.9 | 10.0 | 100.0% | 0 | 1.86s | 615 | 71 | 1,652 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 30.12s | 912 | 513 | 491 | |
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.35s | 558 | 288 | 2,150 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 74.20s | 11,757 | 441 | 587 | |
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.27s | 5,457 | 234 | 403 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 3.0 | 10.0 | 0.0% | 0 | 27.75s | 0 | 0 | 0 | |
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 1.88s | 156 | 12 | 690 |
Quick Compare
Switch Comparison Pair
Gemini 3.5 FlashlowvsQwen3.8 Max (0902)mediumGemini 3.5 FlashlowvsMuse Spark 1.3mediumClaude Opus 5.5mediumvsSeed 2.1 TurbolowClaude Opus 5.5mediumvsQwen3.8 Max (0902)highSeed 2.1 TurbohighvsGemini 3.5 FlashlowGemini 3.5 FlashlowvsParetodefaultGemini 3.5 FlashlowvsGLM 5.3 FlashmaxClaude Opus 5.5mediumvsMuse Spark 1.3highGemini 3.5 FlashlowvsMuse Spark 1.3highClaude Haiku 5.5xhighvsGemini 3.5 FlashlowGemini 3.5 FlashlowvsGPT-5.3-CodexmediumClaude Opus 5.5mediumvsParetodefault