- Rank
- #233
- Total Output Tokens
- 96,722
- Response Time (avg)
- 32.23s
- Total Cost
- $2.961
Claude Opus 4.6 (medium) vs Gemini 2.5 Flash (medium)
Gemini 2.5 Flash (medium) leads on average score with 7.3 vs 6.3. Gemini 2.5 Flash (medium) has the lower benchmark cost at $0.680 vs $2.961. Gemini 2.5 Flash (medium) is faster at 20.51s vs 32.23s, with pass rates of 60.9% vs 68.1%.
Compared models
- Rank
- #145
- Total Output Tokens
- 241,365
- Response Time (avg)
- 20.51s
- Total Cost
- $0.680
Recommended model
Gemini 2.5 Flash (medium)
It has the best score here (7.3), while costing about 4.4x less than Claude Opus 4.6 (medium).
Detailed comparison
| Metric | Claude Opus 4.6 Claude Opus 4.6 medium | Gemini 2.5 Flash Gemini 2.5 Flash medium |
|---|---|---|
| Score | 6.3 | 7.3 |
| Rank | #233 | #145 |
| Reliability | 10.0 | 10.0 |
| Consistency | 8.5 | 9.6 |
| Attempts | 66/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 60.9% | 68.1% |
| Flaky tests | 3 | 1 |
| Total Runs | 66 | 69 |
| Cost per result | 22.777 | 4.288 |
| Total Cost | $2.961 | $0.680 |
| Input Price | $5.000 / 1M | $0.300 / 1M |
| Output Price | $25.000 / 1M | $2.500 / 1M |
| Cache Read Price | $0.500 / 1M | $0.030 / 1M |
| Cache Write Price | $6.250 / 1M | $0.084 / 1M |
| Total Input Tokens | 108,573 | 132,507 |
| Output Tokens | 69,994 | 12,739 |
| Reasoning Tokens | 26,728 | 228,626 |
| Response Time (avg) | 32.23s | 20.51s |
| Response Time (max) | 151.51s | 140.50s |
| Response Time (total) | 515.65s | 471.64s |
| Parameters | ~5T total (~500B active) | ~350B total (~20B active) |
| Availability | Closed | Closed |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#233 Claude Opus 4.6
medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
- Cost
- $0.000
- Time
- 300.0s
- Tokens
- 0 tok
#145 Gemini 2.5 Flash
medium
No output was saved. The original provider response or failure reason is unavailable.
- Cost
- $0.000
- Time
- 274.0s
- Tokens
- 0 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 0.0 | 0.0 | 0.0% | 0 | 0ms | 0 | 0 | 0 | |
| Gemini 2.5 Flash | 3.0 | 10.0 | 0.0% | 0 | 6.54s | 0 | 0 | 0 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 6.4 | 5.8 | 66.7% | 2 | 7.45s | 840 | 986 | 1,071 | |
| Gemini 2.5 Flash | 8.4 | 10.0 | 75.0% | 0 | 6.30s | 492 | 255 | 10,233 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 5.7 | 7.1 | 44.4% | 1 | 30.10s | 8,522 | 13,057 | 4,121 | |
| Gemini 2.5 Flash | 7.8 | 10.0 | 66.7% | 0 | 41.01s | 6,669 | 543 | 32,303 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 10.0 | 10.0 | 100.0% | 0 | 114.08s | 76,073 | 33,018 | 9,509 | |
| Gemini 2.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 84.47s | 110,544 | 11,112 | 95,241 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 10.0 | 10.0 | 100.0% | 0 | 7.37s | 8,676 | 691 | 757 | |
| Gemini 2.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 4.06s | 7,257 | 279 | 2,325 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 3.0 | 10.0 | 0.0% | 0 | 42.53s | 632 | 12,350 | 7,100 | |
| Gemini 2.5 Flash | 5.9 | 7.2 | 55.6% | 1 | 37.07s | 642 | 18 | 80,864 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 10.0 | 10.0 | 100.0% | 0 | 5.04s | 564 | 188 | 292 | |
| Gemini 2.5 Flash | 4.8 | 10.0 | 0.0% | 0 | 4.86s | 486 | 92 | 1,899 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 10.0 | 10.0 | 100.0% | 0 | 2.43s | 792 | 266 | 467 | |
| Gemini 2.5 Flash | 9.8 | 10.0 | 100.0% | 0 | 2.62s | 615 | 69 | 1,203 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 7.7 | 10.0 | 66.7% | 0 | 4.71s | 816 | 532 | 630 | |
| Gemini 2.5 Flash | 7.7 | 10.0 | 66.7% | 0 | 3.18s | 558 | 126 | 2,499 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 10.0 | 10.0 | 100.0% | 0 | 9.73s | 11,454 | 861 | 329 | |
| Gemini 2.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 6.20s | 5,088 | 234 | 1,140 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | 3.0 | 10.0 | 0.0% | 0 | 63.24s | 204 | 8,045 | 2,452 | |
| Gemini 2.5 Flash | 3.0 | 10.0 | 0.0% | 0 | 2.76s | 156 | 11 | 919 |
Quick Compare
Switch Comparison Pair
Gemini 2.5 FlashmediumvsLongCat 2.0highGemini 2.5 FlashmediumvsGLM 5.3 FlashhighGemini 2.5 FlashmediumvsQwen3.5-27BnoneClaude Opus 4.8lowvsGemini 2.5 FlashmediumGemini 2.5 FlashmediumvsQwen3.7 FlashhighDeepSeek V4 Pro 0423nonevsGemini 2.5 FlashmediumGemini 2.5 FlashmediumvsStep 3.7 FlashlowGemini 2.5 FlashmediumvsInkling SmallhighFree AvailableGemini 2.5 FlashmediumvsGrok 4.7lowGemini 2.5 FlashmediumvsGLM 5.3 FlashXhighClaude Opus 5nonevsGemini 2.5 FlashmediumDeepSeek V4 Flash 0731lowvsGemini 2.5 Flashmedium