- Rank
- #84
- Total Output Tokens
- 67,522
- Response Time (avg)
- 16.72s
- Total Cost
- $3.490
Claude Opus 4.8 (medium) vs Gemini 3.7 Flash (low)
Gemini 3.7 Flash (low) leads on average score with 9.4 vs 8.3. Gemini 3.7 Flash (low) has the lower benchmark cost at $0.183 vs $3.490. Gemini 3.7 Flash (low) is faster at 6.24s vs 16.72s, with pass rates of 82.6% vs 95.7%.
Compared models
- Rank
- #25
- Total Output Tokens
- 38,453
- Response Time (avg)
- 6.24s
- Total Cost
- $0.183
Recommended model
Gemini 3.7 Flash (low)
It has the best score here (9.4), while costing about 19.1x less than Claude Opus 4.8 (medium).
Detailed comparison
| Metric | Claude Opus 4.8 Claude Opus 4.8 medium | Gemini 3.7 Flash Gemini 3.7 Flash low |
|---|---|---|
| Score | 8.3 | 9.4 |
| Rank | #84 | #25 |
| Reliability | 10.0 | 10.0 |
| Consistency | 9.0 | 9.3 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 82.6% | 95.7% |
| Flaky tests | 3 | 2 |
| Total Runs | 69 | 69 |
| Cost per result | 20.527 | 0.868 |
| Total Cost | $3.490 | $0.183 |
| Input Price | $5.000 / 1M | $0.750 / 1M |
| Output Price | $25.000 / 1M | $3.750 / 1M |
| Cache Read Price | $0.500 / 1M | $0.075 / 1M |
| Cache Write Price | $6.250 / 1M | $0.042 / 1M |
| Total Input Tokens | 360,294 | 188,519 |
| Output Tokens | 43,441 | 7,694 |
| Reasoning Tokens | 24,401 | 30,759 |
| Response Time (avg) | 16.72s | 6.24s |
| Response Time (max) | 99.37s | 58.75s |
| Response Time (total) | 384.66s | 143.56s |
| Parameters | ~5T total (~500B active) | ~500B total (~20B active) |
| Availability | Closed | Closed |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#84 Claude Opus 4.8
medium- Cost
- $0.057
- Time
- 23.1s
- Tokens
- 2,412 tok
#25 Gemini 3.7 Flash
low- Cost
- $0.010
- Time
- 23.5s
- Tokens
- 5,210 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.1 | 3.1 | 66.7% | 1 | 99.37s | 221,846 | 2,676 | 13,239 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 58.75s | 98,197 | 1,400 | 0 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.95s | 834 | 1,179 | 478 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 1.54s | 492 | 99 | 1,398 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 15.33s | 10,590 | 9,945 | 1,381 | |
| Gemini 3.7 Flash | 7.6 | 7.2 | 77.8% | 1 | 6.20s | 8,118 | 461 | 11,508 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.9 | 10.0 | 100.0% | 0 | 54.29s | 101,005 | 19,531 | 4,762 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 13.00s | 66,250 | 4,873 | 8,108 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 7.1 | 5.6 | 83.3% | 1 | 12.29s | 10,503 | 481 | 312 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.15s | 7,548 | 278 | 1,093 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.6 | 7.2 | 22.2% | 1 | 18.11s | 972 | 7,476 | 2,987 | |
| Gemini 3.7 Flash | 8.2 | 7.2 | 88.9% | 1 | 3.09s | 642 | 12 | 3,029 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 2.46s | 708 | 237 | 0 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.76s | 486 | 81 | 1,043 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.32s | 909 | 373 | 320 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.47s | 615 | 72 | 1,778 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.95s | 894 | 791 | 483 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 1.92s | 558 | 166 | 1,580 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 8.96s | 11,775 | 301 | 225 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 4.10s | 5,457 | 241 | 160 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 6.14s | 258 | 451 | 214 | |
| Gemini 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.92s | 156 | 11 | 1,062 |
Quick Compare
Switch Comparison Pair
Claude Opus 5highvsGemini 3.7 FlashlowClaude Opus 5mediumvsGemini 3.7 FlashlowClaude Opus 4.8mediumvsGrok 4.5highClaude Opus 5.5highvsGemini 3.7 FlashlowClaude Opus 4.8mediumvsKimi K3maxClaude Opus 4.8mediumvsGemini 3.5 FlashhighClaude Opus 4.8mediumvsGPT-5.6 TerrahighClaude Opus 4.8mediumvsGLM 5.2highGemini 3.7 FlashlowvsGPT-5.6 SolhighGemini 3.7 FlashlowvsGPT-6 AstramediumClaude Opus 4.8mediumvsDeepSeek V4 Flash 0731highGemini 3.7 FlashlowvsGPT-5.6 Solmedium