- Rank
- #143
- Total Output Tokens
- 69,489
- Response Time (avg)
- 17.13s
- Total Cost
- $3.787
Claude Opus 4.8 (low) vs Gemini 2.5 Flash (medium)
Gemini 2.5 Flash (medium) leads on average score with 7.3 vs 7.2. Gemini 2.5 Flash (medium) has the lower benchmark cost at $0.644 vs $3.787. Claude Opus 4.8 (low) is faster at 17.13s vs 20.51s, with pass rates of 78.3% vs 68.1%.
Compared models
- Rank
- #135
- Total Output Tokens
- 241,365
- Response Time (avg)
- 20.51s
- Total Cost
- $0.644
Recommended model
Gemini 2.5 Flash (medium)
It has the best score here (7.3), while costing about 5.9x less than Claude Opus 4.8 (low).
Detailed comparison
| Metric | Claude Opus 4.8 Claude Opus 4.8 low | Gemini 2.5 Flash Gemini 2.5 Flash medium |
|---|---|---|
| Score | 7.2 | 7.3 |
| Rank | #143 | #135 |
| Reliability | 10.0 | 10.0 |
| Consistency | 8.6 | 9.6 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 78.3% | 68.1% |
| Flaky tests | 4 | 1 |
| Total Runs | 69 | 69 |
| Cost per result | 23.669 | 4.288 |
| Total Cost | $3.787 | $0.644 |
| Input Price | $5.000 / 1M | $0.300 / 1M |
| Output Price | $25.000 / 1M | $2.500 / 1M |
| Total Input Tokens | 409,947 | 132,507 |
| Output Tokens | 46,060 | 12,739 |
| Reasoning Tokens | 23,429 | 228,626 |
| Response Time (avg) | 17.13s | 20.51s |
| Response Time (max) | 127.97s | 140.50s |
| Response Time (total) | 394.01s | 471.64s |
| Parameters | ~5T total (~500B active) | ~350B total (~20B active) |
| Availability | Closed | Closed |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#143 Claude Opus 4.8
low- Cost
- $0.031
- Time
- 14.1s
- Tokens
- 1,345 tok
#135 Gemini 2.5 Flash
medium
No output was saved. The original provider response or failure reason is unavailable.
- Cost
- $0.000
- Time
- 274.0s
- Tokens
- 0 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 4.7 | 3.1 | 33.3% | 1 | 110.68s | 253,425 | 3,004 | 14,248 | |
| Gemini 2.5 Flash | 3.0 | 10.0 | 0.0% | 0 | 6.54s | 0 | 0 | 0 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.30s | 834 | 793 | 371 | |
| Gemini 2.5 Flash | 8.4 | 10.0 | 75.0% | 0 | 6.30s | 492 | 255 | 10,233 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.6 | 4.6 | 77.8% | 2 | 7.58s | 10,590 | 3,637 | 809 | |
| Gemini 2.5 Flash | 7.8 | 10.0 | 66.7% | 0 | 41.01s | 6,669 | 543 | 32,303 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.9 | 10.0 | 100.0% | 0 | 36.87s | 119,079 | 13,586 | 2,867 | |
| Gemini 2.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 84.47s | 110,544 | 11,112 | 95,241 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.3 | 5.8 | 66.7% | 1 | 2.27s | 10,503 | 310 | 0 | |
| Gemini 2.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 4.06s | 7,257 | 279 | 2,325 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.3 | 10.0 | 33.3% | 0 | 46.54s | 972 | 23,226 | 4,472 | |
| Gemini 2.5 Flash | 5.9 | 7.2 | 55.6% | 1 | 37.07s | 642 | 18 | 80,864 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 2.55s | 708 | 231 | 0 | |
| Gemini 2.5 Flash | 4.8 | 10.0 | 0.0% | 0 | 4.86s | 486 | 92 | 1,899 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.8 | 10.0 | 100.0% | 0 | 2.78s | 909 | 111 | 221 | |
| Gemini 2.5 Flash | 9.8 | 10.0 | 100.0% | 0 | 2.62s | 615 | 69 | 1,203 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.01s | 894 | 592 | 184 | |
| Gemini 2.5 Flash | 7.7 | 10.0 | 66.7% | 0 | 3.18s | 558 | 126 | 2,499 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 6.85s | 11,775 | 370 | 35 | |
| Gemini 2.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 6.20s | 5,088 | 234 | 1,140 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 5.48s | 258 | 200 | 222 | |
| Gemini 2.5 Flash | 3.0 | 10.0 | 0.0% | 0 | 2.76s | 156 | 11 | 919 |
Quick Compare
Switch Comparison Pair
Gemini 2.5 FlashmediumvsLongCat 2.0highClaude Opus 4.8lowvsQwen3.8 27BmediumFree AvailableClaude Opus 4.8lowvsQwen3.7 FlashhighClaude Opus 4.8lowvsQwen3.5 Plus 2026-02-15mediumClaude Opus 4.8lowvsLongCat 2.0mediumClaude Opus 4.8lowvsGLM 5mediumGemini 2.5 FlashmediumvsGLM 5.3 FlashhighGemini 2.5 FlashmediumvsQwen3.5-27BnoneClaude Opus 4.8lowvsQwen3.5-27BnoneClaude Opus 4.8lowvsQwen3.6 27BmediumClaude Opus 4.8lowvsGemini 3.5 Flash LitemediumClaude Opus 4.8lowvsQwen3.6 Plusmedium