- Rank
- #167
- Total Output Tokens
- 24,343
- Response Time (avg)
- 7.54s
- Total Cost
- $2.334
Claude Opus 4.8 vs Kimi K2.7 Code (medium)
Kimi K2.7 Code (medium) leads on average score with 7.0 vs 6.9. Kimi K2.7 Code (medium) has the lower benchmark cost at $0.861 vs $2.334. Claude Opus 4.8 is faster at 7.54s vs 81.18s, with pass rates of 60.9% vs 60.9%.
Compared models
- Rank
- #156
- Total Output Tokens
- 259,318
- Response Time (avg)
- 81.18s
- Total Cost
- $0.861
Recommended model
Claude Opus 4.8
Its score stays close to the best score here (6.9 vs 7.0), while responding about 10.8x faster than Kimi K2.7 Code (medium).
Detailed comparison
| Metric | Claude Opus 4.8 Claude Opus 4.8 none | Kimi K2.7 Code Kimi K2.7 Code medium |
|---|---|---|
| Score | 6.9 | 7.0 |
| Rank | #167 | #156 |
| Reliability | 10.0 | 10.0 |
| Consistency | 9.3 | 8.1 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 60.9% | 60.9% |
| Flaky tests | 2 | 5 |
| Total Runs | 69 | 69 |
| Cost per result | 17.953 | 8.755 |
| Total Cost | $2.334 | $0.861 |
| Input Price | $5.000 / 1M | $0.672 / 1M |
| Output Price | $25.000 / 1M | $3.350 / 1M |
| Total Input Tokens | 345,059 | 245,179 |
| Output Tokens | 24,343 | 62,697 |
| Reasoning Tokens | 0 | 196,621 |
| Response Time (avg) | 7.54s | 81.18s |
| Response Time (max) | 65.07s | 365.80s |
| Response Time (total) | 173.31s | 1785.87s |
| Parameters | ~5T total (~500B active) | 1T total (32B active) |
| Availability | Closed | Weights available |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#167 Claude Opus 4.8
none- Cost
- $0.053
- Time
- 22.0s
- Tokens
- 2,253 tok
#156 MoonshotAI: Kimi K2.7 Code
medium- Cost
- $0.025
- Time
- 138.0s
- Tokens
- 6,093 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.0 | 10.0 | 0.0% | 0 | 65.07s | 195,856 | 7,546 | 0 | |
| Kimi K2.7 Code | 5.0 | 10.0 | 0.0% | 0 | 104.02s | 173,094 | 5,244 | 14,528 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.5 | 10.0 | 50.0% | 0 | 3.40s | 834 | 1,472 | 0 | |
| Kimi K2.7 Code | 7.3 | 5.8 | 83.3% | 2 | 11.56s | 618 | 3,048 | 5,041 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.5 | 10.0 | 33.3% | 0 | 3.29s | 10,590 | 1,332 | 0 | |
| Kimi K2.7 Code | 7.8 | 9.3 | 66.7% | 0 | 146.73s | 4,650 | 1,864 | 25,635 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.8 | 10.0 | 100.0% | 0 | 26.38s | 111,760 | 11,949 | 0 | |
| Kimi K2.7 Code | 7.3 | 5.8 | 83.3% | 1 | 66.03s | 57,353 | 3,642 | 21,308 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 7.3 | 5.8 | 83.3% | 1 | 1.77s | 10,503 | 308 | 0 | |
| Kimi K2.7 Code | 10.0 | 10.0 | 100.0% | 0 | 12.27s | 7,014 | 248 | 2,569 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.3 | 7.2 | 44.4% | 1 | 1.76s | 972 | 61 | 0 | |
| Kimi K2.7 Code | 3.7 | 6.5 | 22.2% | 1 | 184.17s | 443 | 29,311 | 66,939 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.48s | 708 | 230 | 0 | |
| Kimi K2.7 Code | 10.0 | 10.0 | 100.0% | 0 | 10.78s | 477 | 1,024 | 1,071 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.9 | 10.0 | 100.0% | 0 | 1.37s | 909 | 95 | 0 | |
| Kimi K2.7 Code | 9.9 | 10.0 | 100.0% | 0 | 5.39s | 669 | 725 | 1,232 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 7.7 | 10.0 | 66.7% | 0 | 2.74s | 894 | 783 | 0 | |
| Kimi K2.7 Code | 5.9 | 7.7 | 44.4% | 1 | 41.00s | 651 | 15,438 | 17,368 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 5.35s | 11,775 | 355 | 0 | |
| Kimi K2.7 Code | 3.0 | 10.0 | 0.0% | 0 | 0ms | 0 | 0 | 0 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 3.41s | 258 | 212 | 0 | |
| Kimi K2.7 Code | 3.0 | 10.0 | 0.0% | 0 | 341.76s | 210 | 2,153 | 40,930 |
Quick Compare
Switch Comparison Pair
Claude Opus 4.8nonevsGPT-5.6 LunalowClaude Opus 4.8nonevsGemma 4 31BmediumFree AvailableEmber-1lowvsKimi K2.7 CodemediumClaude Opus 4.8nonevsEmber-1highClaude Opus 4.8nonevsKimi K2.6mediumKimi K2.7 CodemediumvsGPT-5.2 ChatnoneClaude Opus 4.8nonevsGemini 3.1 Flash LitemediumClaude Opus 4.8nonevsQwen3.5-FlashmediumClaude Opus 4.8nonevsInklinglowFree AvailableClaude Opus 4.8nonevsMercury 2.5 PreviewmediumKimi K2.7 CodemediumvsGrok 4.6lowGemini 3 Flash PreviewlowvsKimi K2.7 Codemedium