- Rank
- #283
- Total Output Tokens
- 23,173
- Response Time (avg)
- 4.56s
- Total Cost
- $0.019
Laguna XS 2.1 vs Step 3.5 Flash (medium)
Step 3.5 Flash (medium) leads on average score with 5.4 vs 5.3. Laguna XS 2.1 has the lower benchmark cost at $0.019 vs $0.105. Laguna XS 2.1 is faster at 4.56s vs 190.48s, with pass rates of 29.0% vs 49.3%.
Compared models
- Rank
- #276
- Total Output Tokens
- 607,130
- Response Time (avg)
- 190.48s
- Total Cost
- $0.105
Recommended model
Laguna XS 2.1
Its score stays close to the best score here (5.3 vs 5.4), while costing about 5.5x less than Step 3.5 Flash (medium).
Detailed comparison
| Metric | Laguna XS 2.1 Laguna XS 2.1 none Free Available | Step 3.5 Flash Step 3.5 Flash medium |
|---|---|---|
| Score | 5.3 | 5.4 |
| Rank | #283 | #276 |
| Reliability | 10.0 | 10.0 |
| Consistency | 9.1 | 8.3 |
| Attempts | 69/69 | 66/69 |
| Tests Correct | ||
| Attempt pass rate | 29.0% | 49.3% |
| Flaky tests | 3 | 3 |
| Total Runs | 69 | 66 |
| Cost per result | 0.380 | 1.047 |
| Total Cost | $0.019 | $0.105 |
| Input Price | $0.060 / 1M | $0.100 / 1M |
| Output Price | $0.120 / 1M | $0.300 / 1M |
| Total Input Tokens | 270,072 | 139,086 |
| Output Tokens | 23,173 | 193,584 |
| Reasoning Tokens | 0 | 413,546 |
| Response Time (avg) | 4.56s | 190.48s |
| Response Time (max) | 70.79s | 1597.85s |
| Response Time (total) | 104.80s | 3238.23s |
| Parameters | 33B total (3B active) | 196B total (11B active) |
| Availability | Weights available | Open source |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#283 Laguna XS 2.1
none- Cost
- $0.001
- Time
- 27.6s
- Tokens
- 4,344 tok
#276 Step 3.5 Flash
medium- Cost
- $0.008
- Time
- 277.1s
- Tokens
- 23,695 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 5.0 | 10.0 | 0.0% | 0 | 70.79s | 178,465 | 9,796 | 0 | |
| Step 3.5 Flash | 2.8 | 1.6 | 33.3% | 1 | 172.16s | 73,370 | 4,160 | 34,434 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 5.3 | 8.3 | 33.3% | 1 | 755ms | 774 | 1,015 | 0 | |
| Step 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 40.57s | 694 | 20,391 | 24,176 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 4.3 | 7.8 | 22.2% | 1 | 623ms | 7,995 | 562 | 0 | |
| Step 3.5 Flash | 2.4 | 5.2 | 0.0% | 0 | 258.38s | 2,211 | 13,207 | 22,429 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 3.0 | 10.0 | 0.0% | 0 | 10.39s | 64,647 | 10,328 | 0 | |
| Step 3.5 Flash | 6.5 | 10.0 | 50.0% | 0 | 813.71s | 44,914 | 18,150 | 111,004 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 10.0 | 10.0 | 100.0% | 0 | 768ms | 7,734 | 240 | 0 | |
| Step 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 15.01s | 7,368 | 600 | 13,886 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 5.3 | 10.0 | 33.3% | 0 | 303ms | 843 | 14 | 0 | |
| Step 3.5 Flash | 3.5 | 4.4 | 33.3% | 2 | 311.60s | 682 | 126,213 | 175,555 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 5.0 | 10.0 | 0.0% | 0 | 529ms | 537 | 128 | 0 | |
| Step 3.5 Flash | 5.5 | 10.0 | 0.0% | 0 | 22.39s | 509 | 240 | 3,506 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 3.8 | 5.8 | 33.3% | 1 | 364ms | 638 | 50 | 0 | |
| Step 3.5 Flash | 8.3 | 10.0 | 50.0% | 0 | 4.78s | 705 | 2,364 | 3,521 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 3.0 | 10.0 | 0.0% | 0 | 1.01s | 771 | 730 | 0 | |
| Step 3.5 Flash | 5.3 | 10.0 | 33.3% | 0 | 7.22s | 711 | 5,630 | 10,861 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 10.0 | 10.0 | 100.0% | 0 | 1.36s | 7,413 | 300 | 0 | |
| Step 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 11.91s | 7,701 | 275 | 3,802 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Laguna XS 2.1 | 3.0 | 10.0 | 0.0% | 0 | 254ms | 255 | 10 | 0 | |
| Step 3.5 Flash | 3.0 | 10.0 | 0.0% | 0 | 108.45s | 221 | 2,354 | 10,372 |
Quick Compare
Switch Comparison Pair
Step 3.5 FlashmediumvsMiMo-V2.6-FlashnoneEmber-1nonevsStep 3.5 FlashmediumStep 3.5 FlashmediumvsHy4 previewlowGPT-5.6 LunanonevsStep 3.5 FlashmediumGranite 4.2 8BlowvsStep 3.5 FlashmediumGranite 4.2 8BlowvsLaguna XS 2.1noneFree AvailableLaguna XS 2.1noneFree AvailablevsInkling SmalllowFree AvailableKimi K2.5nonevsStep 3.5 FlashmediumQwen3.8 27BnoneFree AvailablevsStep 3.5 FlashmediumNemotron 3.5 LightninghighFree AvailablevsLaguna XS 2.1noneFree AvailableSeed-2.0-CodenonevsStep 3.5 FlashmediumKAT Coder AIR V2.5highvsLaguna XS 2.1noneFree Available