- Rang
- #143
- Total tokenuri de ieșire
- 69,489
- Timp de răspuns (mediu)
- 17.13s
- Cost total
- $3.787
Claude Opus 4.8 (low) vs LongCat 2.0 (high)
LongCat 2.0 (high) conduce la scorul mediu cu 7.3 vs 7.2. LongCat 2.0 (high) are costul de benchmark mai mic, $0.569 vs $3.787. Claude Opus 4.8 (low) este mai rapid cu 17.13s vs 151.67s, cu rate de reușită de 78.3% vs 53.6%.
Modele comparate
- Rang
- #136
- Total tokenuri de ieșire
- 404,635
- Timp de răspuns (mediu)
- 151.67s
- Cost total
- $0.569
Model recomandat
Claude Opus 4.8 (low)
Scorul rămâne aproape de cel mai bun scor de aici (7.2 vs 7.3) și răspunde de aproximativ 8.9x mai rapid decât LongCat 2.0 (high).
Comparație detaliată
| Metrică | Claude Opus 4.8 Claude Opus 4.8 low | LongCat 2.0 LongCat 2.0 high |
|---|---|---|
| Scor | 7.2 | 7.3 |
| Rang | #143 | #136 |
| Fiabilitate | 10.0 | 10.0 |
| Consistență | 8.6 | 8.5 |
| Încercări | 69/69 | 69/69 |
| Teste corecte | ||
| Rată de trecere pe încercare | 78.3% | 53.6% |
| Teste instabile | 4 | 4 |
| Rulări totale | 69 | 69 |
| Cost per rezultat | 23.669 | 5.681 |
| Cost total | $3.787 | $0.569 |
| Preț de intrare | $5.000 / 1M | $0.300 / 1M |
| Preț de ieșire | $25.000 / 1M | $1.200 / 1M |
| Total tokenuri de intrare | 409,947 | 275,080 |
| Tokenuri de ieșire | 46,060 | 32,447 |
| Tokenuri de raționament | 23,429 | 372,188 |
| Timp de răspuns (mediu) | 17.13s | 151.67s |
| Timp de răspuns (maxim) | 127.97s | 941.66s |
| Timp de răspuns (total) | 394.01s | 3488.43s |
| Parametri | ~5T în total (~500B activi) | 1.6T în total (48B activi) |
| Disponibilitate | Închis | Sursă deschisă |
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#143 Claude Opus 4.8
low- Cost
- $0.031
- Timp
- 14.1s
- Tokenuri
- 1,345 tok
#136 LongCat 2.0
high
Reached the allocated time limit (600 seconds) without receiving showcase output.
- Cost
- $0.000
- Timp
- 600.0s
- Tokenuri
- 0 tok
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor vs Timp de răspuns (mediu)
Total tokenuri de ieșire
Scor vs Total tokenuri de ieșire
Defalcare pe categorii
| Sarcini agentice | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 4.7 | 3.1 | 33.3% | 1 | 110.68s | 253,425 | 3,004 | 14,248 | |
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 116.07s | 181,669 | 1,977 | 16,016 |
| Trucuri anti-AI | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.30s | 834 | 793 | 371 | |
| LongCat 2.0 | 8.9 | 8.1 | 91.7% | 1 | 7.76s | 588 | 303 | 3,300 |
| Programare | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.6 | 4.6 | 77.8% | 2 | 7.58s | 10,590 | 3,637 | 809 | |
| LongCat 2.0 | 7.8 | 9.3 | 66.7% | 0 | 505.33s | 6,913 | 244 | 192,377 |
| Combinat | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.9 | 10.0 | 100.0% | 0 | 36.87s | 119,079 | 13,586 | 2,867 | |
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 167.13s | 68,941 | 4,934 | 49,558 |
| Parsare și extragere de date | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.3 | 5.8 | 66.7% | 1 | 2.27s | 10,503 | 310 | 0 | |
| LongCat 2.0 | 3.6 | 5.8 | 33.3% | 1 | 10.98s | 7,653 | 197 | 2,714 |
| Specific domeniului | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.3 | 10.0 | 33.3% | 0 | 46.54s | 972 | 23,226 | 4,472 | |
| LongCat 2.0 | 3.6 | 7.2 | 22.2% | 1 | 433.73s | 505 | 23,928 | 86,947 |
| Inteligență generală | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 2.55s | 708 | 231 | 0 | |
| LongCat 2.0 | 5.1 | 10.0 | 0.0% | 0 | 17.00s | 480 | 111 | 1,748 |
| Respectarea instrucțiunilor | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.8 | 10.0 | 100.0% | 0 | 2.78s | 909 | 111 | 221 | |
| LongCat 2.0 | 6.5 | 10.0 | 50.0% | 0 | 6.96s | 657 | 78 | 1,726 |
| Rezolvare de puzzle-uri | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.01s | 894 | 592 | 184 | |
| LongCat 2.0 | 3.1 | 7.4 | 11.1% | 1 | 9.18s | 636 | 379 | 2,778 |
| Apelare instrumente | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 6.85s | 11,775 | 370 | 35 | |
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 10.02s | 6,840 | 249 | 505 |
| Cultură generală | Scor | Consistență | Rată de trecere pe încercare | Teste instabile | Teste corecte | Timp de răspuns (mediu) | Tokenuri de intrare | Tokenuri de ieșire | Tokenuri de raționament |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 5.48s | 258 | 200 | 222 | |
| LongCat 2.0 | 3.0 | 10.0 | 0.0% | 0 | 99.44s | 198 | 47 | 14,519 |
Comparație rapidă
Schimbă perechea de comparație
Gemini 2.5 FlashmediumvsLongCat 2.0highLongCat 2.0highvsQwen3.6 PlusmediumGemini 3.5 Flash LitemediumvsLongCat 2.0highClaude Opus 4.8lowvsQwen3.8 27BmediumDisponibil gratuitLongCat 2.0highvsGrok 4.7mediumClaude Opus 4.8lowvsQwen3.7 FlashhighClaude Opus 4.8lowvsQwen3.5 Plus 2026-02-15mediumClaude Fable 5.1mediumvsLongCat 2.0highClaude Opus 4.8lowvsLongCat 2.0mediumClaude Opus 4.8lowvsGLM 5mediumLongCat 2.0highvsQwen3.5-27BnoneClaude Opus 4.8lowvsQwen3.5-27Bnone