Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Qwen: Qwen3.5 Plus 2026-02-15

Qwen3.5 Plus 2026-02-15 leidt in gemiddelde score met 6.4 vs 6.3. LongCat 2.0 heeft lagere benchmarkkosten met $0.044 vs $0.073. LongCat 2.0 is sneller met 5.18s vs 9.85s, met slagingspercentages van 36.4% vs 48.5%.

Aanbevolen modelLongCat 2.0De score blijft dicht bij de beste score hier (6.3 vs 6.4) en het kost ongeveer 1.7x minder dan Qwen3.5 Plus 2026-02-15.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-07-20

Metriek LongCat 2.0 LongCat 2.0 none Releasedatum: 2026-07-20 Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Releasedatum: 2026-02-15
Score 6.3 6.4
Rang #111 #107
Betrouwbaarheid 10.0 10.0
Consistentie 9.3 9.4
Correcte tests
Slaagpercentage per poging 36.4% 48.5%
Instabiele tests 2 2
Totaal runs 66 66
Kosten per resultaat 0.627 0.751
Totale kosten $0.044 $0.073
Invoerprijs $0.300 / 1M $0.260 / 1M
Uitvoerprijs $1.200 / 1M $1.560 / 1M
Totaal aantal invoer-tokens 108,743 102,646
Uitvoer-tokens 9,372 29,370
Redeneer-tokens 0 0
Responstijd (gem.) 5.18s 9.85s
Responstijd (max) 48.38s 123.00s
Responstijd (totaal) 113.95s 157.63s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 LongCat 2.0

none
Kosten
$0.027
Tijd
411.7s
Tokens
22,283 tok

#107 Qwen3.5 Plus 2026-02-15

none
Kosten
$0.012
Tijd
153.2s
Tokens
7,787 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Qwen3.5 Plus 2026-02-15 4.3 7.9 11.1% 1 2.05s 7,913 473 0

Snelle vergelijking

Vergelijkingspaar wisselen