نیویگیشن
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Qwen: Qwen3.5-35B-A3B

LongCat 2.0 average score میں آگے ہے: 6.3 vs 6.2. LongCat 2.0 کی benchmark لاگت کم ہے: $0.044 vs $0.837. LongCat 2.0 تیز ہے: 5.18s vs 112.47s، pass rates 36.4% vs 66.7%.

تجویز کردہ ماڈلLongCat 2.0It has the best score here (6.3), while costing about 19.1x less than Qwen3.5-35B-A3B (medium).

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-07-20

میٹرک LongCat 2.0 LongCat 2.0 none اجرا: 2026-07-20 Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium اجرا: 2026-02-24
اسکور 6.3 6.2
درجہ #111 #119
اعتماد پذیری 10.0 10.0
تسلسل 9.3 7.6
درست ٹیسٹس
فی کوشش کامیابی کی شرح 36.4% 66.7%
غیر مستحکم ٹیسٹ 2 6
کل رنز 66 66
فی نتیجہ لاگت 0.627 9.130
کل لاگت $0.044 $0.837
ان پٹ قیمت $0.300 / 1M $0.140 / 1M
آؤٹ پٹ قیمت $1.200 / 1M $1.000 / 1M
کل ان پٹ ٹوکنز 108,743 130,388
آؤٹ پٹ ٹوکنز 9,372 40,630
ریزننگ ٹوکنز 0 786,040
ردِعمل کا وقت (اوسط) 5.18s 112.47s
ردِعمل کا وقت (زیادہ سے زیادہ) 48.38s 950.25s
ردِعمل کا وقت (کل) 113.95s 2474.28s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 LongCat 2.0

none
لاگت
$0.027
وقت
411.7s
ٹوکنز
22,283 tok

#119 Qwen3.5-35B-A3B

medium
لاگت
$0.009
وقت
71.4s
ٹوکنز
8,631 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Qwen3.5-35B-A3B 5.9 9.3 33.3% 0 206.65s 4,106 23,844 111,462

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں