नेविगेशन
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs OpenAI: GPT-5.6 Luna

LongCat 2.0 average score में आगे है: 6.3 vs 6.2. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.249. GPT-5.6 Luna (low) तेज है: 5.04s vs 5.18s, pass rates 36.4% vs 56.1%.

अनुशंसित मॉडलLongCat 2.0It has the best score here (6.3), while costing about 5.7x less than GPT-5.6 Luna (low).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 GPT-5.6 Luna GPT-5.6 Luna low रिलीज़: 2026-07-09
स्कोर 6.3 6.2
रैंक #111 #117
विश्वसनीयता 10.0 10.0
संगति 9.3 8.2
सही परीक्षण
प्रति प्रयास पास दर 36.4% 56.1%
अस्थिर टेस्ट 2 5
कुल रन 66 66
प्रति परिणाम लागत 0.627 2.490
कुल लागत $0.044 $0.249
इनपुट कीमत $0.300 / 1M $1.000 / 1M
आउटपुट कीमत $1.200 / 1M $6.000 / 1M
कुल इनपुट टोकन 108,743 96,346
आउटपुट टोकन 9,372 8,211
रीजनिंग टोकन 0 17,227
प्रतिक्रिया समय (औसत) 5.18s 5.04s
प्रतिक्रिया समय (अधिकतम) 48.38s 19.44s
प्रतिक्रिया समय (कुल) 113.95s 110.88s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#117 GPT-5.6 Luna

low
लागत
$0.011
समय
10.2s
टोकन
1,897 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
GPT-5.6 Luna 5.5 10.0 33.3% 0 4.61s 7,302 557 3,535

त्वरित तुलना

तुलना जोड़ी बदलें