नेविगेशन
AI BENCHY
Advertise here

Poolside: Laguna S 2.1 vs Qwen: Qwen3.5-9B

Laguna S 2.1 (high) average score में आगे है: 5.4 vs 5.1. Qwen3.5-9B की benchmark लागत कम है: $0.021 vs $0.127. Qwen3.5-9B तेज है: 19.17s vs 111.61s, pass rates 27.3% vs 19.7%.

अनुशंसित मॉडलQwen3.5-9BIts score stays close to the best score here (5.1 vs 5.4), while costing about 6.3x less than Laguna S 2.1 (high).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-22

मेट्रिक Laguna S 2.1 Laguna S 2.1 high रिलीज़: 2026-07-21 निःशुल्क उपलब्ध Qwen3.5-9B Qwen3.5-9B none रिलीज़: 2026-03-02
स्कोर 5.4 5.1
रैंक #167 #177
विश्वसनीयता 9.9 10.0
संगति 8.1 9.7
सही परीक्षण
प्रति प्रयास पास दर 27.3% 19.7%
अस्थिर टेस्ट 5 1
कुल रन 66 66
प्रति परिणाम लागत 3.153 0.490
कुल लागत $0.127 $0.021
इनपुट कीमत $0.100 / 1M $0.100 / 1M
आउटपुट कीमत $0.200 / 1M $0.150 / 1M
कुल इनपुट टोकन 208,931 144,407
आउटपुट टोकन 175,588 37,484
रीजनिंग टोकन 409,276 0
प्रतिक्रिया समय (औसत) 111.61s 19.17s
प्रतिक्रिया समय (अधिकतम) 1190.11s 382.06s
प्रतिक्रिया समय (कुल) 2455.39s 421.74s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#167 Laguna S 2.1

high
लागत
$0.001
समय
6.8s
टोकन
1,389 tok

#177 Qwen3.5-9B

none
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Laguna S 2.1 5.3 7.2 44.4% 1 271.42s 6,496 59,355 151,009
Qwen3.5-9B 3.9 7.8 11.1% 1 5.60s 7,913 1,042 0

त्वरित तुलना

तुलना जोड़ी बदलें