नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Poolside: Laguna S 2.1 vs Qwen: Qwen3.5-9B

Laguna S 2.1 (medium) average score में आगे है: 5.4 vs 5.1. Qwen3.5-9B की benchmark लागत कम है: $0.021 vs $0.059. Qwen3.5-9B तेज है: 19.17s vs 58.43s, pass rates 25.8% vs 19.7%.

अनुशंसित मॉडलQwen3.5-9BIts score stays close to the best score here (5.1 vs 5.4), while costing about 2.9x less than Laguna S 2.1 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-22

मेट्रिक Laguna S 2.1 Laguna S 2.1 medium रिलीज़: 2026-07-21 निःशुल्क उपलब्ध Qwen3.5-9B Qwen3.5-9B none रिलीज़: 2026-03-02
स्कोर 5.4 5.1
रैंक #164 #177
विश्वसनीयता 9.8 10.0
संगति 8.4 9.7
सही परीक्षण
प्रति प्रयास पास दर 25.8% 19.7%
अस्थिर टेस्ट 4 1
कुल रन 66 66
प्रति परिणाम लागत 1.451 0.490
कुल लागत $0.059 $0.021
इनपुट कीमत $0.100 / 1M $0.100 / 1M
आउटपुट कीमत $0.200 / 1M $0.150 / 1M
कुल इनपुट टोकन 86,641 144,407
आउटपुट टोकन 97,298 37,484
रीजनिंग टोकन 242,297 0
प्रतिक्रिया समय (औसत) 58.43s 19.17s
प्रतिक्रिया समय (अधिकतम) 560.31s 382.06s
प्रतिक्रिया समय (कुल) 1285.48s 421.74s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#164 Laguna S 2.1

medium
लागत
$0.001
समय
4.0s
टोकन
867 tok

#177 Qwen3.5-9B

none
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Laguna S 2.1 5.3 7.2 44.4% 1 158.98s 7,917 93,354 106,718
Qwen3.5-9B 3.9 7.8 11.1% 1 5.60s 7,913 1,042 0

त्वरित तुलना

तुलना जोड़ी बदलें