नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY तुलना

Inception: Mercury 2 vs Qwen: Qwen3.5-9B

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-03-12

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 Qwen3.5-9B Qwen3.5-9B none रिलीज़: 2026-03-02
रैंक #40 #60
औसत स्कोर 5.3 3.4
संगति 8.4 10.0
प्रति परिणाम लागत 0.631 0.111
कुल लागत $0.045 $0.005
सही परीक्षण
प्रति प्रयास पास दर 54.2% 25.0%
अस्थिर टेस्ट 3 0
कुल रन 48 48
आउटपुट टोकन 3,708 2,939
रीजनिंग टोकन 45,921 0
प्रतिक्रिया समय (औसत) 2.36s 1.06s
प्रतिक्रिया समय (अधिकतम) 14.63s 5.91s
प्रतिक्रिया समय (कुल) 35.39s 16.95s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

औसत स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

औसत स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Mercury 2 7.3 9.8 66.7% 0 1.30s 2,531 2,410
Qwen3.5-9B 10.0 9.9 0.0% 0 1.02s 576 0
संयुक्त स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Mercury 2 10.0 10.0 100.0% 0 3.28s 268 4,887
Qwen3.5-9B 10.0 10.0 0.0% 0 5.91s 1,255 0
डेटा पार्सिंग और निष्कर्षण स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Mercury 2 5.5 5.9 83.3% 1 1.11s 183 1,656
Qwen3.5-9B 9.9 10.0 100.0% 0 847ms 249 0
डोमेन-विशिष्ट स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Mercury 2 10.0 7.2 11.1% 1 6.48s 41 30,754
Qwen3.5-9B 10.0 10.0 0.0% 0 464ms 24 0
Samanya Buddhimatta स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Mercury 2 4.0 10.0 0.0% 0 821ms 137 542
Qwen3.5-9B 3.0 9.9 0.0% 0 552ms 99 0
निर्देश पालन स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Mercury 2 10.0 10.0 100.0% 0 1.07s 14 958
Qwen3.5-9B 5.5 10.0 50.0% 0 514ms 75 0
Puzzle Solving स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Mercury 2 1.7 7.5 22.2% 1 934ms 354 2,758
Qwen3.5-9B 10.0 9.9 0.0% 0 683ms 388 0
टूल कॉलिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Mercury 2 10.0 10.0 100.0% 0 1.89s 180 1,956
Qwen3.5-9B 10.0 10.0 100.0% 0 1.27s 273 0

त्वरित तुलना

तुलना जोड़ी बदलें