नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY तुलना

तुलना किए गए मॉडल

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-04-14

मेट्रिक Elephant Elephant none रिलीज़: 2026-04-14 Qwen3.5-27B Qwen3.5-27B none रिलीज़: 2026-02-24 Elephant Elephant medium रिलीज़: 2026-04-14 Qwen3.5-27B Qwen3.5-27B medium रिलीज़: 2026-02-24
स्कोर 5.2 5.9 5.2 8.4
रैंक #81 #64 #77 #8
संगति 9.6 9.2 9.6 8.8
सही परीक्षण
प्रति प्रयास पास दर 31.5% 38.9% 29.6% 81.5%
अस्थिर टेस्ट 1 2 1 3
कुल रन 54 54 54 54
प्रति परिणाम लागत 0.000 0.265 0.000 3.822
कुल लागत $0.000 $0.016 $0.000 $0.497
???? ??? $0.000 / 1M $0.195 / 1M $0.000 / 1M $0.195 / 1M
????? ??? $0.000 / 1M $1.560 / 1M $0.000 / 1M $1.560 / 1M
आउटपुट टोकन 2,573 3,545 2,596 2,500
रीजनिंग टोकन 0 0 0 242,500
प्रतिक्रिया समय (औसत) 1.23s 1.74s 1.27s 53.03s
प्रतिक्रिया समय (अधिकतम) 3.81s 9.39s 3.70s 163.96s
प्रतिक्रिया समय (कुल) 22.16s 31.32s 22.82s 954.46s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 6.6 10.0 50.0% 0 963ms 610 0
Qwen3.5-27B 4.8 10.0 25.0% 0 788ms 267 0
Elephant 6.6 10.0 50.0% 0 1.19s 815 0
Qwen3.5-27B 8.7 7.9 91.7% 1 19.75s 569 31,505
कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 6.4 3.3 66.7% 1 1.39s 375 0
Qwen3.5-27B 10.0 10.0 100.0% 0 2.51s 381 0
Elephant 5.1 3.3 33.3% 1 1.30s 365 0
Qwen3.5-27B 10.0 10.0 100.0% 0 70.35s 375 19,165
संयुक्त स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 3.0 10.0 0.0% 0 3.81s 731 0
Qwen3.5-27B 2.8 1.6 33.3% 1 9.39s 1,461 0
Elephant 3.0 10.0 0.0% 0 3.70s 562 0
Qwen3.5-27B 10.0 10.0 100.0% 0 163.96s 483 9,991
डेटा पार्सिंग और निष्कर्षण स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 6.5 10.0 50.0% 0 1.04s 246 0
Qwen3.5-27B 10.0 10.0 100.0% 0 1.43s 243 0
Elephant 6.5 10.0 50.0% 0 979ms 246 0
Qwen3.5-27B 10.0 10.0 100.0% 0 30.26s 270 16,150
डोमेन-विशिष्ट स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 3.0 10.0 0.0% 0 927ms 24 0
Qwen3.5-27B 3.0 10.0 0.0% 0 540ms 15 0
Elephant 3.0 10.0 0.0% 0 925ms 24 0
Qwen3.5-27B 5.3 10.0 33.3% 0 79.53s 43 52,368
Samanya Buddhimatta स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 4.0 10.0 0.0% 0 854ms 106 0
Qwen3.5-27B 5.0 10.0 0.0% 0 2.51s 126 0
Elephant 4.3 10.0 0.0% 0 920ms 105 0
Qwen3.5-27B 6.1 3.1 66.7% 1 101.41s 70 23,147
निर्देश पालन स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 9.8 10.0 100.0% 0 1.03s 81 0
Qwen3.5-27B 4.8 10.0 0.0% 0 815ms 69 0
Elephant 9.8 10.0 100.0% 0 987ms 82 0
Qwen3.5-27B 10.0 10.0 100.0% 0 19.66s 97 11,638
पहेली समाधान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 3.3 10.0 0.0% 0 849ms 170 0
Qwen3.5-27B 6.7 7.9 55.6% 1 1.37s 680 0
Elephant 3.7 10.0 0.0% 0 867ms 166 0
Qwen3.5-27B 8.2 7.7 77.8% 1 64.61s 245 77,213
टूल कॉलिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
Elephant 3.0 10.0 0.0% 0 2.79s 230 0
Qwen3.5-27B 10.0 10.0 100.0% 0 3.54s 303 0
Elephant 3.0 10.0 0.0% 0 2.83s 231 0
Qwen3.5-27B 10.0 10.0 100.0% 0 7.45s 348 1,323

त्वरित तुलना

तुलना जोड़ी बदलें