नेविगेशन
AI BENCHY
Advertise here

AI BENCHY तुलना

Inception: Mercury 2 vs OpenAI: gpt-oss-120b

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-03

मेट्रिक Mercury 2 Mercury 2 none रिलीज़: 2026-02-24 gpt-oss-120b gpt-oss-120b medium रिलीज़: 2025-08-05 निःशुल्क उपलब्ध
स्कोर 4.6 5.9
रैंक #153 #103
विश्वसनीयता 10.0 10.0
संगति 9.1 7.9
सही परीक्षण
प्रति प्रयास पास दर 25.0% 50.0%
अस्थिर टेस्ट 2 5
कुल रन 60 60
प्रति परिणाम लागत 0.216 0.151
कुल लागत $0.009 $0.012
इनपुट कीमत $0.250 / 1M $0.039 / 1M
आउटपुट कीमत $0.750 / 1M $0.180 / 1M
कुल इनपुट टोकन 25,515 36,355
आउटपुट टोकन 3,001 17,495
रीजनिंग टोकन 0 46,878
प्रतिक्रिया समय (औसत) 614ms 22.41s
प्रतिक्रिया समय (अधिकतम) 1.27s 68.16s
प्रतिक्रिया समय (कुल) 12.28s 291.35s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
gpt-oss-120b 6.7 9.9 50.0% 0 10.21s 1,314 3,518 2,177
कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.5 9.4 0.0% 0 831ms 4,631 1,650 0
gpt-oss-120b 3.9 5.6 33.3% 1 47.24s 5,053 847 8,618
संयुक्त स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
gpt-oss-120b 10.0 10.0 100.0% 0 31.18s 11,535 694 5,072
डेटा पार्सिंग और निष्कर्षण स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
gpt-oss-120b 6.4 5.9 66.7% 1 1.98s 7,476 241 1,114
डोमेन-विशिष्ट स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
gpt-oss-120b 2.9 4.4 22.2% 2 50.92s 1,266 6,784 20,606
Samanya Buddhimatta स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
gpt-oss-120b 4.3 10.0 0.0% 0 7.90s 659 107 387
निर्देश पालन स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
gpt-oss-120b 9.9 10.0 100.0% 0 7.63s 1,036 126 1,799
पहेली समाधान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
gpt-oss-120b 5.3 7.2 44.4% 1 21.71s 1,190 1,790 2,264
टूल कॉलिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
gpt-oss-120b 9.8 10.0 100.0% 0 6.91s 6,514 287 1,083
सामान्य ज्ञान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
gpt-oss-120b 3.0 10.0 0.0% 0 26.51s 312 3,101 3,758

त्वरित तुलना

तुलना जोड़ी बदलें