नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

OpenAI: gpt-oss-120b vs Poolside: Laguna S 2.1

Laguna S 2.1 average score में आगे है: 4.5 vs 3.7. gpt-oss-120b की benchmark लागत कम है: $0.010 vs $0.025. Laguna S 2.1 तेज है: 11.67s vs 21.61s, pass rates 33.3% vs 15.2%.

अनुशंसित मॉडलLaguna S 2.1It has the best score here (4.5), while responding about 1.9x faster than gpt-oss-120b.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-22

मेट्रिक gpt-oss-120b gpt-oss-120b none रिलीज़: 2025-08-05 निःशुल्क उपलब्ध Laguna S 2.1 Laguna S 2.1 none रिलीज़: 2026-07-21 निःशुल्क उपलब्ध
स्कोर 3.7 4.5
रैंक #216 #200
विश्वसनीयता 10.0 10.0
संगति 7.8 8.8
सही परीक्षण
प्रति प्रयास पास दर 33.3% 15.2%
अस्थिर टेस्ट 2 3
कुल रन 57 66
प्रति परिणाम लागत 0.168 1.205
कुल लागत $0.010 $0.025
इनपुट कीमत $0.037 / 1M $0.100 / 1M
आउटपुट कीमत $0.170 / 1M $0.200 / 1M
कुल इनपुट टोकन 9,081 125,598
आउटपुट टोकन 51,664 57,634
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 21.61s 11.67s
प्रतिक्रिया समय (अधिकतम) 113.71s 200.52s
प्रतिक्रिया समय (कुल) 345.79s 256.80s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#216 gpt-oss-120b

none
इस मॉडल के लिए अभी तक कोई शोकेस परिणाम उत्पन्न नहीं हुआ है।
लागत
$0.000
समय
-
टोकन
0 tok

#200 Laguna S 2.1

none
लागत
$0.001
समय
7.6s
टोकन
1,345 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
gpt-oss-120b 1.5 4.0 22.2% 1 9.57s 901 3,232 0
Laguna S 2.1 3.4 9.7 0.0% 0 550ms 7,917 424 0

त्वरित तुलना

तुलना जोड़ी बदलें