नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Poolside: Laguna S 2.1 vs xAI: Grok 4.20

Laguna S 2.1 average score में आगे है: 4.5 vs 4.1. Laguna S 2.1 की benchmark लागत कम है: $0.025 vs $0.057. Grok 4.20 तेज है: 1.11s vs 11.67s, pass rates 15.2% vs 27.3%.

अनुशंसित मॉडलLaguna S 2.1It has the best score here (4.5), while costing about 2.3x less than Grok 4.20.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-22

मेट्रिक Laguna S 2.1 Laguna S 2.1 none रिलीज़: 2026-07-21 निःशुल्क उपलब्ध Grok 4.20 Grok 4.20 none रिलीज़: 2026-03-31
स्कोर 4.5 4.1
रैंक #200 #207
विश्वसनीयता 10.0 लागू नहीं
संगति 8.8 8.1
सही परीक्षण
प्रति प्रयास पास दर 15.2% 27.3%
अस्थिर टेस्ट 3 0
कुल रन 66 54
प्रति परिणाम लागत 1.205 1.570
कुल लागत $0.025 $0.057
इनपुट कीमत $0.100 / 1M $1.250 / 1M
आउटपुट कीमत $0.200 / 1M $2.500 / 1M
कुल इनपुट टोकन 125,598 41,313
आउटपुट टोकन 57,634 1,923
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 11.67s 1.11s
प्रतिक्रिया समय (अधिकतम) 200.52s 6.04s
प्रतिक्रिया समय (कुल) 256.80s 19.96s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#200 Laguna S 2.1

none
लागत
$0.001
समय
7.6s
टोकन
1,345 tok

#207 xAI: Grok 4.20

none
लागत
$0.004
समय
6.5s
टोकन
1,367 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Laguna S 2.1 3.4 9.7 0.0% 0 550ms 7,917 424 0
Grok 4.20 1.1 3.1 0.0% 0 1.22s 1,074 312 0

त्वरित तुलना

तुलना जोड़ी बदलें