नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Poolside: Laguna S 2.1 vs xAI: Grok 4.20

Laguna S 2.1 (low) average score में आगे है: 5.0 vs 4.1. Grok 4.20 की benchmark लागत कम है: $0.057 vs $0.091. Grok 4.20 तेज है: 1.11s vs 85.35s, pass rates 25.8% vs 27.3%.

अनुशंसित मॉडलLaguna S 2.1 (low)It has the strongest score in this comparison (5.0) and the best overall balance of cost and response time across all 2 models.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक Laguna S 2.1 Laguna S 2.1 low रिलीज़: 2026-07-21 निःशुल्क उपलब्ध Grok 4.20 Grok 4.20 none रिलीज़: 2026-03-31
स्कोर 5.0 4.1
रैंक #187 #213
विश्वसनीयता 9.9 लागू नहीं
संगति 7.8 8.1
सही परीक्षण
प्रति प्रयास पास दर 25.8% 27.3%
अस्थिर टेस्ट 6 0
कुल रन 66 54
प्रति परिणाम लागत 3.022 1.570
कुल लागत $0.091 $0.057
इनपुट कीमत $0.100 / 1M $1.250 / 1M
आउटपुट कीमत $0.200 / 1M $2.500 / 1M
कुल इनपुट टोकन 118,746 41,313
आउटपुट टोकन 67,823 1,923
रीजनिंग टोकन 383,885 0
प्रतिक्रिया समय (औसत) 85.35s 1.11s
प्रतिक्रिया समय (अधिकतम) 814.73s 6.04s
प्रतिक्रिया समय (कुल) 1877.64s 19.96s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#187 Laguna S 2.1

low
लागत
$0.001
समय
6.6s
टोकन
1,314 tok

#213 xAI: Grok 4.20

none
लागत
$0.004
समय
6.5s
टोकन
1,367 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Laguna S 2.1 3.8 7.1 22.2% 1 167.51s 7,917 58,111 119,138
Grok 4.20 1.1 3.1 0.0% 0 1.22s 1,074 312 0

त्वरित तुलना

तुलना जोड़ी बदलें