नेव्हिगेशन
AI BENCHY
Advertise here

AI BENCHY Compare

तुलना केलेली मॉडेल्स

सारांश

Grok 4.20 Beta vs Grok 4.20 Multi Agent Beta vs Grok 4.1 Fast vs Gemini 3 Flash Preview benchmark तुलनाGemini 3 Flash Preview स्कोअर मध्ये 9.6 सह आघाडीवर आहे. Grok 4.1 Fast विश्वसनीयता मध्ये 10.0 सह आघाडीवर आहे. Grok 4.1 Fast चे एकूण खर्च सर्वात कमी आहे: $0.069. Grok 4.20 Multi Agent Beta 9.69s वर सर्वात जलद आहे.

शिफारस केलेले मॉडेल: Gemini 3 Flash Preview - It has the best score here (9.6), while costing about 3.2x less than या तुलनेतील इतर मॉडेल.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-06-12

मेट्रिक Grok 4.20 Beta Grok 4.20 Beta medium प्रकाशन: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium प्रकाशन: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium प्रकाशन: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium प्रकाशन: 2025-12-17
स्कोअर 9.2 7.3 6.0 9.6
क्रमांक #8 #57 #105 #2
विश्वसनीयता लागू नाही लागू नाही 10.0 10.0
सुसंगतता 9.5 7.9 7.3 9.7
बरोबर चाचण्या
प्रति प्रयत्न पास दर 81.5% 59.3% 61.4% 98.4%
अस्थिर चाचण्या 1 5 6 1
एकूण रन 52 52 57 63
प्रति निकाल खर्च 4.505 62.923 0.642 3.335
एकूण खर्च $0.750 $5.599 $0.069 $0.667
इनपुट किंमत $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
आउटपुट किंमत $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
एकूण इनपुट टोकन्स 35,955 721,952 42,845 37,017
आउटपुट टोकन्स 1,647 294,668 2,006 2,006
रिझनिंग टोकन्स 91,565 305,374 96,334 214,153
प्रतिसाद वेळ (सरासरी) 9.75s 9.69s 23.85s 18.64s
प्रतिसाद वेळ (कमाल) 31.36s 35.28s 121.79s 117.26s
प्रतिसाद वेळ (एकूण) 175.48s 155.07s 286.16s 391.35s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#8 Grok 4.20 Beta

medium
Cost
$0.034
Time
91.0s
Tokens
13,523 tok

#57 Grok 4.20 Multi Agent Beta

medium
Cost
$0.261
Time
123.4s
Tokens
199,344 tok

#105 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Cost
$0.000
Time
0.1s
Tokens
0 tok

#2 Gemini 3 Flash Preview

medium
Cost
$0.010
Time
17.9s
Tokens
3,236 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

अँटी-एआय युक्त्या स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 8.7 7.9 91.7% 1 3.16s 2,010 268 7,583
Grok 4.20 Multi Agent Beta 6.9 5.8 75.0% 2 3.46s 90,925 33,706 33,077
Grok 4.1 Fast 8.7 7.9 91.7% 1 3.81s 2,358 108 4,741
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 3.88s 494 330 3,216
कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 10.0 10.0 100.0% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 10.0 10.0 100.0% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 2.3 1.1 33.3% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084
संयुक्त स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 10.0 10.0 100.0% 0 20.93s 12,909 227 12,212
Grok 4.20 Multi Agent Beta 3.0 10.0 0.0% 0 0ms 0 0 0
Grok 4.1 Fast 10.0 10.0 100.0% 0 37.64s 13,899 261 12,272
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 22.42s 12,873 351 10,485
डेटा पार्सिंग आणि निष्कर्षण स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 10.0 10.0 100.0% 0 4.01s 7,761 180 5,281
Grok 4.20 Multi Agent Beta 10.0 10.0 100.0% 0 5.54s 97,232 25,306 25,051
Grok 4.1 Fast 10.0 10.0 100.0% 0 6.63s 8,001 180 5,409
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.43s 7,548 279 4,893
डोमेन-विशिष्ट स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 5.3 10.0 33.3% 0 21.33s 1,764 251 40,255
Grok 4.20 Multi Agent Beta 2.9 7.2 11.1% 1 24.67s 328,253 164,609 163,647
Grok 4.1 Fast 5.8 4.4 66.7% 2 121.79s 1,777 11 37,657
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 15.27s 633 12 21,684
Samanya Buddhimatta स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 10.0 10.0 100.0% 0 5.78s 825 72 3,440
Grok 4.20 Multi Agent Beta 5.8 2.8 66.7% 1 6.40s 41,387 15,848 15,746
Grok 4.1 Fast 4.2 9.9 0.0% 0 16.25s 912 127 3,456
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.19s 486 72 1,905
सूचनांचे पालन स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 9.8 10.0 100.0% 0 4.89s 1,362 57 7,123
Grok 4.20 Multi Agent Beta 9.8 10.0 100.0% 0 3.52s 43,923 19,752 19,617
Grok 4.1 Fast 6.5 10.0 50.0% 0 4.63s 1,536 54 3,326
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.04s 615 72 2,709
कोडी सोडवणे स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 10.0 10.0 100.0% 0 3.52s 1,689 328 6,300
Grok 4.20 Multi Agent Beta 6.7 7.9 55.6% 1 5.19s 107,020 35,361 35,095
Grok 4.1 Fast 5.3 7.2 44.4% 1 7.40s 1,950 169 5,904
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.05s 558 183 4,365
टूल कॉलिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta 3.0 10.0 0.0% 0 12.39s 7,275 183 5,384
Grok 4.20 Multi Agent Beta 3.0 10.0 0.0% 0 0ms 0 0 0
Grok 4.1 Fast 2.8 1.6 33.3% 1 27.71s 10,627 260 11,485
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 12.60s 5,532 234 1,487
सामान्य ज्ञान स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Grok 4.20 Beta - - - - - - - - -
Grok 4.20 Multi Agent Beta - - - - - - - - -
Grok 4.1 Fast 3.0 10.0 0.0% 0 25.52s 618 15 5,381
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.50s 156 11 2,325

झटपट तुलना

तुलना जोडी बदला