Navigare
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Modele comparate

Rezumat

Comparație benchmark Grok 4.20 Beta vs Grok 4.20 Multi Agent Beta vs Grok 4.1 Fast vs Gemini 3 Flash PreviewGemini 3 Flash Preview conduce la Scor cu 9.6. Grok 4.1 Fast conduce la Fiabilitate cu 10.0. Grok 4.1 Fast are cel mai mic Cost total, $0.069. Grok 4.20 Multi Agent Beta are cel mai rapid timp de răspuns, 9.69s.

Model recomandat: Gemini 3 Flash Preview - Are cel mai bun scor aici (9.6) și costă de aproximativ 3.2x mai puțin decât celelalte modele din această comparație.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-12

Metrică Grok 4.20 Beta Grok 4.20 Beta medium Lansare: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Lansare: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Lansare: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Lansare: 2025-12-17
Scor 9.2 7.3 6.0 9.6
Rang #8 #57 #105 #2
Fiabilitate N/D N/D 10.0 10.0
Consistență 9.5 7.9 7.3 9.7
Teste corecte
Rată de trecere pe încercare 81.5% 59.3% 61.4% 98.4%
Teste instabile 1 5 6 1
Rulări totale 52 52 57 63
Cost per rezultat 4.505 62.923 0.642 3.335
Cost total $0.750 $5.599 $0.069 $0.667
Preț de intrare $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Preț de ieșire $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Total tokenuri de intrare 35,955 721,952 42,845 37,017
Tokenuri de ieșire 1,647 294,668 2,006 2,006
Tokenuri de raționament 91,565 305,374 96,334 214,153
Timp de răspuns (mediu) 9.75s 9.69s 23.85s 18.64s
Timp de răspuns (maxim) 31.36s 35.28s 121.79s 117.26s
Timp de răspuns (total) 175.48s 155.07s 286.16s 391.35s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#8 Grok 4.20 Beta

medium
Cost
$0.034
Time
91.0s
Tokens
13,523 tok

#57 Grok 4.20 Multi Agent Beta

medium
Cost
$0.261
Time
123.4s
Tokens
199,344 tok

#105 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Cost
$0.000
Time
0.1s
Tokens
0 tok

#2 Gemini 3 Flash Preview

medium
Cost
$0.010
Time
17.9s
Tokens
3,236 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 8.7 7.9 91.7% 1 3.16s 2,010 268 7,583
Grok 4.20 Multi Agent Beta 6.9 5.8 75.0% 2 3.46s 90,925 33,706 33,077
Grok 4.1 Fast 8.7 7.9 91.7% 1 3.81s 2,358 108 4,741
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 3.88s 494 330 3,216
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 10.0 10.0 100.0% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 10.0 10.0 100.0% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 2.3 1.1 33.3% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 10.0 10.0 100.0% 0 20.93s 12,909 227 12,212
Grok 4.20 Multi Agent Beta 3.0 10.0 0.0% 0 0ms 0 0 0
Grok 4.1 Fast 10.0 10.0 100.0% 0 37.64s 13,899 261 12,272
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 22.42s 12,873 351 10,485
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 10.0 10.0 100.0% 0 4.01s 7,761 180 5,281
Grok 4.20 Multi Agent Beta 10.0 10.0 100.0% 0 5.54s 97,232 25,306 25,051
Grok 4.1 Fast 10.0 10.0 100.0% 0 6.63s 8,001 180 5,409
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.43s 7,548 279 4,893
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 5.3 10.0 33.3% 0 21.33s 1,764 251 40,255
Grok 4.20 Multi Agent Beta 2.9 7.2 11.1% 1 24.67s 328,253 164,609 163,647
Grok 4.1 Fast 5.8 4.4 66.7% 2 121.79s 1,777 11 37,657
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 15.27s 633 12 21,684
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 10.0 10.0 100.0% 0 5.78s 825 72 3,440
Grok 4.20 Multi Agent Beta 5.8 2.8 66.7% 1 6.40s 41,387 15,848 15,746
Grok 4.1 Fast 4.2 9.9 0.0% 0 16.25s 912 127 3,456
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.19s 486 72 1,905
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 9.8 10.0 100.0% 0 4.89s 1,362 57 7,123
Grok 4.20 Multi Agent Beta 9.8 10.0 100.0% 0 3.52s 43,923 19,752 19,617
Grok 4.1 Fast 6.5 10.0 50.0% 0 4.63s 1,536 54 3,326
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.04s 615 72 2,709
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 10.0 10.0 100.0% 0 3.52s 1,689 328 6,300
Grok 4.20 Multi Agent Beta 6.7 7.9 55.6% 1 5.19s 107,020 35,361 35,095
Grok 4.1 Fast 5.3 7.2 44.4% 1 7.40s 1,950 169 5,904
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.05s 558 183 4,365
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta 3.0 10.0 0.0% 0 12.39s 7,275 183 5,384
Grok 4.20 Multi Agent Beta 3.0 10.0 0.0% 0 0ms 0 0 0
Grok 4.1 Fast 2.8 1.6 33.3% 1 27.71s 10,627 260 11,485
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 12.60s 5,532 234 1,487
Cultură generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Grok 4.20 Beta - - - - - - - - -
Grok 4.20 Multi Agent Beta - - - - - - - - -
Grok 4.1 Fast 3.0 10.0 0.0% 0 25.52s 618 15 5,381
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.50s 156 11 2,325

Comparație rapidă

Schimbă perechea de comparație