नेविगेशन
AI BENCHY
Your ad here

AI BENCHY तुलना

तुलना किए गए मॉडल

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-05-01

मेट्रिक GPT-5.4 GPT-5.4 medium रिलीज़: 2026-03-05 GPT-5.3-Codex GPT-5.3-Codex medium रिलीज़: 2026-02-05 GPT-5.2 GPT-5.2 medium रिलीज़: 2025-12-11
स्कोर 8.2 8.6 7.5
रैंक #23 #13 #54
विश्वसनीयता लागू नहीं लागू नहीं लागू नहीं
संगति 8.7 8.7 8.1
सही परीक्षण
प्रति प्रयास पास दर 79.6% 83.3% 72.2%
अस्थिर टेस्ट 3 3 4
कुल रन 54 54 54
प्रति परिणाम लागत 6.399 4.405 3.193
कुल लागत $0.832 $0.573 $0.352
???? ??? $2.500 / 1M $1.750 / 1M $1.750 / 1M
????? ??? $15.000 / 1M $14.000 / 1M $14.000 / 1M
आउटपुट टोकन 2,169 2,279 2,705
रीजनिंग टोकन 48,732 35,179 18,977
प्रतिक्रिया समय (औसत) 18.63s 15.38s 14.04s
प्रतिक्रिया समय (अधिकतम) 100.41s 100.93s 77.80s
प्रतिक्रिया समय (कुल) 335.26s 276.91s 154.41s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 8.3 10.0 75.0% 0 4.11s 240 1,511
GPT-5.3-Codex 8.7 7.9 91.7% 1 4.16s 240 1,722
GPT-5.2 6.5 8.0 58.3% 1 7.81s 567 2,002
कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 10.0 10.0 100.0% 0 13.03s 389 2,045
GPT-5.3-Codex 10.0 10.0 100.0% 0 8.95s 491 1,530
GPT-5.2 10.0 10.0 100.0% 0 15.12s 467 2,166
संयुक्त स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 10.0 10.0 100.0% 0 20.57s 301 3,543
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.56s 364 2,731
GPT-5.2 10.0 10.0 100.0% 0 14.06s 291 1,757
डेटा पार्सिंग और निष्कर्षण स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 10.0 10.0 100.0% 0 5.32s 234 804
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.07s 234 728
GPT-5.2 10.0 10.0 100.0% 0 3.15s 234 420
डोमेन-विशिष्ट स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 5.3 7.2 44.4% 1 74.27s 61 34,748
GPT-5.3-Codex 5.9 7.2 55.6% 1 64.31s 64 25,308
GPT-5.2 5.9 7.2 55.6% 1 77.80s 42 10,342
Samanya Buddhimatta स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 4.7 3.1 33.3% 1 4.92s 145 321
GPT-5.3-Codex 4.6 10.0 0.0% 0 4.87s 187 331
GPT-5.2 3.7 9.7 0.0% 0 4.32s 162 269
निर्देश पालन स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 10.0 10.0 100.0% 0 3.11s 93 897
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.04s 93 693
GPT-5.2 9.9 10.0 100.0% 0 3.12s 94 614
पहेली समाधान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 8.2 7.2 88.9% 1 9.13s 442 3,832
GPT-5.3-Codex 9.0 7.9 88.9% 1 5.12s 352 1,644
GPT-5.2 7.7 7.3 77.8% 1 5.47s 609 938
टूल कॉलिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 10.0 10.0 100.0% 0 13.28s 264 1,031
GPT-5.3-Codex 10.0 10.0 100.0% 0 6.37s 254 492
GPT-5.2 4.7 1.6 66.7% 1 10.30s 239 469

त्वरित तुलना

तुलना जोड़ी बदलें