AI BENCHY
Advertise here

AI BENCHY श्रेणी विफलताएँ

डेटा पार्सिंग और निष्कर्षण: API त्रुटि

डेटा पार्सिंग और निष्कर्षण
API त्रुटि

देखें कि डेटा पार्सिंग और निष्कर्षण में किन AI मॉडलों में API त्रुटि आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

15

कुल विफलताएँ

16

सबसे अधिक प्रभावित मॉडल

Gemini 3.5 Flash 1
रैंक मॉडल कंपनी API त्रुटि संख्या श्रेणी स्कोर सही परीक्षण प्रतिक्रिया समय (औसत)
#20 Gemini 3.5 Flash none Google 1 6.5 1/2 8.10s
#33 Hy3 preview medium Tencent 1 6.5 1/2 5.25s
#49 Qwen3.5-Flash medium Qwen 1 7.3 1/2 57.0s
#64 MiMo-V2-Flash medium Xiaomi 1 6.5 1/2 0ms
#66 Qwen3.5-35B-A3B medium Qwen 1 7.3 1/2 59.3s
#82 Hy3 preview high Tencent 1 6.5 1/2 12.1s
#89 Hy3 preview low Tencent 1 6.5 1/2 5.85s
#103 DeepSeek V4 Pro high DeepSeek 1 7.3 1/2 23.6s
#113 DeepSeek V4 Pro none DeepSeek 1 6.9 1/2 30.5s
#126 gpt-oss-120b none OpenAI 1 6.5 1/2 7.12s
#132 Mistral Small 4 medium Mistral 1 7.3 1/2 1.23s
#156 Hy3 preview none Tencent 1 6.5 1/2 2.85s
#83 Step 3.5 Flash none Stepfun 1 3.0 0/1 0ms
#96 Ring-2.6-1T none Inclusionai 1 3.0 0/2 45.9s
#100 Grok Build 0.1 none X AI 1 3.8 0/2 9.33s

API त्रुटि संख्या के अनुसार शीर्ष मॉडल

API त्रुटि संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल