ڈیٹا پارسنگ اور استخراج: غلط جواب
ڈیٹا پارسنگ اور استخراج
غلط جواب
دیکھیں کہ ڈیٹا پارسنگ اور استخراج میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
59/59
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #226 | KAT-Coder-Air V2.5 medium | Kwaipilot | 1 | 6.5 | $0.048 | 1/2 | 3.65s |
| #229 | Qwen3.6 27B none | Qwen | 1 | 7.3 | $0.116 | 1/2 | 2.06s |
| #231 | Qwen3.8 27B none | Qwen | 1 | 6.5 | ~$0.006 | 1/2 | 1.14s |
| #235 | KAT-Coder-Air V2.5 low | Kwaipilot | 1 | 6.5 | $0.046 | 1/2 | 2.82s |
| #238 | Kimi K2.5 none | Moonshot AI | 1 | 7.3 | $0.101 | 1/2 | 42.1s |
| #249 | Granite 4.2 8B medium | IBM Granite | 1 | 6.5 | $0.009 | 1/2 | 1.43s |
| #250 | Nemotron 3.5 Lightning medium | NVIDIA | 1 | 3.7 | $0.156 | 0/2 | 23.2s |
| #253 | Granite 4.2 8B low | IBM Granite | 1 | 6.5 | $0.012 | 1/2 | 1.39s |
| #254 | Qwen3 Coder Next none | Qwen | 1 | 6.5 | $0.026 | 1/2 | 1.32s |
| #259 | MiniMax M2.7 medium | Minimax | 1 | 6.3 | $0.208 | 1/2 | 21.9s |
| #260 | Mercury 2.5 Preview low | Inception | 1 | 6.3 | $0.011 | 1/2 | 1.12s |
| #262 | DeepSeek V3.2 none | DeepSeek | 1 | 6.3 | $0.054 | 1/2 | 9.42s |
| #265 | Mercury 2.5 Preview none | Inception | 1 | 6.3 | $0.018 | 1/2 | 1.04s |
| #266 | Ling-2.6-flash none | Inclusionai | 1 | 6.5 | $0.002 | 1/2 | 8.48s |
| #269 | Ring-2.6-1T none | Inclusionai | 1 | 3.0 | $0.026 | 0/2 | 45.9s |