অবৈধ টুল কল ব্যর্থতা
দেখুন কোন AI মডেলগুলো সবচেয়ে বেশি অবৈধ টুল কল সমস্যায় পড়ে, যাতে বেছে নেওয়ার আগে নির্ভরযোগ্যতার ঝুঁকি বুঝতে পারেন। সাজান: সঠিক টেস্ট ↓.
83/83
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | অবৈধ টুল কল সংখ্যা | স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #110 | Gemma 4 31B medium | 1 | 6.3 | $0.163 | 14/22 | 75.4s | |
| #24 | Muse Spark 1.1 low | Meta | 1 | 8.3 | $0.647 | 13/22 | 11.5s |
| #45 | DeepSeek V4 Flash high | DeepSeek | 1 | 7.7 | $0.042 | 13/22 | 49.7s |
| #51 | Nemotron 3 Ultra medium | NVIDIA | 1 | 7.5 | $0.774 | 13/22 | 32.2s |
| #55 | GPT-5.6 Terra low | OpenAI | 1 | 7.5 | $0.519 | 13/22 | 5.31s |
| #58 | Qwen3.5-27B medium | Qwen | 1 | 7.4 | $1.627 | 13/22 | 111.9s |
| #64 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.3 | $0.115 | 13/22 | 4.61s | |
| #65 | Gemini 3.1 Flash Lite medium | 1 | 7.3 | $0.117 | 13/22 | 4.27s | |
| #90 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.7 | $0.746 | 13/22 | 58.1s |
| #104 | Gemini 3.1 Flash Lite Preview low | 1 | 6.5 | $0.646 | 13/22 | 16.7s | |
| #27 | Muse Spark 1.1 high | Meta | 2 | 8.1 | $1.694 | 12/22 | 31.5s |
| #56 | GPT-5.4 Mini medium | OpenAI | 1 | 7.5 | $0.756 | 12/22 | 25.9s |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 12/22 | 20.7s |
| #68 | Kimi K2.6 medium | Moonshot AI | 1 | 7.2 | $1.036 | 12/22 | 110.0s |
| #75 | Grok 4.20 medium | X AI | 1 | 7.1 | $0.777 | 12/22 | 29.5s |