無効なツール呼び出し の失敗
どのAIモデルで 無効なツール呼び出し が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。 並び替え: スコア ↑.
カテゴリ
83/83
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 無効なツール呼び出し 件数 | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #30 | Muse Spark 1.1 high | Meta | 2 | 8.1 | $1.694 | 12/22 | 31.5s |
| #27 | Muse Spark 1.1 low | Meta | 1 | 8.3 | $0.647 | 13/22 | 11.5s |
| #26 | Claude Sonnet 5 medium | Anthropic | 1 | 8.3 | $0.922 | 16/22 | 12.5s |
| #20 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.478 | 17/22 | 17.2s |
| #19 | Muse Spark 1.1 medium | Meta | 1 | 8.6 | $1.357 | 15/22 | 25.0s |
| #14 | Gemini 3.5 Flash low | 1 | 8.9 | $0.433 | 19/22 | 5.55s | |
| #11 | Qwen3.7 Max medium | Qwen | 1 | 9.2 | $1.116 | 18/22 | 40.6s |
| #4 | Gemini 3.5 Flash high | 1 | 9.5 | $1.976 | 20/22 | 15.1s |