数据解析与提取:答案错误
数据解析与提取
答案错误
看看哪些 AI 模型在 数据解析与提取 上最容易遇到 答案错误,更快找出薄弱点。 排序方式: 响应时间(平均) ↑.
36/36
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #201 | Granite 4.1 8B none | IBM Granite | 2 | 3.0 | $0.007 | 0/2 | 575ms |
| #189 | Mercury 2 none | Inception | 1 | 7.3 | $0.030 | 1/2 | 667ms |
| #210 | LFM2-24B-A2B none | Liquid | 2 | 3.0 | $0.001 | 0/2 | 714ms |
| #195 | Elephant Alpha medium | Openrouter | 1 | 6.5 | $0.000 | 1/2 | 979ms |
| #193 | Elephant Alpha none | Openrouter | 1 | 6.5 | $0.000 | 1/2 | 1.04s |
| #78 | Mercury 2 medium | Inception | 1 | 7.3 | $0.093 | 1/2 | 1.11s |
| #180 | GPT-5.4 Nano none | OpenAI | 1 | 6.5 | $0.041 | 1/2 | 1.11s |
| #166 | Qwen3 Coder Next none | Qwen | 1 | 6.5 | $0.025 | 1/2 | 1.32s |
| #208 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 2 | 3.8 | $0.000 | 0/2 | 1.42s |
| #66 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 1/2 | 1.77s |
| #121 | gpt-oss-120b medium | OpenAI | 1 | 6.4 | $0.019 | 1/2 | 1.98s |
| #152 | Qwen3.6 27B none | Qwen | 1 | 7.3 | $0.087 | 1/2 | 2.06s |
| #41 | Claude Opus 4.8 low | Anthropic | 1 | 6.3 | $2.077 | 1/2 | 2.27s |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 1/2 | 2.29s |
| #207 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 1 | 7.3 | $0.000 | 1/2 | 2.72s |