领域专项 排名
看看哪些 AI 模型在 领域专项 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
316/316
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 领域专项 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #190 | Qwen3.7 Flash none | Qwen | 5.3 | 6.1 | $0.019 | 1/3 | 814ms |
| #193 | Inkling low | Thinkingmachines | 5.3 | 6.1 | $0.187 | 1/3 | 1.68s |
| #194 | Trinity Large Thinking medium | Arcee AI | 5.3 | 6.1 | $0.756 | 1/3 | 124.2s |
| #195 | Qwen3.6 Flash none | Qwen | 5.3 | 6.1 | $0.062 | 1/3 | 963ms |
| #196 | Gemma 4 31B none | 5.3 | 6.1 | $0.016 | 1/3 | 3.65s | |
| #197 | Qwen3.5 Plus 2026-04-20 none | Qwen | 5.3 | 6.1 | $0.122 | 1/3 | 1.06s |
| #198 | Nemotron 3 Ultra none | NVIDIA | 5.3 | 6.1 | $0.093 | 1/3 | 758ms |
| #201 | Grok 4.20 Beta medium | X AI | 5.3 | 6.0 | $0.750 | 1/3 | 21.3s |
| #202 | GPT-5.6 Terra none | OpenAI | 5.3 | 6.0 | $0.280 | 1/3 | 843ms |
| #203 | Gemini 3 PRO Preview medium | 5.3 | 6.0 | $0.385 | 1/3 | 7.01s | |
| #205 | Qwen3.5-Flash none | Qwen | 5.3 | 6.0 | $0.073 | 1/3 | 873ms |
| #206 | Qwen3.5-35B-A3B none | Qwen | 5.3 | 5.9 | $0.076 | 1/3 | 507ms |
| #210 | Hy3 preview high | Tencent | 5.3 | 5.9 | $0.135 | 1/3 | 109.0s |
| #214 | GPT-5.4 none | OpenAI | 5.3 | 5.8 | $0.397 | 1/3 | 1.15s |
| #219 | Inkling Small low | Thinkingmachines | 5.3 | 5.7 | $0.055 | 1/3 | 852ms |