领域专项 排名
看看哪些 AI 模型在 领域专项 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 指标 ↑.
316/316
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 领域专项 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #27 | GPT-5.5 medium | OpenAI | 5.3 | 9.0 | $4.163 | 1/3 | 168.2s |
| #33 | Gemini 3.5 Flash low | 5.3 | 8.8 | $0.449 | 1/3 | 4.89s | |
| #44 | Claude Fable 5 medium | Anthropic | 5.3 | 8.6 | $3.004 | 1/3 | 37.3s |
| #47 | GPT-5.4 medium | OpenAI | 5.3 | 8.5 | $1.560 | 1/3 | 72.4s |
| #48 | Grok 4.5 medium | X AI | 5.3 | 8.5 | $2.042 | 1/3 | 249.3s |
| #50 | Grok 4.6 medium | X AI | 5.3 | 8.4 | $1.713 | 1/3 | 304.3s |
| #69 | Inkling medium | Thinkingmachines | 5.3 | 8.0 | $0.383 | 1/3 | 31.6s |
| #71 | Kimi K3 max | Moonshot AI | 5.3 | 7.9 | $3.467 | 1/3 | 683.6s |
| #91 | GPT-5.6 Luna high | OpenAI | 5.3 | 7.6 | $0.179 | 1/3 | 62.9s |
| #96 | GPT-5.6 Terra low | OpenAI | 5.3 | 7.5 | $0.420 | 1/3 | 9.34s |
| #99 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 5.3 | 7.5 | $0.459 | 1/3 | 56.0s |
| #101 | Mercury 2.5 Preview medium | Inception | 5.3 | 7.5 | $0.024 | 1/3 | 3.72s |
| #112 | Gemini 3 Flash Preview low | 5.3 | 7.4 | $0.185 | 1/3 | 9.74s | |
| #120 | Claude Opus 4.8 none | Anthropic | 5.3 | 7.3 | $1.166 | 1/3 | 1.76s |
| #121 | Kimi K2.6 medium | Moonshot AI | 5.3 | 7.2 | $1.247 | 1/3 | 264.4s |