#38 Claude Opus 4.8
low- 成本
- $0.031
- 时间
- 14.1s
- 令牌
- 1,345 tok
AI BENCHY 对比
摘要
Claude Opus 4.8 vs Gemini 3.1 Flash Lite Preview benchmark 对比:平均分几乎持平,为 7.7 vs 7.8。 Gemini 3.1 Flash Lite Preview benchmark 成本更低,为 $0.068 vs $1.270。 Gemini 3.1 Flash Lite Preview 更快,为 3.96s vs 10.83s,通过率为 79.4% vs 61.9%。
推荐模型: Gemini 3.1 Flash Lite Preview - 它在这里得分最高(7.8),同时成本比Claude Opus 4.8低约 18.7 倍。
基准结果生成自 AI BENCHY 测试套件,时间:: 2026-06-30
| 指标 | Claude Opus 4.8 Claude Opus 4.8 low | Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium |
|---|---|---|
| 分数 | 7.7 | 7.8 |
| 排名 | #38 | #33 |
| 可靠性 | 10.0 | 10.0 |
| 一致性 | 8.8 | 10.0 |
| 测试正确 | ||
| 尝试通过率 | 79.4% | 61.9% |
| 不稳定测试 | 3 | 0 |
| 总运行次数 | 63 | 63 |
| 每个结果成本 | 8.466 | 0.523 |
| 总成本 | $1.270 | $0.068 |
| 输入价格 | $5.000 / 1M | $0.250 / 1M |
| 输出价格 | $25.000 / 1M | $1.500 / 1M |
| 总输入令牌 | 60,946 | 37,786 |
| 输出令牌 | 31,771 | 2,210 |
| 推理令牌 | 6,831 | 36,744 |
| 响应时间(平均) | 10.83s | 3.96s |
| 响应时间(最大) | 127.97s | 14.93s |
| 响应时间(总计) | 227.39s | 83.06s |
生成展示
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
| 反AI技巧 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.30s | 834 | 793 | 371 | |
| Gemini 3.1 Flash Lite Preview | 9.1 | 10.0 | 75.0% | 0 | 2.33s | 512 | 570 | 4,305 |
| 编程 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.6 | 4.6 | 77.8% | 2 | 7.58s | 10,590 | 3,637 | 809 | |
| Gemini 3.1 Flash Lite Preview | 5.5 | 10.0 | 33.3% | 0 | 4.09s | 8,126 | 461 | 8,597 |
| 综合 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.8 | 10.0 | 100.0% | 0 | 20.84s | 23,500 | 2,216 | 1,081 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 14.93s | 13,403 | 327 | 7,347 |
| 数据解析与提取 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.3 | 5.8 | 66.7% | 1 | 2.27s | 10,503 | 310 | 0 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 2.29s | 7,362 | 279 | 2,952 |
| 领域专项 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.3 | 10.0 | 33.3% | 0 | 45.53s | 975 | 23,311 | 3,908 | |
| Gemini 3.1 Flash Lite Preview | 3.0 | 10.0 | 0.0% | 0 | 4.21s | 639 | 18 | 5,325 |
| 通用智能 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 2.55s | 708 | 231 | 0 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 3.16s | 488 | 96 | 1,488 |
| 指令遵循 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.8 | 10.0 | 100.0% | 0 | 2.78s | 909 | 111 | 221 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 1.91s | 621 | 72 | 2,121 |
| 谜题求解 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.01s | 894 | 592 | 184 | |
| Gemini 3.1 Flash Lite Preview | 7.7 | 10.0 | 66.7% | 0 | 5.30s | 566 | 141 | 1,896 |
| 工具调用 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 6.85s | 11,775 | 370 | 35 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 3.80s | 5,909 | 234 | 912 |
| 常识问答 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 5.48s | 258 | 200 | 222 | |
| Gemini 3.1 Flash Lite Preview | 3.0 | 10.0 | 0.0% | 0 | 2.68s | 160 | 12 | 1,801 |
切换对比组合