AI
扒了 590 个模型的公开数据,挑出真正值得用的几个
用 Artificial Analysis 免费 API 拉 590 条模型记录,按编程、性价比、日常自动化重排,给一套分层搭配。
想找个便宜又能打的模型跑日常脚本,发现各家定价和 benchmark 散在十几个页面,没法横向比。Artificial Analysis 有免费 API,注册拿 key 就能整包拉数据。我拉了 590 条,写脚本按需求重排了一遍。
一句话结论
- 全能性价比之王:
DeepSeek V4 Flash 0731。编程 69.1、智能 49.9、自动化 82.0,价格$0.17/M。日常高频任务直接用它。 - 顶级编程力、不想花旗舰的钱:
GPT-5.6 Terra (max),编程 76.7,$4.5/M,旗舰的一半。 - 便宜的大批量编码:
GPT-5.6 Luna (max),编程 71.4,$0.45/M。 - 关键 agent 任务:
GLM-5.2 (max),自动化 84.6,$2.15/M。
数据口径
- 接口:
GET https://artificialanalysis.ai/api/v2/data/llms/models,请求头带x-api-key,免费额度每天 1000 次。 - 590 条记录里同一底模有多个配置。我按「模型名 + 厂商」去重,每组只留智能指数最高的一条。
- 同时有智能、编程、价格的有 160 条,去重后 123 个。下面的榜基于这 123 个。
三点口径,先说清楚:
- 价格是混合价(
$/M token,3:1 输入输出折算),不是真实账单。真实账单还看缓存、batch 折扣、代理商。 intelligence_index、coding_index是 Artificial Analysis 的自研综合分。比趋势可以,别把 1~2 分当严格胜负。- 自动化分是我自己拼的,见下文。
编程
纯编程力榜(coding_index):
| 模型 | 厂商 | 智能 | 编程 | 价$/M | 输出tps |
|---|---|---|---|---|---|
| Claude Opus 5 (Adaptive, Max) | Anthropic | 60.7 | 78.0 | 10 | 57 |
| GPT-5.6 Sol (max) | OpenAI | 58.9 | 77.4 | 11.25 | 68 |
| GPT-5.6 Terra (max) | OpenAI | 55.0 | 76.7 | 4.50 | 132 |
| Claude Fable 5 (Adaptive, Max) | Anthropic | 59.9 | 76.5 | 20 | 63 |
| Kimi K3 (max) | Kimi | 57.1 | 76.2 | 6 | 34 |
| Grok 4.5 (high) | SpaceXAI | 53.8 | 72.4 | 3 | 54 |
| GPT-5.6 Luna (max) | OpenAI | 51.2 | 71.4 | 0.45 | 172 |
| Gemini 3.5 Flash (high) | 50.2 | 70.1 | 3.38 | 220 | |
| DeepSeek V4 Flash 0731 (Reasoning, Max) | DeepSeek | 49.9 | 69.1 | 0.17 | - |
编程力和价格基本正交。前两名的 Claude Opus 5、GPT-5.6 Sol 强,但 $10~11/M。难的重构、架构、跨仓库调试,这钱该花。
日常编码不用为几分付十倍价。GPT-5.6 Terra (max) 是特例:编程 76.7 贴着天花板,价格 $4.5,132 tps。高端编程力和合理价格难得重合。
性价比榜(coding_index ÷ 价):
| 模型 | 编程 | 智能 | 价$/M | 编程/价 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 (Reasoning, Max) | 69.1 | 49.9 | 0.17 | 394.9 |
| MiMo-V2.5 | 56.8 | 37.2 | 0.17 | 324.6 |
| Hy3 (Tencent) | 58.8 | 41.2 | 0.24 | 244.0 |
| GPT-5.6 Luna (max) | 71.4 | 51.2 | 0.45 | 158.7 |
| DeepSeek V3.2 (Reasoning) | 44.2 | 32.0 | 0.32 | 140.3 |
GPT-5.6 Luna (max) 单拎出来:编程 71.4,$0.45。它是「接近前沿能力」里最便宜的。
我的取法:硬骨头上 GPT-5.6 Terra (max) 或 Claude Opus 5,批量常规编码用 GPT-5.6 Luna (max) 或 DeepSeek V4 Flash。后者跟旗舰差 20~60 倍成本,多数任务感觉不出区别。
日常自动化(性价比优先)
没有现成的「适不适合自动化」指标,我自己拼:
自动化分 = tau2 × 40% + 指令遵循 × 40% + 终端操作 × 20%
自动化跑的是高频脚本和 agent,听话(指令遵循)和闭环(tau2)最关键,终端操作权重压低。自动化要追性价比,所以主榜按「分 ÷ 价」排。
先说结论:自动化能力到 85 分就封顶了。能力榜第一 Qwen3.7 Max 85.0 分要 $3.75,GPT-5.5 84.7 分要 $11.25——比 DeepSeek V4 Flash 的 82.0 分只高 3 分,价格高 22 到 66 倍。这 3 分不值得。
真正能用的性价比选择(能力 ≥ 75):
| 模型 | 自动化分 | 价$/M | 分/价 | tau2 | 指令 | 终端 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash (Reasoning, Max) | 82.0 | 0.17 | 468.8 | 0.950 | 0.792 | 0.618 |
| MiMo-V2.5 | 75.8 | 0.17 | 433.4 | 0.906 | 0.671 | 0.637 |
| MiMo-V2.5-Pro | 82.6 | 0.54 | 151.9 | 0.942 | 0.799 | 0.652 |
| Kimi K2.6 | 81.9 | 1.71 | 47.9 | 0.959 | 0.760 | 0.659 |
| GLM-5.2 (max) | 84.6 | 2.15 | 39.3 | 0.991 | 0.733 | 0.779 |
DeepSeek V4 Flash 是这档的最优解:82 分,$0.17。要更稳的关键任务,MiMo-V2.5-Pro(82.6,$0.54)或 GLM-5.2(84.6,$2.15)顶上,仍然比旗舰便宜一个量级。
注:纯性价比榜最前面是 Qwen3.5 4B、Gemma 4 E4B 这类小模型,比值上千,但绝对能力太低(自动化分 26~63),只够干最轻的活,不算真正的自动化选项。
分层搭配
| 场景 | 模型 | 价$/M | 依据 |
|---|---|---|---|
| 重活 / 硬编码 | GPT-5.6 Terra (max) | 4.5 | 编程 76.7 |
| 日常编码 + 自动化 | DeepSeek V4 Flash 0731 | 0.17 | 全能性价比王 |
| 极速高频轻任务 | GPT-5.6 Luna (max) | 0.45 | 172 tps,编程 71.4 |
| 关键 agent 任务 | GLM-5.2 (max) | 2.15 | 自动化 84.6 |
80% 流量走 $0.17~0.45 档,只有真需要才碰 $4.5 档。对比「什么都用旗舰」,成本压到零头,体感质量几乎不掉。