想找个便宜又能打的模型跑日常脚本,发现各家定价和 benchmark 散在十几个页面,没法横向比。Artificial Analysis 有免费 API,注册拿 key 就能整包拉数据。我拉了 590 条,写脚本按需求重排了一遍。

一句话结论

  • 全能性价比之王:DeepSeek V4 Flash 0731。编程 69.1、智能 49.9、自动化 82.0,价格 $0.17/M。日常高频任务直接用它。
  • 顶级编程力、不想花旗舰的钱:GPT-5.6 Terra (max),编程 76.7,$4.5/M,旗舰的一半。
  • 便宜的大批量编码:GPT-5.6 Luna (max),编程 71.4,$0.45/M
  • 关键 agent 任务:GLM-5.2 (max),自动化 84.6,$2.15/M

数据口径

  • 接口:GET https://artificialanalysis.ai/api/v2/data/llms/models,请求头带 x-api-key,免费额度每天 1000 次。
  • 590 条记录里同一底模有多个配置。我按「模型名 + 厂商」去重,每组只留智能指数最高的一条。
  • 同时有智能、编程、价格的有 160 条,去重后 123 个。下面的榜基于这 123 个。

三点口径,先说清楚:

  • 价格是混合价$/M token,3:1 输入输出折算),不是真实账单。真实账单还看缓存、batch 折扣、代理商。
  • intelligence_indexcoding_index 是 Artificial Analysis 的自研综合分。比趋势可以,别把 1~2 分当严格胜负
  • 自动化分是我自己拼的,见下文。

编程

纯编程力榜(coding_index):

模型 厂商 智能 编程 价$/M 输出tps
Claude Opus 5 (Adaptive, Max) Anthropic 60.7 78.0 10 57
GPT-5.6 Sol (max) OpenAI 58.9 77.4 11.25 68
GPT-5.6 Terra (max) OpenAI 55.0 76.7 4.50 132
Claude Fable 5 (Adaptive, Max) Anthropic 59.9 76.5 20 63
Kimi K3 (max) Kimi 57.1 76.2 6 34
Grok 4.5 (high) SpaceXAI 53.8 72.4 3 54
GPT-5.6 Luna (max) OpenAI 51.2 71.4 0.45 172
Gemini 3.5 Flash (high) Google 50.2 70.1 3.38 220
DeepSeek V4 Flash 0731 (Reasoning, Max) DeepSeek 49.9 69.1 0.17 -

编程力和价格基本正交。前两名的 Claude Opus 5GPT-5.6 Sol 强,但 $10~11/M。难的重构、架构、跨仓库调试,这钱该花。

日常编码不用为几分付十倍价。GPT-5.6 Terra (max) 是特例:编程 76.7 贴着天花板,价格 $4.5,132 tps。高端编程力和合理价格难得重合。

性价比榜(coding_index ÷ 价):

模型 编程 智能 价$/M 编程/价
DeepSeek V4 Flash 0731 (Reasoning, Max) 69.1 49.9 0.17 394.9
MiMo-V2.5 56.8 37.2 0.17 324.6
Hy3 (Tencent) 58.8 41.2 0.24 244.0
GPT-5.6 Luna (max) 71.4 51.2 0.45 158.7
DeepSeek V3.2 (Reasoning) 44.2 32.0 0.32 140.3

GPT-5.6 Luna (max) 单拎出来:编程 71.4,$0.45。它是「接近前沿能力」里最便宜的。

我的取法:硬骨头上 GPT-5.6 Terra (max)Claude Opus 5,批量常规编码用 GPT-5.6 Luna (max)DeepSeek V4 Flash。后者跟旗舰差 20~60 倍成本,多数任务感觉不出区别。

日常自动化(性价比优先)

没有现成的「适不适合自动化」指标,我自己拼:

自动化分 = tau2 × 40% + 指令遵循 × 40% + 终端操作 × 20%

自动化跑的是高频脚本和 agent,听话(指令遵循)和闭环(tau2)最关键,终端操作权重压低。自动化要追性价比,所以主榜按「分 ÷ 价」排。

先说结论:自动化能力到 85 分就封顶了。能力榜第一 Qwen3.7 Max 85.0 分要 $3.75GPT-5.5 84.7 分要 $11.25——比 DeepSeek V4 Flash 的 82.0 分只高 3 分,价格高 22 到 66 倍。这 3 分不值得。

真正能用的性价比选择(能力 ≥ 75):

模型 自动化分 价$/M 分/价 tau2 指令 终端
DeepSeek V4 Flash (Reasoning, Max) 82.0 0.17 468.8 0.950 0.792 0.618
MiMo-V2.5 75.8 0.17 433.4 0.906 0.671 0.637
MiMo-V2.5-Pro 82.6 0.54 151.9 0.942 0.799 0.652
Kimi K2.6 81.9 1.71 47.9 0.959 0.760 0.659
GLM-5.2 (max) 84.6 2.15 39.3 0.991 0.733 0.779

DeepSeek V4 Flash 是这档的最优解:82 分,$0.17。要更稳的关键任务,MiMo-V2.5-Pro(82.6,$0.54)或 GLM-5.2(84.6,$2.15)顶上,仍然比旗舰便宜一个量级。

注:纯性价比榜最前面是 Qwen3.5 4BGemma 4 E4B 这类小模型,比值上千,但绝对能力太低(自动化分 26~63),只够干最轻的活,不算真正的自动化选项。

分层搭配

场景 模型 价$/M 依据
重活 / 硬编码 GPT-5.6 Terra (max) 4.5 编程 76.7
日常编码 + 自动化 DeepSeek V4 Flash 0731 0.17 全能性价比王
极速高频轻任务 GPT-5.6 Luna (max) 0.45 172 tps,编程 71.4
关键 agent 任务 GLM-5.2 (max) 2.15 自动化 84.6

80% 流量走 $0.17~0.45 档,只有真需要才碰 $4.5 档。对比「什么都用旗舰」,成本压到零头,体感质量几乎不掉。