想找个便宜又能打的模型跑日常脚本,发现各家定价和 benchmark 散在十几个页面,没法横向比。Artificial Analysis 有免费 API,注册拿 key 就能整包拉数据。我拉了 590 条,写脚本按需求重排了一遍。

一句话结论

  • 全能性价比之王:DeepSeek V4 Flash 0731。编程 69.1、智能 49.9、自动化 82.0,价格 $0.17/M。日常高频任务直接用它。
  • 顶级编程力、不想花旗舰的钱:GPT-5.6 Terra (max),编程 76.7,$4.5/M,旗舰的一半。
  • 便宜的大批量编码:GPT-5.6 Luna (max),编程 71.4,$0.45/M
  • 关键 agent 任务:GLM-5.2 (max),自动化 84.6,$2.15/M

数据口径

  • 接口:GET https://artificialanalysis.ai/api/v2/data/llms/models,请求头带 x-api-key,免费额度每天 1000 次。
  • 590 条记录里同一底模有多个配置。我按「模型名 + 厂商」去重,每组只留智能指数最高的一条。
  • 同时有智能、编程、价格的有 160 条,去重后 123 个。下面的榜基于这 123 个。

三点口径,先说清楚:

  • 价格是混合价$/M token,3:1 输入输出折算),不是真实账单。真实账单还看缓存、batch 折扣、代理商。
  • intelligence_indexcoding_index 是 Artificial Analysis 的自研综合分。比趋势可以,别把 1~2 分当严格胜负
  • 自动化分是我自己拼的,见下文。

编程

纯编程力榜(coding_index):

模型 厂商 智能 编程 价$/M 输出tps
Claude Opus 5 (Adaptive, Max) Anthropic 60.7 78.0 10 57
GPT-5.6 Sol (max) OpenAI 58.9 77.4 11.25 68
GPT-5.6 Terra (max) OpenAI 55.0 76.7 4.50 132
Claude Fable 5 (Adaptive, Max) Anthropic 59.9 76.5 20 63
Kimi K3 (max) Kimi 57.1 76.2 6 34
Grok 4.5 (high) SpaceXAI 53.8 72.4 3 54
GPT-5.6 Luna (max) OpenAI 51.2 71.4 0.45 172
Gemini 3.5 Flash (high) Google 50.2 70.1 3.38 220
DeepSeek V4 Flash 0731 (Reasoning, Max) DeepSeek 49.9 69.1 0.17 -

编程力和价格基本正交。前两名的 Claude Opus 5GPT-5.6 Sol 强,但 $10~11/M。难的重构、架构、跨仓库调试,这钱该花。

日常编码不用为几分付十倍价。GPT-5.6 Terra (max) 是特例:编程 76.7 贴着天花板,价格 $4.5,132 tps。高端编程力和合理价格难得重合。

性价比榜(coding_index ÷ 价):

模型 编程 智能 价$/M 编程/价
DeepSeek V4 Flash 0731 (Reasoning, Max) 69.1 49.9 0.17 394.9
MiMo-V2.5 56.8 37.2 0.17 324.6
Hy3 (Tencent) 58.8 41.2 0.24 244.0
GPT-5.6 Luna (max) 71.4 51.2 0.45 158.7
DeepSeek V3.2 (Reasoning) 44.2 32.0 0.32 140.3

GPT-5.6 Luna (max) 单拎出来:编程 71.4,$0.45。它是「接近前沿能力」里最便宜的。

我的取法:硬骨头上 GPT-5.6 Terra (max)Claude Opus 5,批量常规编码用 GPT-5.6 Luna (max)DeepSeek V4 Flash。后者跟旗舰差 20~60 倍成本,多数任务感觉不出区别。

日常自动化(性价比优先)

没有现成的「适不适合自动化」指标,我自己拼:

自动化分 = tau2 × 40% + 指令遵循 × 40% + 终端操作 × 20%

自动化跑的是高频脚本和 agent,听话(指令遵循)和闭环(tau2)最关键,终端操作权重压低。自动化要追性价比,所以主榜按「分 ÷ 价」排。

先说结论:自动化能力到 85 分就封顶了。能力榜第一 Qwen3.7 Max 85.0 分要 $3.75GPT-5.5 84.7 分要 $11.25——比 DeepSeek V4 Flash 的 82.0 分只高 3 分,价格高 22 到 66 倍。这 3 分不值得。

真正能用的性价比选择(能力 ≥ 75):

模型 自动化分 价$/M 分/价 tau2 指令 终端
DeepSeek V4 Flash (Reasoning, Max) 82.0 0.17 468.8 0.950 0.792 0.618
MiMo-V2.5 75.8 0.17 433.4 0.906 0.671 0.637
MiMo-V2.5-Pro 82.6 0.54 151.9 0.942 0.799 0.652
Kimi K2.6 81.9 1.71 47.9 0.959 0.760 0.659
GLM-5.2 (max) 84.6 2.15 39.3 0.991 0.733 0.779

DeepSeek V4 Flash 是这档的最优解:82 分,$0.17。要更稳的关键任务,MiMo-V2.5-Pro(82.6,$0.54)或 GLM-5.2(84.6,$2.15)顶上,仍然比旗舰便宜一个量级。

注:纯性价比榜最前面是 Qwen3.5 4BGemma 4 E4B 这类小模型,比值上千,但绝对能力太低(自动化分 26~63),只够干最轻的活,不算真正的自动化选项。

分层搭配

场景 模型 价$/M 依据
重活 / 硬编码 GPT-5.6 Terra (max) 4.5 编程 76.7
日常编码 + 自动化 DeepSeek V4 Flash 0731 0.17 全能性价比王
极速高频轻任务 GPT-5.6 Luna (max) 0.45 172 tps,编程 71.4
关键 agent 任务 GLM-5.2 (max) 2.15 自动化 84.6

80% 流量走 $0.17~0.45 档,只有真需要才碰 $4.5 档。对比「什么都用旗舰」,成本压到零头,体感质量几乎不掉。

更新:2026-8-5

 coding  creator            intelligence  name                                            output_tps  price_blended  ttft
 69.1    DeepSeek           49.9          DeepSeek V4 Flash 0731 (Reasoning, Max Effort)  113         0.18           0.95
 56.2    DeepSeek           40.3          DeepSeek V4 Flash (Reasoning, Max Effort)       0           0.17           0
 58.8    Tencent            41.2          Hy3                                             71          0.24           1.77
 71.4    OpenAI             51.2          GPT-5.6 Luna (max)                              167         0.45           61.63
 58.6    MiniMax            44.4          MiniMax-M3                                      85          0.53           1.16
 59.4    DeepSeek           44.3          DeepSeek V4 Pro (Reasoning, Max Effort)         67          0.54           1.12
 60.2    Xiaomi             42.2          MiMo-V2.5-Pro                                   47          0.54           2
 52.9    Thinking Machines  40.2          Inkling Small                                   131         0.53           1.58
 59.1    Nex AGI            41            Nex-N2-Pro                                      138         1              0.89
 61.8    Kimi               44.2          Kimi K2.6                                       0           1.71           0
 71.3    Meta               50.6          Muse Spark 1.1 (xhigh)                          202         2              2.24
 68.8    Z AI               51.1          GLM-5.2 (max)                                   201         2.09           0.96
 60.8    Kimi               41.9          Kimi K2.7 Code                                  38          1.71           1.2
 56.1    OpenAI             40            GPT-5.4 mini (xhigh)                            0           1.69           0
 52.1    Thinking Machines  40.7          Inkling (xhigh)                                 85          1.76           2.1
 55.8    Z AI               40.2          GLM-5.1 (Reasoning)                             0           2.13           0
 72.4    SpaceXAI           53.8          Grok 4.5 (high)                                 59          3              12.9
 69.2    Google             50.1          Gemini 3.6 Flash (high)                         232         3              16.93
 70.1    Google             50.2          Gemini 3.5 Flash (high)                         269         3.38           12.91
 None    Alibaba            40            Qwen3.6 Max Preview                             0           2.93           0
字段 含义
name 模型名称,例如 GPT-5DeepSeek V3
creator 模型创建方/厂商,例如 OpenAI、DeepSeek
intelligence Artificial Analysis Intelligence Index,综合智能评分;通常越高越好
coding Artificial Analysis Coding Index,编程能力评分;通常越高越好
output_tps 输出速度,平均每秒生成的 token 数(中位数);越高越快
price_blended 混合价格,单位是美元/百万 token,按输入:输出约 3:1 加权
ttft Time To First Token,收到第一个 token 前的等待时间(中位数),单位秒;越低越好