mitce机场,0.6/月
博文

DeepSeek V4 Flash 之后,大模型开始卷「智效比」而不是「智商」了

刺猬
DeepSeek V4 Flash

过去选模型有点「颜控」——谁占 SOTA、谁跑分高,哪怕按次结账能烧穿额度也先冲。Agent 一来画风变了:它自己搜资料、读文件、写码、跑测试、报错重来,你甩一句话它在后台刷上百次工具调用。AI 不会免费加班,Token 按趟结,这时不能只看智商,得看它能不能细水长流式打工

DeepSeek V4 Flash 被叫「斩杀线」——不一定每项第一,但能力覆盖大量真实活、价格够低。APPSO 拿「给 AI 一块钱看它干多少活」重测了一遍,顺手揪出蚂蚁 Ling-3.0-Flash 这匹黑马。这篇不转 benchmark 长表,把账本拆开看。

一块钱能雇 AI 干多少活

先让 V4 Flash Max 搭一个 DeepSeek API 非官方状态监控页(自定结构+原创二次元吉祥物+抓状态信息),实跑:

模型调用次数输入 tok输出 tok花费
DeepSeek V4 Flash Max251.22M66,995$0.0758
Ling-3.0-Flash250.94M14,752$0.0402
Claude Sonnet 4.6$2.50(同题审美页)

Ling 同活比 V4 Flash Max 便宜约 40%、输入少 30%、输出只有 1/4.5;Sonnet 4.6 审美更贴《奥德赛》电影感,但单价把预算直接干到 2.5 刀[1](@ref)。

换到「上海去哪看诺兰《奥德赛》」的长调研页,差距更直白:

  • Ling-3.0-Flash:137 次请求 / 3.26M tok / 17m55s / $0.483,错推了内地没有的 IMAX 70mm 厅,但重跑两三次仍比 Sonnet 便宜
  • Claude Sonnet 4.6:14 次工具调用 / 1.10M tok / 16.1m / $2.50,约为 Ling 的 6 倍价

Ling 不是智能上限最高那个,但短输入、定字段抽取、高频 API Agent 执行层里,调用量越大越像黑马[1](@ref)。

智效比这道公式

APPSO 造了词:智效比 = 真正解决问题的力 ÷(激活参数 + Token + 时间 + 价格)。Artificial Analysis 智能指数(Intelligence Index v4.1.1)上,Ling-3.0-Flash 综合 38 分,追平 MiMo-V2.5 与 Qwen3.6 27B;总参 124B、推理仅激活 5.1B,比同体量的 Qwen3.6 122B 激活参数少一半[1,3](@ref)。

# 智效比坐标(越大越能花小钱办大事)
Ling-3.0-Flash   124B 总参 / 5.1B 激活 / AA=38 / 单任务≈$0.04
DeepSeek V4 Flash 284B 总参 / ~13B 激活 / AA=50 / 单任务≈$0.03-0.04
Claude Fable 5   AA 领先 / 单任务 $3.15 / 约为 V4 Flash 的 105x

Hugging Face 联合创始人 clem 引的测算更狠:待测模型单任务成本差 约 800 倍,Claude Fable 5 均价超 $31/任务,V4 Flash Max 约 $0.04,开源权重 GLM-5.2 / V4 Pro 进「同智能档价格 25% 内」区[1,5](@ref)。

为什么 8T Token/日 是信号不是噪点

OpenCode 自报 DeepSeek V4 Flash 在 8 月 1 日经其平台吃掉 8 万亿 tok(5T 免费 + 3T Go 付费),不是全网审计数但是 Agent 工具侧单日流量[1,2,10](@ref)。按官方牌价(入 $0.14 / 出 $0.28、命中缓存入 $0.0028)混算,便宜缓存比高的 agent harness 能把单 task 压到几分钱、把同体量闭源旗舰按成本比拉开百倍级。

Agent 时代评价单位从「一次回答」变成「一项可被验证交付的任务」:规划—检索—执行—验证—复盘拆成上百轮,五个 Agent 并行跑。智效比不够,模型不敢多查一个源、不敢并行三条路线、验证崩了没预算重来[1,10](@ref)。

落到自己选型

V4 Flash 把 1M 上下文+代码/Agent 能力塞进低价区;Ling-3.0-Flash 用 5.1B 激活换 353 tok/s 吞吐、跑批量抽取/工具调用执行层更省[3,4](@ref)。旗舰闭源模型留着做「要审美的最后一跳」,执行层别用它按轮结账。

AGI 是山顶,但多数人工作在山脚:读码、回消息、查资料、跑流水。智能不再只是惊艳指标,而是可千次复跑的单位交付成本——这词叫智效比。


信源:APPSO 智效比长文+Artificial Analysis Intelligence Index v4.1.1、OpenCode 8/1 平台用量自报、蚂蚁百灵 Ling-3.0-Flash 模型卡。

发表评论