博文

DeepSeek V4 Flash 之后,大模型开始卷「智效比」而不是「智商」了

刺猬
DeepSeek V4 Flash 之后,大模型开始卷「智效比」而不是「智商」了
过去选模型有点「颜控」——谁占 SOTA、谁跑分高,哪怕按次结账能烧穿额度也先冲。Agent 一来画风变了:它自己搜资料、读文件、写码、跑测试、报错重来,你甩一句话它在后台刷上百次工具调用。AI 不会免费加班,Token 按趟结, 这时不能只看智商,得看它能不能细水长流式打工 。 DeepSeek V4 Flash 被叫「斩杀线」——不一定每项第一,但能力覆盖大量真实活、价格够低。APPSO 拿「给 AI 一块钱看它干多少活」重测了一遍,顺手揪出蚂蚁 Ling-3.0-Flash 这匹黑马。这篇不转 benchmark 长表,把账本拆开看。 一块钱能雇 AI 干多少活 先让 V4 Flash Max 搭一个 DeepSeek API 非官方状态监控页(自定结构+原创二次元吉祥物+抓状态信息),实跑: 模型 调用次数 输入 tok 输出 tok 花费 DeepSeek V4 Flash Max 25 1.22M 66,995 $0.0758 Ling-3.0-Flash 25 0.94M 14,752 $0.0402 Claude Sonnet 4.6 — — — $2.50(同题审美页) Ling 同活比 V4 Flash Max 便宜约 40%、输入少 30%、输出只有 1/4.5;Sonnet 4.6 审美更贴《奥德赛》电影感,但单价把预算直接干到 2.5 刀[1](@ref)。 换到「上海去哪看诺兰《奥德赛》」的长调研页,差距更直白: Ling-3.0-Flash :137 次请求 / 3.26M tok / 17m55s / $0.483 ,错推了内地没有的 IMAX 70mm 厅,但重跑两三次仍比 Sonnet 便宜 Claude Sonnet 4.6 :14 次工具调用 / 1.10M tok / 16.1m / $2.50 ,约为 Ling 的 6 倍价 Ling 不是智能上限最高那个,但短输入、定字段抽取、高频 API Agent 执行层里,调用量越大越像黑马[1](@ref)。 智效比这道公式 APPSO 造了词: 智效比 = 真正解决问题的力 ÷(激活参数 + Token + 时间 + 价格) 。Artificial Analysis 智能指数(Intelligence Index v4.1.1)上,Ling-3.0-Flash 综合 38 分,追平 MiMo-V2.5 与 Qwen3.6 27B;总参 124B、推理…