mitce机场,0.6/月
博文

Grok 4.6 冲进御三家:61 分、不涨价、把 Agent 活儿压到 0.84 刀一单

刺猬
Grok 4.6

马斯克隔 35 天又把 Grok 从 4.5 顶到 4.6,顺手预告 4.7「会超过当前所有模型」。AA 智能指数 61、GDPVal-AA v2 1753、DeepSWE 65.9、Harvey LAB 法律 15.8%,API 却还是 2 / 6 刀百万 tok 的老价签,AA 估的单任务成本 0.84 刀。SpaceXAI 这轮不是「变大」,是拿着 4.5 同底座磨后训练、把 Cursor 真实开发数据灌进 SFT、再去抢 Agent 工作流的那把椅子。

御三家原本指 OpenAI / Anthropic / Google;Gemini 3.5 Pro 跳票、DeepMind 换帅,第三把椅空了半截——Grok 4.6 是不是坐上去的那个,得拆开看。

榜单:综合第三,知识工作第一,终端活儿仍菜

xAI 官方对比表重排后:

评测Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v2 (Elo)1753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54.0%73.0%70.0%
FrontierCode v1.1 Ext61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
APEX-SWE56.4%53.6%58.8%
AA-Briefcase (Elo)1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%

读表别只看 61 总分:GDPVal-AA、AA-Briefcase、Harvey LAB 上 Grok 4.6 反超 Fable 5 / Sol;但 DeepSWE 落后 Sol 7.1 点、Terminal 落后约 8.6 点——长程知识工作 / 法务 / 多步 Agent 是它的场,纯修大代码库和终端运维仍归 OpenAI / Anthropic。

后训练磨出来的,不是换底座

4.6 沿用 4.5 的底座规模,提升全来自更长的补充训练:用 4.5 重生 SFT 轨迹(STEM / SWE / 知识工作),模型自检滤样本,再在 kernel 优化、Web 开发、CAD 等真实环境跑 Agentic RL;SpaceX 年初收掉 Cursor 后,真实开发者调试轨迹首次进训练管线。代差体现到数字:DeepSWE +11.9、Terminal-Bench +10.3、APEX-Agents +10.4,Cursor CEO 背书「Opus 级智能+低价高吞吐」。

上下文 500K、High 档吞吐约 80 tok/s,做长程状态保持的多步任务(如河流演变五阶段演练、TERAFAB 3D 场景出码)不漂不中断。

定价:加量不加价,但长上下文有坑

模型输入 $/1M输出 $/1M缓存命中输入单任务成本(AA)
Grok 4.62.006.000.50~$0.84
Grok 4.52.006.000.30
GPT-5.6 Sol5.0030.000.50~$1.23
Claude Opus 55.0025.00更贵

短上下文报价比 Opus 5 / Sol 低 60% 以上;但长上下文档(20 万 tok 起)价格翻倍到 4 / 12,且整单所有 tok 按高价计,fast variant 也是标准价两倍。AA 按「跑完一单真实活」算,Grok 4.6 用 ~53 轮 / ~5 亿输入 tok 干完 Opus 5 要 103 轮 / 20 亿 tok 的活,单任务成本压到 0.84 刀。

御三家坐得稳吗

AA 总榜前排:Opus 5 (63) / Fable 5 (62) / Grok 4.6 (61) / GPT-5.6 Sol (61) / Kimi K3 (~59.7),Google 旗舰跳票掉出前排。Grok 4.6 坐进「综合第三」没问题,但是:

  • 企业合规端:Grok Build CLI 曾被发现静默打整包代码传云端、模型本身有极端言论与图像滥用史,严监管行业不会只因分数转投
  • 细分榜仍被 Sol / Fable 按在终端与 SWE 上,真做代码库维护不是首选
  • 马斯克式跳跃迭代下 4.7 又在预告,API 契约稳定性要赌

所以更准确的说法:Grok 4.6 坐稳的是「前沿档里最便宜的那把转椅」——长文研报 / 法务抽取 / 多步 Agent 编排 / 高频出码,它目前单位智能最省;纯终端运维、大库修 bug、合规严区,椅子还没抢过来。


信源:xAI Introducing Grok 4.6 官方页、Artificial Analysis Intelligence Index v4.1.1 与 GDPVal/AA-Briefcase 转引、Cursor CEO 背书推文。

发表评论