马斯克隔 35 天又把 Grok 从 4.5 顶到 4.6,顺手预告 4.7「会超过当前所有模型」。AA 智能指数 61、GDPVal-AA v2 1753、DeepSWE 65.9、Harvey LAB 法律 15.8%,API 却还是 2 / 6 刀百万 tok 的老价签,AA 估的单任务成本 0.84 刀。SpaceXAI 这轮不是「变大」,是拿着 4.5 同底座磨后训练、把 Cursor 真实开发数据灌进 SFT、再去抢 Agent 工作流的那把椅子。
御三家原本指 OpenAI / Anthropic / Google;Gemini 3.5 Pro 跳票、DeepMind 换帅,第三把椅空了半截——Grok 4.6 是不是坐上去的那个,得拆开看。
榜单:综合第三,知识工作第一,终端活儿仍菜
xAI 官方对比表重排后:
| 评测 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 Ext | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase (Elo) | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
读表别只看 61 总分:GDPVal-AA、AA-Briefcase、Harvey LAB 上 Grok 4.6 反超 Fable 5 / Sol;但 DeepSWE 落后 Sol 7.1 点、Terminal 落后约 8.6 点——长程知识工作 / 法务 / 多步 Agent 是它的场,纯修大代码库和终端运维仍归 OpenAI / Anthropic。
后训练磨出来的,不是换底座
4.6 沿用 4.5 的底座规模,提升全来自更长的补充训练:用 4.5 重生 SFT 轨迹(STEM / SWE / 知识工作),模型自检滤样本,再在 kernel 优化、Web 开发、CAD 等真实环境跑 Agentic RL;SpaceX 年初收掉 Cursor 后,真实开发者调试轨迹首次进训练管线。代差体现到数字:DeepSWE +11.9、Terminal-Bench +10.3、APEX-Agents +10.4,Cursor CEO 背书「Opus 级智能+低价高吞吐」。
上下文 500K、High 档吞吐约 80 tok/s,做长程状态保持的多步任务(如河流演变五阶段演练、TERAFAB 3D 场景出码)不漂不中断。
定价:加量不加价,但长上下文有坑
| 模型 | 输入 $/1M | 输出 $/1M | 缓存命中输入 | 单任务成本(AA) |
|---|---|---|---|---|
| Grok 4.6 | 2.00 | 6.00 | 0.50 | ~$0.84 |
| Grok 4.5 | 2.00 | 6.00 | 0.30 | — |
| GPT-5.6 Sol | 5.00 | 30.00 | 0.50 | ~$1.23 |
| Claude Opus 5 | 5.00 | 25.00 | — | 更贵 |
短上下文报价比 Opus 5 / Sol 低 60% 以上;但长上下文档(20 万 tok 起)价格翻倍到 4 / 12,且整单所有 tok 按高价计,fast variant 也是标准价两倍。AA 按「跑完一单真实活」算,Grok 4.6 用 ~53 轮 / ~5 亿输入 tok 干完 Opus 5 要 103 轮 / 20 亿 tok 的活,单任务成本压到 0.84 刀。
御三家坐得稳吗
AA 总榜前排:Opus 5 (63) / Fable 5 (62) / Grok 4.6 (61) / GPT-5.6 Sol (61) / Kimi K3 (~59.7),Google 旗舰跳票掉出前排。Grok 4.6 坐进「综合第三」没问题,但是:
- 企业合规端:Grok Build CLI 曾被发现静默打整包代码传云端、模型本身有极端言论与图像滥用史,严监管行业不会只因分数转投
- 细分榜仍被 Sol / Fable 按在终端与 SWE 上,真做代码库维护不是首选
- 马斯克式跳跃迭代下 4.7 又在预告,API 契约稳定性要赌
所以更准确的说法:Grok 4.6 坐稳的是「前沿档里最便宜的那把转椅」——长文研报 / 法务抽取 / 多步 Agent 编排 / 高频出码,它目前单位智能最省;纯终端运维、大库修 bug、合规严区,椅子还没抢过来。
信源:xAI Introducing Grok 4.6 官方页、Artificial Analysis Intelligence Index v4.1.1 与 GDPVal/AA-Briefcase 转引、Cursor CEO 背书推文。
