Grok 4.6 冲进御三家:61 分、不涨价、把 Agent 活儿压到 0.84 刀一单
马斯克隔 35 天又把 Grok 从 4.5 顶到 4.6,顺手预告 4.7「会超过当前所有模型」。AA 智能指数 61、GDPVal-AA v2 1753、DeepSWE 65.9、Harvey LAB 法律 15.8%,API 却还是 2 / 6 刀百万 tok 的老价签,AA 估的单任务成本 0.84 刀。SpaceXAI 这轮不是「变大」,是拿着 4.5 同底座磨后训练、把 Cursor 真实开发数据灌进 SFT、再去抢 Agent 工作流的那把椅子。 御三家原本指 OpenAI / Anthropic / Google;Gemini 3.5 Pro 跳票、DeepMind 换帅,第三把椅空了半截——Grok 4.6 是不是坐上去的那个,得拆开看。 榜单:综合第三,知识工作第一,终端活儿仍菜 xAI 官方对比表重排后: 评测 Grok 4.6 High Grok 4.5 High GPT-5.6 Sol Max Fable 5 Max AA Intelligence Index 61 56 61 62 GDPVal-AA v2 (Elo) 1753 1526 1728 1741 CursorBench v3.2 69.9% 66.7% 67.2% 70.5% DeepSWE v1.1 65.9% 54.0% 73.0% 70.0% FrontierCode v1.1 Ext 61.3% 56.6% 60.6% 63.6% APEX-Agents 57.5% 47.1% 56.7% 59.2% Terminal-Bench v3.0 26% 15.7% 34.6% 34.1% APEX-SWE 56.4% 53.6% — 58.8% AA-Briefcase (Elo) 1577 1313 1502 1574 Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%
读表别只看 61 总分 :GDPVal-AA、AA-Briefcase、Harvey LAB 上 Grok 4.6 反超 Fable 5 / Sol;但 DeepSWE 落后 Sol 7.1 点、Terminal 落后约 8.6 点——长程知识工作 / 法务 / 多步 Agent 是它的场,纯修大代码库和终端运维仍归 OpenAI / Anthropic。 后训练磨出来的,不是换底座 4.6 沿用 4.5 的底座规模,提升全来自更长的补充训练:用 4.5 重生 SFT 轨迹(STEM / SW…