
图片:Mariia Shalabaieva @ Unsplash
马斯克说Grok 4.5是"Opus级"模型.这话信几分?
7月8日,SpaceXAI发布Grok 4.5--这是它花600亿美元收购Cursor之后的第一款重磅模型.马斯克给它的定位标签很直接:"Opus-class",对标Anthropic的Claude Opus 4.8.
但xAI自己放出的跑分数据讲了一个分裂的故事:4项重点benchmark里,Grok 4.5赢了2项,输了2项.说它是"Opus级"--勉强说得过去,但要说全面碾压,真没有.
真正的杀手锏不在天花板,在账单上.
"Opus级"的含金量:4项跑分,赢2输2

图片:Justin Morgan @ Unsplash
先看硬指标.Grok 4.5的关键参数:约1.5万亿参数,50万token上下文窗口(100万即将推出),支持文本和图像输入,定价每百万token输入2美元,输出6美元,吞吐量约80 tokens/秒,原生集成X搜索.
跑分方面,xAI官方给出的对比是:4项重点benchmark中,Grok 4.5在2项上超过Claude Opus 4.8,另外2项落后.具体哪些benchmark,领先多少,素材中未详细披露--但这个"打平手"的格局很清楚:天花板能力上,Grok 4.5和Opus 4.8是同一档,但不是同一个天花板.
真正让Grok 4.5拉开差距的不是跑分,而是token效率.在SWE-Bench Pro(一个软件工程能力评测)上,Grok 4.5完成任务平均只用了15.9K个输出token,而Opus 4.8用了67K个.4.2倍的差距.这意味着什么?同样的活儿,Grok 4.5干的token量不到Opus的零头,直接折算成每个任务的成本--Grok 4.5便宜得多.
打个比方:两个程序员都能把bug修好,一个写了200行代码搞定,另一个写了800行,最后结果一样--你选谁?按token计费的时候,少写就是省钱.Grok 4.5就是那个写得少还干得漂亮的.
600亿买Cursor,训练数据里藏了真东西

图片:Ilya Pavlov @ Unsplash
Grok 4.5最值得说的一个差异点,藏在训练数据里.
收购Cursor花了600亿美元,但xAI没有只把Cursor当一个IDE壳子用.Grok 4.5的训练数据里包含了真实的Cursor开发者会话数据--调试轨迹,多文件diff,人类纠错记录.这不是静态的代码仓库,而是"代码是怎么被写出来的"全过程.
这个区别太关键了.传统代码模型训练用的是GitHub上的成品代码--就像只看菜谱,学的是"最后这道菜长什么样".但Cursor的会话数据记录的是开发者从写第一行到跑通整个流程的挣扎过程:哪里报错了,怎么改的,为什么这么改.相当于你不光看了菜谱,还看了厨师在厨房里手忙脚乱的全过程--翻车,补救,重来,每一步都有记录.
这种训练信号让Grok 4.5在理解"代码实际是怎么写的"这件事上,有了别的模型没有的信息优势.特别是在需要多文件协作,需要调试迭代的任务上,这个优势会直接体现出来.后面实测也验证了这一点.
实测:内核驱动一把过,子弹孔翻车了

图片:Markus Spiske @ Unsplash
跑分和参数说完了,真正能说明问题的是上手跑.
这次实测跑了一整套任务:多个3D场景,Linux内核驱动,V8发动机模型,精灵图修复,还有一个C++游戏及修复.全部跑完,API花费7.78美元.这个数字本身就是一个有意义的参考--对成本敏感的高频工作流来说,这就是决策依据.
最亮眼的:底层系统级编程. 测试要求写一个Linux内核模块,驱动一款没有文档的笔记本电脑RGB键盘灯.这个任务之前用另一个模型试过,结果惨不忍睹.Grok 4.5一把写出来,功能正常.底层,需要理解硬件接口的任务,是很多模型翻车的重灾区,Grok 4.5在这里表现出了真正的硬实力.这也印证了前面说的--Cursor会话数据里那些调试轨迹的训练信号,在这种需要反复试错,理解底层逻辑的任务上,价值直接兑现了.
同样亮眼的:参数化3D建模. 给定一个真实的物理约束--一个为特定直流电机设计的V8发动机--Grok 4.5完成了参数化3D建模.这不是"画个好看的图",而是要在物理约束下做出能用的模型.
多模态修复也很能打. 从截图修复损坏的精灵图3D模型,甚至在极少甚至没有文字引导的情况下也能完成.这种"看图修bug"的能力说明Grok 4.5的多模态不是摆设,是真能干活.
只是合格的水平: 通用的Three.js/3D场景生成.能做,但不出彩,中规中矩.
诚实的翻车点: 第一人称场景中的环境影响效果--比如弹孔--始终没能解决.这种需要精细物理模拟和视觉细节的任务,Grok 4.5目前搞不定.
什么时候该选Grok 4.5,什么时候别选

图片:Jackson Sophat @ Unsplash
总结一下,Grok 4.5是一个真正能打,定价有竞争力的模型.它和上一代前沿模型互有胜负,但最清晰的优势不是天花板能力,而是"每完成一个任务的成本".
选Grok 4.5的场景:
- 成本敏感,高频的编码/Agent工作流--4.2倍的token效率差距摆在那里
选Opus 4.8的场景:
- 你需要绝对最高的推理天花板,token成本不是首要考虑因素
还有一个实操建议:别只看发布日的跑分图.建一套你自己的,可重复的,针对具体任务的评测集--用窄的,有物理约束的,或者新颖的问题,别用那些通用的demo类目.只有你自己跑出来的信号,才是任何发布日跑分图都替代不了的.
7.78美元,一整套测试.内核驱动一把过,子弹孔没搞定.这就是Grok 4.5--不是六边形战士,但在它擅长的领域,性价比高得吓人.马斯克说"Opus级",嗯,勉强算.但真正让Grok 4.5站稳脚跟的,不是跑分赢了几个,是它花更少的token把活干完的能力.在Agent时代,token就是弹药,省弹药的就是赢.