又一个大模型开始把竞争重点从“回答得更聪明”,转向“能不能把一件复杂工作真正做完”。
9月22日,马斯克旗下AI公司 SpaceXAI 正式发布新一代模型 Grok 4.7,重点瞄准编程、知识工作以及需要长时间持续执行的复杂任务。
SpaceXAI称,Grok 4.7采用了规模更大的基础模型,并进行了更长时间的强化学习训练,目前是公司最强的编码和知识处理模型。
价格则延续了上一代的低价策略:输入每百万Token 2美元,输出每百万Token 6美元。
按照官方说法,Grok 4.7在速度、价格和性能之间进行了重新平衡,并针对长时间编程任务进行了专门优化。
不只是“更大的模型”,而是让AI干活更久
与上一代Grok 4.6相比,Grok 4.7最明显的变化并不是简单增加模型参数,而是训练方式发生了变化。
SpaceXAI表示,新模型使用了更大的基础模型,同时接受了更长时间的强化学习训练。
训练数据也更加侧重那些需要数小时才能完成的复杂任务。
这其实对应着AI应用正在发生的一种变化。
早期的大模型主要解决的是“问一个问题,给一个答案”。
而现在的AI Agent和编程助手,需要处理的往往是一项完整工作:
分析需求、阅读代码、修改文件、运行测试、发现错误,再重新修改,最后提交结果。
这种任务最大的难点并不是某一个瞬间的推理能力,而是能否持续保持上下文,并在发现错误之后自己纠正。
SpaceXAI因此特别加强了Grok 4.7的自我验证和长上下文管理能力。
简单来说,就是让模型少一点“答完就算”,多一点“做完再检查”。
专门为编程Agent训练
Grok 4.7此次还针对 Grok Bot harness 进行了原生训练。
这意味着SpaceXAI并不是只把模型本身训练得更强,而是开始围绕“模型+工具+执行环境”进行整体优化。
对于编程场景而言,这一点尤其重要。
一个真正的AI程序员并不是只需要生成几段代码,而需要不断与开发环境交互。
例如:
读取代码 → 理解项目 → 修改代码 → 执行测试 → 分析报错 → 再次修改 → 验证结果。
因此,模型是否适合Agent运行环境,已经成为衡量编码模型的重要指标。
SpaceXAI表示,Grok 4.7在CursorBench 4.0测试中针对长时间运行的编程任务表现突出。
与此同时,Grok 4.7已经通过 Cursor、Grok Build 提供,并开放Grok API,可以接入第三方编程工具、模型路由服务和云平台。
这也意味着它不只是面向Grok聊天产品的模型,而是在直接争夺开发者的AI编程入口。
从写代码,到做“知识工作”
Grok 4.7的目标也没有停留在程序员群体。
SpaceXAI同时强化了模型在文档、演示文稿以及一般知识工作中的能力。
在GDPval和AA Briefcase两项测试中,Grok 4.7相比Grok 4.6均有所提升。
这两类测试的共同特点,是要求AI完成更加接近真实职业工作的任务,例如律师、护士、金融分析师等专业人士日常会处理的工作。
这背后其实透露出大模型竞争的一个重要方向:
AI公司的竞争对象正在从“聊天机器人”变成“数字员工”。
如果模型只能回答问题,那么参数规模和知识准确率可能是核心指标。
但如果模型开始承担实际工作,评价标准就会变成另外一套东西——
能不能理解任务?
能不能连续工作?
能不能调用工具?
能不能发现自己的错误?
能不能最终交付一个可以使用的结果?
Grok 4.7显然正在沿着这条路线走。
价格没有涨,输入2美元、输出6美元
Grok 4.7另一个值得关注的地方,是价格。
SpaceXAI给出的API价格为:
| 项目 | 价格 |
|---|---|
| 输入 | 2美元 / 百万Token |
| 输出 | 6美元 / 百万Token |
| 高速版本 | 输出速度翻倍,价格也翻倍 |
按照目前汇率计算,输入成本约为每百万Token 13.4元人民币,输出约40.2元人民币。
SpaceXAI甚至宣称,相比同类模型,Grok 4.7能够做到“速度更快、价格更低”。
不过,这类横向比较需要结合具体模型、Token计算方式以及实际任务负载来看,单纯比较API单价并不能完全反映实际使用成本。
对于Agent而言,真正重要的还包括一次任务到底需要调用多少次模型,以及模型是否能够减少反复尝试的次数。
便宜的模型,如果需要调用十次,未必比贵一点但一次完成的模型更省钱。
这也是Grok 4.7把“长时间任务能力”放在重要位置的原因之一。
安全也成为新模型的一部分
随着模型开始执行代码、网络安全研究甚至生物相关任务,AI安全已经很难再只是一个简单的“敏感词过滤器”。
SpaceXAI表示,Grok 4.7采用了新的安全防护体系,在拒答和抵抗越狱攻击方面达到公司目前测试中的最高水平。
在双重用途领域,SpaceXAI尤其强调“既不能什么都拒绝,也不能什么都放行”。
例如网络安全领域,合法的安全研究、漏洞验证和红队工作本身具有实际价值,但同样的技术也可能被用于攻击。
SpaceXAI公布的HackerBench v0.3测试显示,Grok 4.7仅有3.3%的高风险双重用途提示通过,同时尽量减少对合法安全工作的阻止。
在生物安全测试中,Grok 4.7在LatchBio基准上获得62.4%的成绩。
此外,SpaceXAI已经开始向部分网络安全合作伙伴提供邀请制访问,用于红队能力和防御研究。
Grok的竞争逻辑正在发生变化
从Grok 4到Grok 4.7,SpaceXAI正在逐渐改变自己的模型竞争方式。
过去,大模型之间更多是比较:
参数规模、知识能力、数学推理、代码能力和Benchmark成绩。
但到了Agent时代,单项Benchmark的重要性正在下降。
一个模型即使某个考试分数很高,如果让它连续工作几个小时就开始遗忘上下文、重复犯错,实际价值仍然有限。
因此,Grok 4.7此次反复强调的其实是三个关键词:
长时间任务、工具调用、自我验证。
这三项能力组合起来,指向的已经不是传统意义上的聊天机器人,而是能够持续执行任务的AI Agent。
从这个角度看,Grok 4.7真正值得关注的并不是“4.7”这个数字,而是SpaceXAI正在尝试把模型竞争从**“谁回答得更好”推进到“谁能把事情做完”**。
而这场竞争,接下来很可能会从模型公司进一步蔓延到Cursor、云平台、AI编程工具以及整个Agent基础设施市场。






