TG首页 资讯 查看内容

Grok 4.7来了:百万Token输入2美元,马斯克把AI竞争推向“长时间干活” ... ...

又一个大模型开始把竞争重点从“回答得更聪明”,转向“能不能把一件复杂工作真正做完”。

9月22日,马斯克旗下AI公司 SpaceXAI 正式发布新一代模型 Grok 4.7,重点瞄准编程、知识工作以及需要长时间持续执行的复杂任务。

SpaceXAI称,Grok 4.7采用了规模更大的基础模型,并进行了更长时间的强化学习训练,目前是公司最强的编码和知识处理模型。

价格则延续了上一代的低价策略:输入每百万Token 2美元,输出每百万Token 6美元

按照官方说法,Grok 4.7在速度、价格和性能之间进行了重新平衡,并针对长时间编程任务进行了专门优化。

不只是“更大的模型”,而是让AI干活更久

与上一代Grok 4.6相比,Grok 4.7最明显的变化并不是简单增加模型参数,而是训练方式发生了变化。

SpaceXAI表示,新模型使用了更大的基础模型,同时接受了更长时间的强化学习训练。

训练数据也更加侧重那些需要数小时才能完成的复杂任务

这其实对应着AI应用正在发生的一种变化。

早期的大模型主要解决的是“问一个问题,给一个答案”。

而现在的AI Agent和编程助手,需要处理的往往是一项完整工作:

分析需求、阅读代码、修改文件、运行测试、发现错误,再重新修改,最后提交结果。

这种任务最大的难点并不是某一个瞬间的推理能力,而是能否持续保持上下文,并在发现错误之后自己纠正

SpaceXAI因此特别加强了Grok 4.7的自我验证和长上下文管理能力。

简单来说,就是让模型少一点“答完就算”,多一点“做完再检查”。

专门为编程Agent训练

Grok 4.7此次还针对 Grok Bot harness 进行了原生训练。

这意味着SpaceXAI并不是只把模型本身训练得更强,而是开始围绕“模型+工具+执行环境”进行整体优化。

对于编程场景而言,这一点尤其重要。

一个真正的AI程序员并不是只需要生成几段代码,而需要不断与开发环境交互。

例如:

读取代码 → 理解项目 → 修改代码 → 执行测试 → 分析报错 → 再次修改 → 验证结果。

因此,模型是否适合Agent运行环境,已经成为衡量编码模型的重要指标。

SpaceXAI表示,Grok 4.7在CursorBench 4.0测试中针对长时间运行的编程任务表现突出。

与此同时,Grok 4.7已经通过 Cursor、Grok Build 提供,并开放Grok API,可以接入第三方编程工具、模型路由服务和云平台。

这也意味着它不只是面向Grok聊天产品的模型,而是在直接争夺开发者的AI编程入口。

从写代码,到做“知识工作”

Grok 4.7的目标也没有停留在程序员群体。

SpaceXAI同时强化了模型在文档、演示文稿以及一般知识工作中的能力。

在GDPval和AA Briefcase两项测试中,Grok 4.7相比Grok 4.6均有所提升。

这两类测试的共同特点,是要求AI完成更加接近真实职业工作的任务,例如律师、护士、金融分析师等专业人士日常会处理的工作。

这背后其实透露出大模型竞争的一个重要方向:

AI公司的竞争对象正在从“聊天机器人”变成“数字员工”。

如果模型只能回答问题,那么参数规模和知识准确率可能是核心指标。

但如果模型开始承担实际工作,评价标准就会变成另外一套东西——

能不能理解任务?

能不能连续工作?

能不能调用工具?

能不能发现自己的错误?

能不能最终交付一个可以使用的结果?

Grok 4.7显然正在沿着这条路线走。

价格没有涨,输入2美元、输出6美元

Grok 4.7另一个值得关注的地方,是价格。

SpaceXAI给出的API价格为:

项目价格
输入2美元 / 百万Token
输出6美元 / 百万Token
高速版本输出速度翻倍,价格也翻倍

按照目前汇率计算,输入成本约为每百万Token 13.4元人民币,输出约40.2元人民币。

SpaceXAI甚至宣称,相比同类模型,Grok 4.7能够做到“速度更快、价格更低”。

不过,这类横向比较需要结合具体模型、Token计算方式以及实际任务负载来看,单纯比较API单价并不能完全反映实际使用成本。

对于Agent而言,真正重要的还包括一次任务到底需要调用多少次模型,以及模型是否能够减少反复尝试的次数。

便宜的模型,如果需要调用十次,未必比贵一点但一次完成的模型更省钱。

这也是Grok 4.7把“长时间任务能力”放在重要位置的原因之一。

安全也成为新模型的一部分

随着模型开始执行代码、网络安全研究甚至生物相关任务,AI安全已经很难再只是一个简单的“敏感词过滤器”。

SpaceXAI表示,Grok 4.7采用了新的安全防护体系,在拒答和抵抗越狱攻击方面达到公司目前测试中的最高水平。


在双重用途领域,SpaceXAI尤其强调“既不能什么都拒绝,也不能什么都放行”。

例如网络安全领域,合法的安全研究、漏洞验证和红队工作本身具有实际价值,但同样的技术也可能被用于攻击。

SpaceXAI公布的HackerBench v0.3测试显示,Grok 4.7仅有3.3%的高风险双重用途提示通过,同时尽量减少对合法安全工作的阻止。

在生物安全测试中,Grok 4.7在LatchBio基准上获得62.4%的成绩。

此外,SpaceXAI已经开始向部分网络安全合作伙伴提供邀请制访问,用于红队能力和防御研究。

Grok的竞争逻辑正在发生变化

从Grok 4到Grok 4.7,SpaceXAI正在逐渐改变自己的模型竞争方式。

过去,大模型之间更多是比较:

参数规模、知识能力、数学推理、代码能力和Benchmark成绩。


但到了Agent时代,单项Benchmark的重要性正在下降。

一个模型即使某个考试分数很高,如果让它连续工作几个小时就开始遗忘上下文、重复犯错,实际价值仍然有限。

因此,Grok 4.7此次反复强调的其实是三个关键词:

长时间任务、工具调用、自我验证。

这三项能力组合起来,指向的已经不是传统意义上的聊天机器人,而是能够持续执行任务的AI Agent。

从这个角度看,Grok 4.7真正值得关注的并不是“4.7”这个数字,而是SpaceXAI正在尝试把模型竞争从**“谁回答得更好”推进到“谁能把事情做完”**。

而这场竞争,接下来很可能会从模型公司进一步蔓延到Cursor、云平台、AI编程工具以及整个Agent基础设施市场。

标签: Grok

路过

雷人

握手

鲜花

鸡蛋
来自: 思聪网

最新评论

思聪网微信公众号二维码 微信扫码关注思聪网
返回顶部