AI 快讯 编译自 marktechpost #模型发布#代码生成#智能体

SpaceXAI 发布 Grok 4.5:与 Cursor 联合训练,代码与智能体任务性能领先,定价 $2/百万输入 token

SpaceXAI 推出 Grok 4.5,与 Cursor 联合训练,专攻编程、智能体任务和知识工作。推理速度 80 TPS,定价 $2/$6 每百万 token,在 Harvey 法律智能体基准上排名第一,token 效率是 Opus 4.8 的 4.2 倍。了解其性能、定价及对中文开发者的影响。

编译发布 2026/07/08 原文发布 2026/07/08

一句话看懂

SpaceXAI 发布 Grok 4.5,与 Cursor 联合训练,专注编程与智能体任务,定价 $2/$6 每百万 token,速度 80 TPS,在 Harvey 法律基准上排名第一。

详细发生了什么

SpaceXAI 于 2026 年 7 月 8 日发布 Grok 4.5,号称其迄今最智能的模型。该模型与 AI 代码编辑器 Cursor 联合训练,目标场景为编程、智能体任务和知识工作。训练使用数万块 NVIDIA GB300 GPU,并采用大规模训练稳定性技术,数据经过去重、质量评分和领域筛选,随后进行强化学习,覆盖数十万任务,重点是多步骤软件工程。

性能方面,Grok 4.5 在 DeepSWE 1.0 上 pass@1 达 62.0%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。虽然 Fable (max) 在四个基准上均领先,但 Grok 4.5 在 Terminal Bench 2.1 上最接近(83.3% vs 84.3%)。token 效率突出:在 SWE Bench Pro 上平均仅用 15,954 个输出 token,而 Opus 4.8 (max) 需 67,020 个,效率提升约 4.2 倍。

定价为 $2/百万输入 token 和 $6/百万输出 token,推理速度 80 TPS。Grok 4.5 已在 Grok Build、Cursor(所有计划)和 SpaceXAI 控制台可用,模型 ID 为 grok-4.5。

中文圈视角

对中文开发者而言,Grok 4.5 的吸引力在于其与 Cursor 的深度集成和 token 效率。Cursor 在国内有一定用户基础,但需通过 API 访问 SpaceXAI 服务,可能面临网络延迟和合规问题。国内替代方案包括 DeepSeek Coder、CodeGeeX 等,但 Grok 4.5 在 Harvey 法律基准上的表现暗示其在专业领域(如法律文档处理)有独特优势,而国内类似场景多依赖通用模型或定制方案。

价格方面,$2/$6 每百万 token 与 GPT-5.5 和 Claude Opus 4.8 相比具有竞争力,尤其输出 token 效率高,实际成本更低。但国内用户需注意数据出境风险,企业级应用可能需通过 SpaceXAI 的合规渠道。此外,Grok 4.5 在智能体任务上的优化(如多步推理、工具调用)对自动化办公和代码修复场景有直接价值,中文社区可关注其与国产智能体框架(如 AgentGPT、AutoGPT 中文版)的对比。

几条值得记住的细节

  • Grok 4.5 在 Harvey 法律智能体基准上排名第一,显示其在专业文档处理上的能力。
  • token 效率是 Opus 4.8 (max) 的 4.2 倍,意味着相同任务输出更少 token,成本更低。
  • 推理速度 80 TPS,适合实时交互场景。
  • 定价 $2/$6 每百万 token,低于 GPT-5.5 和 Opus 4.8 的典型价格。

一句话总结

Grok 4.5 以高 token 效率和低定价切入编程与智能体市场,对中文开发者而言是值得关注的海外模型,但需考虑网络和合规成本。

原文信息

原文标题
SpaceXAI Releases Grok 4.5, a Cursor-Trained Model for Coding, Agentic Tasks, and Knowledge Work at $2/M Input
原作者
Michal Sutter
翻译模型
deepseek-chat

本文由 AI 跟我学 编译翻译自上述英文原文,并加入中文圈视角解读。如有版权问题请联系 [email protected], 我们将第一时间处理。