AI 快讯 编译自 marktechpost #模型发布#行业分析#工具评测

Grok 4.6发布:500K上下文,编码能力仍落后,中文用户如何用?

SpaceXAI发布Grok 4.6,500K上下文,AA指数61分追平GPT-5.6 Sol Max,但编码基准仍落后。本文解析其性能、定价及对中文开发者的实际意义,包括API访问、平替方案与合规考量。

编译发布 2026/08/13 原文发布 2026/08/13

一句话看懂

SpaceXAI发布Grok 4.6,500K上下文,AA指数61分追平GPT-5.6 Sol Max,但编码基准仍落后,API定价不变。

详细发生了什么

8月12日,SpaceXAI推出Grok 4.6。这是基于Grok 4.5的后训练升级,并非更大规模的基座模型。公司保持基础模型不变,通过更长的补充训练、重新生成的监督微调轨迹,以及在智能体环境中的强化学习来提升性能。Grok 4.6在Artificial Analysis Intelligence Index上得分为61,比Grok 4.5高出5分,与GPT-5.6 Sol Max持平。模型支持500K上下文,新增xhigh推理强度等级,即日起在Cursor和Grok Build中可用。

定价方面,Grok 4.6保持每百万token $2/$0.50/$6(输入/缓存输入/输出),但超过200K prompt token后价格翻倍至$4/$1/$12。模型通过xAI API提供,名为grok-4.6,是Grok Build的默认模型,并可通过OpenRouter、Vercel和Cloudflare路由。没有开放权重,不支持自托管。

在基准测试中,Grok 4.6在GDPval-AA v2(1753 Elo)和AA-Briefcase(1577)上领先,但在编码任务上仍落后:DeepSWE v1.1得分65.9%,低于GPT-5.6 Sol Max的73%;Terminal-Bench v3.0为26%,虽接近翻倍但仍是四款模型中最低。此外,对比组未包含Claude Opus 5,后者目前在该指数上排名第一。

中文圈视角

对中文开发者而言,Grok 4.6的吸引力在于500K上下文和长任务智能体能力,但实际使用需考虑几个现实问题。首先,访问xAI API需要海外网络环境,且国内直连不稳定,通常需要代理或中转服务。其次,中文支持虽好,但针对中文的优化不如国产模型如DeepSeek或Kimi,后者在中文写作和代码生成上更贴合本地习惯。

平替方案上,如果主要需求是长上下文和智能体,可以考虑DeepSeek-V3或Kimi的200K上下文版本,价格更低且无需翻墙。若追求前沿性能,Grok 4.6的编码短板可能让Claude或GPT系列更合适。此外,企业用户需注意数据出境合规,Grok 4.6的API调用可能涉及敏感数据,建议先进行安全评估。

一个中文圈尚未讨论的盲点是:Grok 4.6的xhigh推理等级在中文复杂任务(如法律文书分析)中的实际效果,目前缺乏第三方评测,早期采用者可以尝试并分享经验。

几条值得记住的细节

  • Grok 4.6支持500K上下文,文本和图像输入,文本输出,知识截止日期为2026年2月1日。
  • 新增xhigh推理等级,默认high,低和中等选项保留。
  • 定价:低于200K prompt token时$2/$0.50/$6,超过后翻倍至$4/$1/$12。
  • 在Cursor和Grok Build中首周提供2倍用量。
  • 无开放权重,不支持自托管,气隙部署不可行。

一句话总结

Grok 4.6性能追平顶尖模型,但编码短板和访问门槛让中文用户需权衡是否值得切换。

原文信息

原文标题
SpaceXAI Releases Grok 4.6: A 500K-Context Frontier Model Tuned for Long-Running Agents, Coding, and Knowledge Work
原作者
Michal Sutter
翻译模型
deepseek-chat

本文由 AI 跟我学 编译翻译自上述英文原文,并加入中文圈视角解读。如有版权问题请联系 [email protected], 我们将第一时间处理。