Grok 4.6发布:500K上下文,编码能力仍落后,中文用户如何用?
SpaceXAI发布Grok 4.6,500K上下文,AA指数61分追平GPT-5.6 Sol Max,但编码基准仍落后。本文解析其性能、定价及对中文开发者的实际意义,包括API访问、平替方案与合规考量。
一句话看懂
SpaceXAI发布Grok 4.6,500K上下文,AA指数61分追平GPT-5.6 Sol Max,但编码基准仍落后,API定价不变。
详细发生了什么
8月12日,SpaceXAI推出Grok 4.6。这是基于Grok 4.5的后训练升级,并非更大规模的基座模型。公司保持基础模型不变,通过更长的补充训练、重新生成的监督微调轨迹,以及在智能体环境中的强化学习来提升性能。Grok 4.6在Artificial Analysis Intelligence Index上得分为61,比Grok 4.5高出5分,与GPT-5.6 Sol Max持平。模型支持500K上下文,新增xhigh推理强度等级,即日起在Cursor和Grok Build中可用。
定价方面,Grok 4.6保持每百万token $2/$0.50/$6(输入/缓存输入/输出),但超过200K prompt token后价格翻倍至$4/$1/$12。模型通过xAI API提供,名为grok-4.6,是Grok Build的默认模型,并可通过OpenRouter、Vercel和Cloudflare路由。没有开放权重,不支持自托管。
在基准测试中,Grok 4.6在GDPval-AA v2(1753 Elo)和AA-Briefcase(1577)上领先,但在编码任务上仍落后:DeepSWE v1.1得分65.9%,低于GPT-5.6 Sol Max的73%;Terminal-Bench v3.0为26%,虽接近翻倍但仍是四款模型中最低。此外,对比组未包含Claude Opus 5,后者目前在该指数上排名第一。
中文圈视角
对中文开发者而言,Grok 4.6的吸引力在于500K上下文和长任务智能体能力,但实际使用需考虑几个现实问题。首先,访问xAI API需要海外网络环境,且国内直连不稳定,通常需要代理或中转服务。其次,中文支持虽好,但针对中文的优化不如国产模型如DeepSeek或Kimi,后者在中文写作和代码生成上更贴合本地习惯。
平替方案上,如果主要需求是长上下文和智能体,可以考虑DeepSeek-V3或Kimi的200K上下文版本,价格更低且无需翻墙。若追求前沿性能,Grok 4.6的编码短板可能让Claude或GPT系列更合适。此外,企业用户需注意数据出境合规,Grok 4.6的API调用可能涉及敏感数据,建议先进行安全评估。
一个中文圈尚未讨论的盲点是:Grok 4.6的xhigh推理等级在中文复杂任务(如法律文书分析)中的实际效果,目前缺乏第三方评测,早期采用者可以尝试并分享经验。
几条值得记住的细节
- Grok 4.6支持500K上下文,文本和图像输入,文本输出,知识截止日期为2026年2月1日。
- 新增xhigh推理等级,默认high,低和中等选项保留。
- 定价:低于200K prompt token时$2/$0.50/$6,超过后翻倍至$4/$1/$12。
- 在Cursor和Grok Build中首周提供2倍用量。
- 无开放权重,不支持自托管,气隙部署不可行。
一句话总结
Grok 4.6性能追平顶尖模型,但编码短板和访问门槛让中文用户需权衡是否值得切换。