AI 快讯 编译自 the_decoder #模型发布#功能更新#行业分析

OpenAI推出Ultrafast模式,GPT-5.6 Sol推理速度提升14倍,Cerebras硬件加持

OpenAI发布Ultrafast推理模式,基于Cerebras硬件,GPT-5.6 Sol输出速度达750 tokens/秒,较标准模式快14倍。本文解析三档定价策略,并探讨对国内用户的影响及国产替代方案。

编译发布 2026/08/14 原文发布 2026/08/14

一句话看懂

OpenAI推出Ultrafast推理模式,基于Cerebras硬件,让GPT-5.6 Sol输出速度飙升至750 tokens/秒,比标准模式快14倍。

详细发生了什么

OpenAI于8月14日宣布推出名为”Ultrafast”的全新推理模式。该模式利用与Cerebras达成的100亿美元合作中的专用硬件,将GPT-5.6 Sol的输出速度提升至每秒750个token。这一速度相比标准模式提升了14倍,使得复杂任务如长文档生成、代码编写和实时对话的响应时间大幅缩短。

Ultrafast模式与现有的”Standard”和”Fast”模式共同构成了三档定价结构,将推理速度本身作为独立产品进行销售。用户可以根据需求选择不同速度级别,Ultrafast面向对延迟敏感的高频应用场景,而Standard则适合常规任务。这一策略表明OpenAI正试图通过差异化服务来满足不同用户群体,同时为高性能计算资源开辟新的收入来源。

Cerebras的硬件以其巨大的晶圆级芯片著称,此前主要用于训练和推理加速。此次合作是OpenAI在基础设施多元化上的重要一步,旨在减少对英伟达GPU的依赖,同时提升推理效率。

中文圈视角

对于国内用户而言,OpenAI的Ultrafast模式目前仍无法直接访问,需要借助网络工具,且API调用可能面临合规风险。不过,这一趋势对国内AI服务商有重要启示:推理速度正成为竞争焦点。国产模型如DeepSeek、Kimi和智谱清言在响应速度上已有优化,但尚未推出类似的分级速度定价。

从应用场景看,Ultrafast模式对高频交互应用(如客服机器人、实时翻译)价值巨大,国内开发者可关注国产GPU厂商(如华为昇腾)和云服务商(如阿里云、百度智能云)是否跟进类似优化。此外,速度提升也意味着成本结构变化,国内用户在选择API服务时,应对比不同供应商的token价格和延迟表现,避免为不必要的速度溢价买单。

值得注意的是,Cerebras与OpenAI的合作可能加剧中美在AI芯片领域的竞争,国内在自主算力建设上的投入或将进一步加大。

几条值得记住的细节

  • Ultrafast模式输出速度最高达750 tokens/秒,较标准模式快14倍。
  • 该模式基于Cerebras硬件,源自OpenAI与Cerebras的100亿美元合作。
  • 三档定价:Standard、Fast、Ultrafast,速度成为独立产品维度。
  • 目前Ultrafast模式已向部分API用户开放,全面推出时间待定。
  • 此举旨在减少对英伟达GPU的依赖,推动推理硬件多元化。

一句话总结

推理速度成为AI服务新卖点,国内用户需关注国产替代方案的性能与成本平衡。