OpenAI推出Ultrafast模式,GPT-5.6 Sol推理速度提升14倍,Cerebras硬件加持
OpenAI发布Ultrafast推理模式,基于Cerebras硬件,GPT-5.6 Sol输出速度达750 tokens/秒,较标准模式快14倍。本文解析三档定价策略,并探讨对国内用户的影响及国产替代方案。
一句话看懂
OpenAI推出Ultrafast推理模式,基于Cerebras硬件,让GPT-5.6 Sol输出速度飙升至750 tokens/秒,比标准模式快14倍。
详细发生了什么
OpenAI于8月14日宣布推出名为”Ultrafast”的全新推理模式。该模式利用与Cerebras达成的100亿美元合作中的专用硬件,将GPT-5.6 Sol的输出速度提升至每秒750个token。这一速度相比标准模式提升了14倍,使得复杂任务如长文档生成、代码编写和实时对话的响应时间大幅缩短。
Ultrafast模式与现有的”Standard”和”Fast”模式共同构成了三档定价结构,将推理速度本身作为独立产品进行销售。用户可以根据需求选择不同速度级别,Ultrafast面向对延迟敏感的高频应用场景,而Standard则适合常规任务。这一策略表明OpenAI正试图通过差异化服务来满足不同用户群体,同时为高性能计算资源开辟新的收入来源。
Cerebras的硬件以其巨大的晶圆级芯片著称,此前主要用于训练和推理加速。此次合作是OpenAI在基础设施多元化上的重要一步,旨在减少对英伟达GPU的依赖,同时提升推理效率。
中文圈视角
对于国内用户而言,OpenAI的Ultrafast模式目前仍无法直接访问,需要借助网络工具,且API调用可能面临合规风险。不过,这一趋势对国内AI服务商有重要启示:推理速度正成为竞争焦点。国产模型如DeepSeek、Kimi和智谱清言在响应速度上已有优化,但尚未推出类似的分级速度定价。
从应用场景看,Ultrafast模式对高频交互应用(如客服机器人、实时翻译)价值巨大,国内开发者可关注国产GPU厂商(如华为昇腾)和云服务商(如阿里云、百度智能云)是否跟进类似优化。此外,速度提升也意味着成本结构变化,国内用户在选择API服务时,应对比不同供应商的token价格和延迟表现,避免为不必要的速度溢价买单。
值得注意的是,Cerebras与OpenAI的合作可能加剧中美在AI芯片领域的竞争,国内在自主算力建设上的投入或将进一步加大。
几条值得记住的细节
- Ultrafast模式输出速度最高达750 tokens/秒,较标准模式快14倍。
- 该模式基于Cerebras硬件,源自OpenAI与Cerebras的100亿美元合作。
- 三档定价:Standard、Fast、Ultrafast,速度成为独立产品维度。
- 目前Ultrafast模式已向部分API用户开放,全面推出时间待定。
- 此举旨在减少对英伟达GPU的依赖,推动推理硬件多元化。
一句话总结
推理速度成为AI服务新卖点,国内用户需关注国产替代方案的性能与成本平衡。