AI 快讯 编译自 the_decoder #芯片#模型推理#AMD

AMD收购Taalas:把AI模型直接烧进芯片,推理速度冲到每秒1.6万token

AMD收购加拿大初创公司Taalas,其技术将模型权重直接硬编码进推理芯片,实现极速推理,但每颗芯片只能跑单一模型。演示芯片跑Llama 3.1-8B时速度超每秒1.6万token。本文聊聊对中文圈的影响、国产芯片的对比,以及未来走向。

编译发布 2026/08/07 原文发布 2026/08/07

一句话看懂

AMD收购加拿大初创公司Taalas,把AI模型权重直接硬编码进推理芯片,推理速度极快,但每颗芯片只能跑一个模型。

详细发生了什么

AMD宣布收购加拿大初创公司Taalas。这家公司的核心技术,是把AI模型的权重直接硬编码进推理芯片的硅片里,而不是像传统GPU那样靠软件加载模型。这么做的效果是推理速度飞快,代价是每颗芯片被锁死,只能跑一个特定模型,没法灵活切换。

据The Decoder报道,Taalas的演示芯片跑Llama 3.1-8B模型时,每用户每秒能处理超过16,000个token,速度远超当前主流硬件。这个速度意味着在实时交互场景里,几乎感觉不到延迟。

另外,谷歌据说也在为Gemini搞类似的技术路线。这说明把模型直接烧进芯片,正在成为AI硬件领域的一个新方向,特别适合那些对延迟极度敏感、模型又相对固定的应用场景。

AMD这次收购,是想强化自己在AI推理市场的竞争力,尤其是在跟NVIDIA的竞争中找差异化优势。Taalas的技术有望整合进AMD的Instinct系列或EPYC产品线,给特定客户提供极致性能的推理方案。

中文圈视角

这项技术对中文圈用户意味着什么?首先,国内用户短期内很难直接受益。AMD的收购和Taalas的技术,主要面向海外云服务商和企业客户。而且硬编码模型的方式,需要针对每个模型单独造芯片,成本极高,不太可能做成消费级产品。国内用户更可能通过云服务间接体验,但考虑到数据出境和合规要求,实际用起来门槛不低。

其次,国产芯片厂商像华为昇腾、寒武纪这些,目前还是走通用GPU路线,强调灵活性。Taalas的“专用化”思路或许值得借鉴,但国内更看重多模型适配和快速迭代,硬编码方式跟国内AI生态的快速变化可能不太合拍。不过,对某些固定场景(比如人脸识别、语音助手),这种专用芯片或许能带来性能飞跃,值得留意。

最后,从监管角度看,硬编码模型芯片可能涉及内容安全预置的问题。如果模型权重被固化,后续更新和内容过滤会变得困难,这在国内合规框架下是个潜在风险点。所以中文圈对这项技术不妨先观望,多关注技术验证结果,而不是急着用。

几条值得记住的细节

  • Taalas是加拿大初创公司,专注把模型权重硬编码进推理芯片。
  • 演示芯片跑Llama 3.1-8B时,速度超过每秒16,000 token/用户。
  • 每颗芯片只能跑单一模型,没法灵活切换,这是它最大的限制。
  • 谷歌据报也在为Gemini开发类似技术,说明这个方向巨头们都在盯。
  • AMD收购后,这项技术可能整合进Instinct或EPYC产品线,面向特定客户。

一句话总结

AMD收购Taalas,标志着AI推理走向专用化,但短期内对中文圈影响有限,更多是个技术风向标。