AI 快讯
编译自 ai_news #token预算#AI成本优化#企业效率
黄仁勋的token预算测试:削减团队不如优化token消耗,Nvidia年支出20亿美元
Nvidia CEO黄仁勋提出工程师价值测试:若年token消耗低于薪资一半则需警惕。企业正从裁员转向优化token预算,通过提示缓存、模型路由、RAG等技术可削减60%以上成本。本文分析token预算优化策略及对中文圈企业的启示。
一句话看懂
Nvidia CEO黄仁勋提出工程师价值测试:若年token消耗低于薪资一半则需警惕,企业应通过技术优化而非裁员来降低AI成本。
详细发生了什么
Nvidia CEO黄仁勋在GTC 2026后的All-In Podcast上提出一个测试:如果一名年薪50万美元的工程师年度AI token消耗低于其薪资的一半,他会“深感担忧”。他确认Nvidia正朝着每年20亿美元token账单的目标前进。这反映了一个趋势:企业正将原本用于人力的资金转向token支出。
四大超大规模云服务商2026年资本支出合计约7000亿美元,几乎翻倍。同时,AI已成为美国裁员的首要原因,连续四个月创纪录。Meta内部备忘录显示,5月裁员8000人是为了抵消巨额投资。然而,Gartner调查350位高管发现,约80%的企业在裁员后并未获得回报提升。分析师Helen Poitevin直言:“裁员创造预算空间,但不创造回报。”
Uber的教训更为直接:去年12月为5000名工程师提供AI编码工具,结果到4月就用完了整个2026年的AI预算。首席运营官Andrew Macdonald承认,尽管70%的代码由AI生成,但与客户体验的关联尚未建立。
中文圈视角
对于中文圈企业,这一趋势同样紧迫。国内大模型API价格虽已大幅下降,但token消耗量激增,成本控制成为关键。与Nvidia、OpenAI等相比,国内企业更需关注以下几点:
- 优化技术栈:提示缓存、模型路由、RAG等技术在国内同样适用。例如,阿里云、百度智能云等已提供类似功能,企业应优先采用。
- 避免盲目裁员:国内企业常将AI视为降本工具,但Gartner研究显示,裁员与回报无正相关。应借鉴Klarna的混合模式:AI处理常规任务,人类负责判断性工作。
- 人才储备:斯坦福HAI报告显示,22-25岁软件开发者就业率下降20%,这意味着初级工程师培养断层。中文圈企业应保持招聘,为未来储备人才。
几条值得记住的细节
- 提示缓存:Anthropic和OpenAI的提示缓存可降低重复输入成本高达90%。ProjectDiscovery通过优化提示,缓存命中率从7%提升至84%,总LLM支出降低59-70%。
- 模型路由:旗舰模型成本是小型模型的5倍,但许多生产任务无需顶级模型。按需路由可大幅节省成本。
- 批处理折扣:非实时任务使用批处理可再享50%折扣。
- Uber的教训:5000名工程师在4个月内耗尽全年AI预算,随后实施每人每月1500美元的token上限。
- Klarna的回归:用AI替代700个客服岗位后客户满意度下降,现已转为混合模式,AI处理常规问题,人类处理复杂问题。
一句话总结
别急着裁员,先优化token预算:通过技术手段削减60%成本,再把省下的钱投资于人。