Token 危机:企业为削减 AI 成本,发现 PDF 转 Markdown 是最大消耗源
埃森哲内部数据显示,非工程师员工消耗大量 token,PDF 转 Markdown 是主要元凶。了解 token 消耗真相,优化 AI 成本策略,避免无谓支出。
一句话看懂
埃森哲内部数据揭示,企业 AI 成本飙升的元凶竟是 PDF 转 Markdown,而非工程师的代码调用。
详细发生了什么
据 404 Media 6 月 24 日报道,埃森哲在一次内部会议(音频疑似泄露)中讨论了 AI token 消耗问题。埃森哲 agentic AI 战略负责人 Justice Kwak 表示,内部数据显示,token 消耗的主要驱动力并非工程师,而是大量非工程师员工的行为。
随后,埃森哲客户群负责人 Stuart Henderson 开玩笑说,希望 Kwak 没有把 PDF 转成图片再转成 markdown 文件,因为”PDF 转 markdown 是最大的 token 消耗源之一”。Kwak 确认,这正是埃森哲自身数据所显示的。
这一轶事揭示了企业 AI 成本失控的一个隐蔽原因:非技术员工在处理文档时,习惯性地将 PDF 转换为 markdown 供 LLM 处理,而这一过程消耗的 token 远超预期。埃森哲的发现也引发了更广泛的思考:PDF 本身作为信息传播媒介,在 AI 时代显得低效且昂贵。
中文圈视角
对国内企业而言,这一发现同样具有警示意义。许多国内公司在引入 AI 工具后,往往只关注模型调用次数,却忽略了 token 消耗的细节。PDF 转 markdown 这类操作,在国产大模型(如 DeepSeek、Kimi)中同样会消耗大量 token,且国内 API 定价虽低,但大规模非工程师使用仍会推高成本。
此外,国内不少企业使用 RAG 流程处理合同、财报等 PDF 文档,若未优化转换流程,token 浪费可能更严重。建议国内团队:优先使用原生支持 PDF 解析的模型(如 GPT-4o、Claude 3.5),或采用本地 OCR 预处理,减少不必要的 token 开销。同时,对非工程师员工进行 AI 使用培训,明确哪些操作会消耗大量 token,避免”无意识烧钱”。
几条值得记住的细节
- 埃森哲内部数据显示,token 消耗主要由非工程师驱动,而非工程师。
- PDF 转 markdown 是最大的 token 消耗源之一,埃森哲数据已证实。
- 该信息来自 404 Media 报道,会议音频疑似泄露。
- 埃森哲高管建议,企业应重新审视 PDF 作为信息媒介的效率。
- 这一发现可能推动企业优化文档处理流程,降低 AI 成本。
一句话总结
企业 AI 成本失控的根源可能在于文档处理,优化 PDF 转换流程能显著节省开支。