AI 快讯 编译自 simon_willison #工具发布#API兼容#本地模型

LLM Chat Completions Server 0.1a0 发布:本地模型兼容 OpenAI API,支持对话去重

Simon Willison 发布 llm-chat-completions-server 0.1a0,一个让本地 LLM 模型通过 OpenAI Chat Completions 兼容 API 提供服务的插件。利用 LLM 0.32rc1 的 content-addressable logs 实现对话消息去重。安装简单,适合开发者本地测试。

编译发布 2026/07/31 原文发布 2026/07/30

一句话看懂

Simon Willison 发布 llm-chat-completions-server 0.1a0,让本地 LLM 模型通过 OpenAI 兼容 API 提供服务,并利用哈希去重减少重复消息。

详细发生了什么

Simon Willison 发布了 llm-chat-completions-server 0.1a0,这是一个为 LLM 命令行工具设计的插件。它启动一个本地服务器(默认端口 9001),将用户已安装的所有 LLM 模型(如通过插件添加的 Qwen3.5-4B 等)暴露为 OpenAI Chat Completions 兼容的 API 端点。

核心设计依赖于 LLM 0.32rc1 中引入的 content-addressable logs 功能。当客户端发送多轮对话请求时(例如连续提问“法国首都?”“巴黎。”“德国?”),每条消息都会被哈希处理,服务器自动去重,避免存储重复的对话历史。这使得长对话更高效。

安装方式简单:先通过 uv tool install llm --pre 安装预发布版 LLM,然后 llm install llm-chat-completions-server,最后运行 llm chat-completions-server -p 9001 即可启动。整个插件代码由 GPT-5.6 Sol 生成,Simon 表示 AI 对 OpenAI API 格式掌握得很好。

中文圈视角

这个工具对中文开发者来说非常实用。目前国内很多开发者使用本地模型(如 Qwen、ChatGLM、Yi 系列)进行测试,但缺乏一个标准化的 API 接口。llm-chat-completions-server 直接兼容 OpenAI 的 API 格式,意味着你可以用任何支持 OpenAI 的客户端(如 Open WebUI、ChatGPT-Next-Web、甚至自己写的脚本)来调用本地模型,无需额外适配。

不过,它需要依赖 LLM 命令行工具,而 LLM 本身对中文模型的支持取决于插件生态。目前 LLM 社区已有 Qwen、DeepSeek 等模型的插件,但安装可能需从 GitHub 手动添加。相比国内已有的类似方案(如 Xinference、Ollama),这个工具更轻量,但功能也相对单一——它只提供 API 代理,不包含模型管理或推理优化。

对于中文用户,一个潜在盲点是 content-addressable logs 的去重机制:如果对话中包含大量重复的中文文本(如长文档分段提问),哈希去重能显著减少存储和网络开销,但需要确保模型插件正确支持该特性。

几条值得记住的细节

  • 安装需先安装 LLM 0.32rc1 预发布版:uv tool install llm --pre
  • 默认端口 9001,可通过 -p 参数修改
  • 支持所有通过 LLM 插件安装的模型,包括本地和远程模型
  • 对话去重基于消息内容的哈希,客户端需自行管理 conversation state
  • 整个插件代码由 GPT-5.6 Sol 生成,Simon 仅做少量调整

一句话总结

如果你在本地跑 LLM 模型并想用 OpenAI 兼容 API 调用,这个插件让你 3 条命令搞定,还自带对话去重。