OpenClaw 发布 iOS/Android 应用:将手机变为自托管 AI Agent 的硬件节点
OpenClaw 推出免费 iOS 和 Android 应用,作为自托管 AI 网关的配套节点,让手机摄像头、位置、语音等硬件能力被 AI 智能体调用。本文解析架构、功能与安全设计,并探讨对中文自部署 AI 用户的实用价值。
一句话看懂
OpenClaw 发布 iOS/Android 应用,让手机成为自托管 AI Agent 的硬件节点,可调用摄像头、位置、语音等设备能力。
详细发生了什么
OpenClaw 是一个开源的个人 AI 智能体/助手项目,由 Peter Steinberger 创建,核心用 TypeScript 编写,运行在 Node 24(推荐)或 Node 22.19+ 上。其架构分为两部分:Gateway(网关)和节点(Node)。
Gateway 是控制中心,负责会话、路由、渠道、工具和事件处理,运行在用户自己的 macOS、Linux 或 Windows(通过 WSL2)机器上。所有聊天消息都到达 Gateway,而非手机。
新发布的 iOS 和 Android 应用是配套节点,而非独立聊天机器人。每个手机通过 WebSocket(默认端口 18789)连接到自托管的 Gateway,配对后手机暴露一系列命令接口,包括 canvas.*、camera.*、device.*、notifications.* 和 system.*。
手机赋予 AI 智能体“身体”:摄像头拍照、GPS 定位、语音对话、Canvas 画布渲染仪表盘等。iOS 应用支持通过二维码或设置码配对,Android 应用则通过设置码或手动输入主机/端口。
隐私方面,摄像头和屏幕录制等敏感命令默认关闭,需用户在 Gateway 配置中显式允许。配对凭据存储在设备上,每次节点连接需审批。
中文圈视角
对中文用户来说,OpenClaw 的这套架构有几个值得关注的点:
-
自部署门槛:需要用户自行运行 Gateway,对非技术用户有一定门槛。但相比依赖云服务的 AI 助手,OpenClaw 提供了完全的数据本地化控制,适合对隐私敏感的用户或企业场景。
-
国产平替对比:国内类似项目如 Dify、FastGPT 等更多聚焦于工作流编排,而 OpenClaw 强调“手机作为硬件节点”的实时交互体验。目前国内开源社区在“手机-智能体”硬件调用方面尚属空白,OpenClaw 的设计思路值得借鉴。
-
实际场景:对于中文用户,可以用手机摄像头进行现场数据采集(如巡检拍照并自动标注位置),或通过语音与自部署智能体进行连续对话。但需注意,语音功能依赖 ElevenLabs 或系统 TTS,中文语音合成效果可能不如国内服务。
-
监管与合规:由于是自托管,数据不出境,符合国内对数据本地化的要求。但摄像头、位置等敏感权限的调用需谨慎设计,避免滥用。
几条值得记住的细节
- iOS 和 Android 应用均免费下载,但需要自托管 Gateway 才能使用。
- 节点通过 WebSocket 连接,默认端口 18789;局域网内通过 mDNS 发现,远程推荐使用 Tailscale 的 wss:// 端点。
- 摄像头和屏幕录制仅在前台可用,后台调用会返回错误。
- 隐私敏感命令(如
camera.snap、screen.record)默认禁用,需在~/.openclaw/openclaw.json中配置gateway.nodes.allowCommands显式允许。 - 支持 WhatsApp、Telegram、Discord、Slack、Signal、iMessage 等渠道,但中文用户常用的微信、钉钉等暂不支持。
一句话总结
如果你自托管 AI 智能体,OpenClaw 的移动应用让手机变成智能体的“感官”,实现摄像头、位置等硬件能力的本地化调用。