本文根据零度博客的 Holo 3.1 部署文章重新组织。速度与模型对比结论属于原帖观察,LingjingHub 未在相同硬件和任务集上独立复现。
工作流目标
通过 llama.cpp 在本机提供 Holo 3.1 的 OpenAI 兼容接口,再让 OpenClaw 调用该接口完成浏览器或桌面任务,减少对云端模型服务的依赖。
一、选择合适的模型尺寸
原帖列出了约 0.8B、4B、9B 与 35B-A3B 等版本,应根据真实显存和任务复杂度选择。带视觉能力的版本可能同时需要主 GGUF 模型和 mmproj 文件。不同仓库的文件名可能变化,应以当前模型卡为准,不要直接照搬批处理脚本中的旧文件名。
二、用 llama.cpp 提供本地接口
从 llama.cpp 官方仓库下载与操作系统、显卡运行时匹配的构建版本。先使用较保守的上下文长度,在 127.0.0.1 启动 llama-server,并单独确认 OpenAI 兼容接口能够响应,再接入 Agent。未配置身份验证和网络访问控制时,服务只应监听本机。
三、连接 OpenClaw
仅按照 OpenClaw 官方文档安装。在模型提供商配置中,把 Base URL 指向本地 llama.cpp 接口,通常是以 /v1 结尾的 localhost 地址,并填写实际加载的模型名。不要把未经检查的远程脚本直接通过高权限 Shell 执行;应先核对官方安装路径和发布文件。
四、逐步增加能力
第一轮只使用只读或低影响任务,例如打开测试网页、整理公开资料、处理测试目录中的样例文件。浏览器自动化 Skill 必须核对来源后再安装。Skill 会扩大 Agent 的操作能力,应把它视为可执行软件,而不是普通提示词。
五、设置人工确认门
下载、提交表单、发送消息、购买、修改账号、删除文件,以及访问私人浏览器会话前,都应要求明确确认。初期使用独立浏览器资料和测试工作区。模型在本地运行,不代表密码、Cookie、API Key 和个人文件可以无条件交给 Agent。
六、用真实任务验收
应记录任务完成率、总耗时、重试次数、显存占用、延迟和错误操作。原帖认为该组合在浏览器自动化中比另一款本地模型更快,但这仍是与硬件、任务和配置高度相关的单次观察。
成功标准
本地接口稳定响应;OpenClaw 确实调用预期的 Holo 模型;测试任务没有越过批准权限;发生错误时能够立即停止,且不会改变真实账号或数据。
故障恢复
OpenClaw 无法连接时,检查 localhost 端口、/v1 路径、模型标识和服务日志。视觉调用失败时,确认是否加载了匹配的 mmproj 文件。显存不足时,降低上下文长度或选择更小的量化版本。
参考资料
https://huggingface.co/collections/Hcompany/holo31
https://github.com/ggml-org/llama.cpp
原始来源