输入动作复核输出

本文根据零度博客的 Holo 3.1 部署文章重新组织。速度与模型对比结论属于原帖观察,LingjingHub 未在相同硬件和任务集上独立复现。

工作流目标

通过 llama.cpp 在本机提供 Holo 3.1 的 OpenAI 兼容接口,再让 OpenClaw 调用该接口完成浏览器或桌面任务,减少对云端模型服务的依赖。

一、选择合适的模型尺寸

原帖列出了约 0.8B、4B、9B 与 35B-A3B 等版本,应根据真实显存和任务复杂度选择。带视觉能力的版本可能同时需要主 GGUF 模型和 mmproj 文件。不同仓库的文件名可能变化,应以当前模型卡为准,不要直接照搬批处理脚本中的旧文件名。

二、用 llama.cpp 提供本地接口

从 llama.cpp 官方仓库下载与操作系统、显卡运行时匹配的构建版本。先使用较保守的上下文长度,在 127.0.0.1 启动 llama-server,并单独确认 OpenAI 兼容接口能够响应,再接入 Agent。未配置身份验证和网络访问控制时,服务只应监听本机。

三、连接 OpenClaw

仅按照 OpenClaw 官方文档安装。在模型提供商配置中,把 Base URL 指向本地 llama.cpp 接口,通常是以 /v1 结尾的 localhost 地址,并填写实际加载的模型名。不要把未经检查的远程脚本直接通过高权限 Shell 执行;应先核对官方安装路径和发布文件。

四、逐步增加能力

第一轮只使用只读或低影响任务,例如打开测试网页、整理公开资料、处理测试目录中的样例文件。浏览器自动化 Skill 必须核对来源后再安装。Skill 会扩大 Agent 的操作能力,应把它视为可执行软件,而不是普通提示词。

五、设置人工确认门

下载、提交表单、发送消息、购买、修改账号、删除文件,以及访问私人浏览器会话前,都应要求明确确认。初期使用独立浏览器资料和测试工作区。模型在本地运行,不代表密码、Cookie、API Key 和个人文件可以无条件交给 Agent。

六、用真实任务验收

应记录任务完成率、总耗时、重试次数、显存占用、延迟和错误操作。原帖认为该组合在浏览器自动化中比另一款本地模型更快,但这仍是与硬件、任务和配置高度相关的单次观察。

成功标准

本地接口稳定响应;OpenClaw 确实调用预期的 Holo 模型;测试任务没有越过批准权限;发生错误时能够立即停止,且不会改变真实账号或数据。

故障恢复

OpenClaw 无法连接时,检查 localhost 端口、/v1 路径、模型标识和服务日志。视觉调用失败时,确认是否加载了匹配的 mmproj 文件。显存不足时,降低上下文长度或选择更小的量化版本。

参考资料

https://huggingface.co/collections/Hcompany/holo31

https://github.com/ggml-org/llama.cpp

https://openclaw.ai/

原始来源

https://www.freedidi.com/24451.html