本文根据零度博客 2026 年 7 月 4 日发布的教程重新整理。命令与性能观察来自原帖,LingjingHub 未在相同硬件上独立复现。Python、CUDA、PyTorch 和模型版本变化较快,安装前应以各项目最新文档为准。
一、整体架构
这套本地语音链路由四部分组成:Whisper 负责把语音转成文字;llama.cpp 或 Ollama 提供本地大模型推理;Qwen3-TTS 把回复合成为语音;本地浏览器界面负责麦克风、实时字幕和状态反馈。模型与依赖下载完成后,主要对话链路可以在本机运行。
二、准备条件
建议使用当前受支持的 Windows 10 或 Windows 11,并准备 Python 3.11、Git、FFmpeg、足够的模型存储空间,以及用于低延迟推理的兼容显卡。实际显存占用取决于模型大小、量化精度、上下文长度,以及语音识别、推理和语音合成是否共用同一块显卡。
三、建立独立 Python 环境
从官方网站安装 Python、Git 和 FFmpeg,并为项目创建独立虚拟环境,避免把依赖装入全局 Python。若 PowerShell 阻止虚拟环境激活,应参考微软的执行策略文档,仅调整必要的最小范围,不要全局关闭安全限制。
四、安装语音处理链路
激活虚拟环境后,按照项目当前文档安装 speech-to-speech。原帖采用 Whisper 识别中文,使用 Qwen3-TTS 合成中文语音。安装前需要确认包所支持的 Python、PyTorch、CUDA 与模型版本,避免照搬已经失效的版本组合。
五、启动本地大模型接口
原帖通过 llama.cpp 加载量化 Qwen 模型,并在 127.0.0.1 提供 OpenAI 兼容接口。如果本机已经使用 Ollama,也可以改为连接现有模型服务。除非已经配置身份验证、防火墙与明确的局域网访问规则,否则服务应只绑定 localhost。
六、连接识别、推理与合成
在语音服务中配置 Whisper、本地 OpenAI 兼容接口和 Qwen3-TTS。启动成功后,应能看到实时 WebSocket 服务监听地址以及模型加载完成信息。首次启动通常较慢,因为可能需要下载语音识别和语音合成模型。
七、打开本地浏览器界面
使用 Hugging Face 语音演示项目启动本地界面,在 Chrome 或 Edge 中打开 localhost 地址,填写本地 WebSocket 地址,并仅向该本地页面授予麦克风权限。界面应能显示就绪、聆听、处理、回答与错误等状态,不需要嵌入任何第三方视频播放器。
八、常见问题
模型服务正常但网页无法连接时,优先检查端口、协议和三个服务的启动顺序。CUDA 无法启用时,确认显卡驱动、PyTorch 构建版本与 llama.cpp 包是否匹配。显存不足时,应先缩小模型、上下文长度或语音模型,而不是继续叠加进程。
九、安全边界
可执行文件、模型和脚本应优先从官方项目页面下载。不要在未检查脚本内容的情况下绕过 Windows SmartScreen,也不要把本地模型接口或 WebSocket 端口直接暴露到公网。本地运行可以减少语音上传,但不能自动保证所有下载依赖和模型文件可信。
官方参考
原始来源
把目标拆成输入、动作和输出,再逐步加入检查点。
保留示例、失败条件和复核标准,教程才真正可复用。