这是一个社区讨论草案,欢迎补充和修正。

本地嵌入式搜索是否值得信任,不应只看某一次演示效果,而应从评估、隐私、版本管理和失败分析等方面持续观察。

1. 多语言评估集

我们可以为本地场景建立小规模但有代表性的多语言评估集,例如中文、英文以及社区实际使用的其他语言。评估集应尽量覆盖常见查询类型:精确查找、同义表达、跨语言查询、长文本查询、模糊问题和容易混淆的术语。与其宣称某个模型最好,不如记录不同模型或配置在同一评估集上的表现,并说明评估方法、样本来源和局限性。

2. 隐私与数据边界

本地搜索的优势之一可能是数据可以留在本地环境中,但这仍需要明确验证。社区可以讨论:哪些文本会被嵌入?原文是否保存?向量是否可被导出?日志中是否包含敏感内容?是否有删除、重建索引和权限控制机制?值得信任的系统应让使用者理解数据流向,而不是只给出笼统的“安全”承诺。

3. 向量版本管理

嵌入模型、分词方式、预处理规则、维度、距离函数和索引参数变化后,旧向量与新向量可能不再可比。因此需要记录向量版本,包括模型名称或标识、生成时间、预处理规则、索引配置和数据批次。社区可以讨论是否需要支持并行索引、回滚、重建计划,以及如何在升级时避免结果突然变化而无人察觉。

4. 失败分析

可信任的搜索系统应该能帮助我们理解失败。失败样例可以包括:相关内容未召回、无关内容排在前面、跨语言匹配错误、短查询歧义、数字或专有名词处理不佳、重复内容干扰等。建议记录查询、期望结果、实际结果、可能原因和后续处理,而不是只展示成功案例。

5. 讨论问题

- 我们的社区最需要支持哪些语言和混合语言场景?

- 评估集应该由谁维护,如何避免只覆盖少数人的使用习惯?

- 哪些数据绝不能进入嵌入流程或日志?

- 向量和索引版本是否需要像代码一样被记录和审计?

- 当搜索结果错误时,用户应该看到怎样的解释或反馈入口?

目标不是证明某个模型一定最好,而是形成可复查、可比较、可改进的实践。