个人截图库自建:砍掉60%索引的实战踩坑
分类小报
搞了300多天、几百G的本地截图,想做成自己的搜索引擎?我试了一圈发现,核心痛点根本不是向量库怎么搭,而是数据清洗和查询理解。今天把踩过的坑拆给你看。
一、OCR别只信一个库
很多人以为接个大模型或OCR库就能直接识别,结果处理中文截图里的英文报错、路径代码时,纯中文库直接“全军覆没”。我的解法是多模型互补:先用通用OCR打底,对低置信度的文字块再丢给视觉模型重读。注意,务必保留坐标信息,不然后续没法高亮定位。
二、索引体积失控?先砍掉60%
全量向量化是个坑,索引体积往往比原图还大。两个关键动作:
- 切分粒度优化:别按整图切,按文字块切。用正则、长度、位置规则过滤掉时间戳、水印等无效UI文字,这一步能直接砍掉60%的无用索引。
- 分层检索架构:先过SQLite FTS5做关键词粗筛,命中候选后再走向量精排。避免全库ANN搜索带来的高延迟。
三、用户搜“那个502”,你怎么懂他?
查询理解决定检索上限。用户口语“那个502”,系统根本不知道要找啥。必须在查询层做改写:把口语转化为截图里可能出现的形态,比如将“报错”扩写为 error/failed/错误。同时,把时间限定词单独解析为过滤条件,别让它污染向量语义。
这套组合拳下来,300+天截图实现1秒内响应,准确率八成以上。记住,最大的工程难点不在检索引擎,而在前期的数据清洗和语义理解。
来源 · V2EX-创业:阅读原文 →
好价雷达 · iMessage 里的 AI 比价助手
对它说一句「盯着 iPhone 降到 4000」,到价自动提醒;也支持查历史好价与凑单。苹果设备点 poke.com/r/iycmctg3F1E 一键安装。