简述
bge-small-zh-v1.5 是一个中文嵌入模型:把一段文字喂进去,它吐出一个 512 维向量。语义相近的文字,向量也相近——这是语义检索的基础。由智源研究院开源。
详解
mindplace 把它烘进 Docker 镜像,在 FastAPI 进程内跑 CPU 推理,不依赖外部服务、不依赖 GPU。写笔记时 ingest 把正文切块、逐块嵌入、存进 pgvector;搜索时把查询词也嵌入,算余弦相似度找最近的块。约 500MB 常驻内存,CPU 上单次推理毫秒级。
深化
选它是被硬件逼出来的最优解:服务器只有 4G 内存,装不下 Ollama 跑更大的 bge-m3,进程内一个小模型是唯一塞得下的方案。它是 2023 年的模型,放到 2026 年,C-MTEB 榜上已被 Qwen3-Embedding-0.6B 这类新模型明显超过。但换不换是”检索质量 vs 内存/延迟”的权衡——0.6B 比它大二十多倍。好在嵌入器是可替换接口,哪天真觉得召回不准,写个新子类、rebuild 一次就换过去,架构早留好了口子。