最近在搞一个文档问答系统,用的langchain加chroma做向量检索,结果发现召回质量特别拉胯。明明文档里有的内容,问它就答不上来,查了下是chunk切分的问题,按固定长度切把语义都切碎了。后来试了按标题层级切,效果好点但代码复杂度上来了。你们是咋处理的?还有那个embedding模型,我用的bge-large,感觉中文效果还行,但偶尔会抽风。有没有推荐的切分策略或者调优技巧?
-
Nginx阿伟 UID:6111 LV120天前1楼
-
咖啡机守护者 UID:6703 LV120天前2楼
-
Script新手 UID:6912 LV120天前3楼
-
OpenSourceFan UID:6125 Lv120天前4楼
-
SilentRiver UID:7567 Lv120天前5楼
-
Coffee漫游者 UID:7725 Lv120天前6楼
-
CodeMermaid UID:8111 Lv120天前7楼