大语言模型的知识来自训练语料,一旦问题超出其掌握范围,模型往往不会承认「不知道」,而是凭借概率拼凑出一个看似通顺、实则错误的答案,这就是人们常说的幻觉。对企业应用而言,一本正经地胡说八道是致命的,客服、医疗、法务等场景都容不得半点虚构,因此如何让模型输出可溯源、可核查的答案成为落地关键。
检索增强生成(Retrieval-Augmented Generation)的思路是在模型回答前加一道检索环节:先把企业文档切块并向量化,存入向量数据库;用户提问时,系统先检索出最相关的若干片段,再连同问题一起交给大模型,让模型基于这些真实资料作答。这样一来,模型就从「凭记忆作答」变成「开卷考试」,答案有了明确出处,还能随知识库更新而实时刷新,不必每次重新训练。
要让RAG效果好,文档切分的粒度、向量模型的选择、检索召回的质量都至关重要。切得太碎会丢失上下文,切得太粗又难以精准命中;检索环节还需要结合关键词与语义混合检索,并对召回结果做重排序。此外,提示词的写法也直接影响模型是否严格依据资料作答。把这几处打磨到位,RAG就能用较低成本让大模型在专业领域变得可靠可用,这也是它成为企业大模型落地首选方案的原因。