1、背景

在垂直行业应用中,大模型可能因缺少专业积累、知识更新滞后或自身机制限制,生成不准确、时效性差甚至虚构的内容。对此,可通过接入知识库、开展领域训练等途径,弥补其在知识准确性、覆盖面和可控性上的不足。

2、配置知识库

2.1 创建知识库

注意

  • 名称,应准确、清晰、简短,尽可能控制在5个字以内。
  • 描述,应描述清楚所有使用场景,尽可能控制在250字以内。内容质量将直接影响大模型的检索输出结果,请认真填写。
  • 意图例句,需要包含典型的用户问题示例,示例数目控制在20个以内。
  • 对于需要加强识别效果的场景,可以在描述中增加类似如下的话术“只要问题包含关键字’xxx’、’xxx’,就认为命中”(其中xxx需要调整为实际需要识别的词汇),并且可以对特别重要的名词增加典型的同音字示例,用于在ASR识别错误时提升意图识别效果。
  • 对于需要加强识别效果的场景,可以在意图例句中配置泛化的话术,用于匹配多样的用户问题,并且也可以配置同音字话术示例。例如:汉朝xxx、中国历史xxx、中国理事xxx,其中中国理事xxx是为了提升同音字识别效果。
  • RAG 高级配置可选填,建议使用默认参数。

2.2 上传文档

文档要求

  • 目前支持纯文本、word、pdf、markdown文档,要求文档大小不超过10MB。
  • 为提升知识库提取、检索效果和回复效果,推荐使用纯文本文档,且文档内容建议使用QA对。
    示例:
    Q1:唐朝是哪一年建立的?
    A:唐朝建立于公元618年。
    Q2:深圳市在哪个省?
    A:广东省。
  • 文档中单个知识点长度不应该过大,尽量不超过500字。单个知识点过大会导致该知识点被切片,无法构成完整的知识点。
  • 支持pdf文档的图片文字识别功能,但应尽可能保证图片中文字清晰,并且文字布局遵循从左至右、从上至下的阅读顺序,否则文字识别效果、文字顺序可能错误。
  • 暂不支持word文档的图片文字识别功能。

3、为智能体配置知识库

3.1 创建智能体配置

3.2 配置知识库

作者:admin  创建时间:2026-09-24 10:45
最后编辑:admin  更新时间:2026-09-30 18:07