自然语言转换结构化查询语言(NL2SQL)能降低非专业人员操作数据库的技术门槛,从而提升用户体验和工作效率。此外,检索增强生成(RAG)技术可以通过引入外部知识库提升NL2SQL的性能。针对目前RAG在NL2SQL应用中存在的检索策略漏检率高和召...自然语言转换结构化查询语言(NL2SQL)能降低非专业人员操作数据库的技术门槛,从而提升用户体验和工作效率。此外,检索增强生成(RAG)技术可以通过引入外部知识库提升NL2SQL的性能。针对目前RAG在NL2SQL应用中存在的检索策略漏检率高和召回上下文的相关性不强等问题,提出一种分序检索重排序RAG(RAG-SRR)方法优化知识库构建、检索召回策略和提示词设计等环节。首先,从问答对、专业名词和数据库结构这3个方面进行领域知识库的构建:问答对根据文物艺术品拍卖监管的高频处理和查询的问题构建,专业名词根据拍卖行业标准构建,而数据库结构根据雅昌艺术拍卖网的数据构建;其次,在检索阶段采取分序检索的策略,并对3类知识库设置不同的优先级,且在召回阶段重排序检索的信息;最后,在提示词设计中给出提示词优化设计的原则及提示词模板。实验结果表明:在领域数据集、Spider数据集上,RAG-SRR方法与基于BERT(Bidirectional Encoder Representations from Transformers)模型和RESDSQL(Ranking-enhanced Encoding plus a Skeleton-aware Decoding framework for text-to-SQL)模型的方法的执行准确率分别至少提高了19.50、24.20和12.17、8.90个百分点。而在相同大语言模型下,RAG-SRR方法比未优化的RAG方法的执行准确率分别至少提高了12.83和15.60个百分点,与C3SQL方法相比,执行准确率分别至少提高了1.50和3.10个百分点。在使用Llama3.1-8B时,与DIN-SQL方法相比,执行准确率在中文语料数据集中提升0.30个百分点,在英文语料数据集中最多相差3.90个百分点;但在使用Qwen2.5-7B时,执行准确率分别提高1.60和4.10个百分点。可见,RAG-SRR方法具备较强的实用性和可移植性。展开更多
文摘自然语言转换结构化查询语言(NL2SQL)能降低非专业人员操作数据库的技术门槛,从而提升用户体验和工作效率。此外,检索增强生成(RAG)技术可以通过引入外部知识库提升NL2SQL的性能。针对目前RAG在NL2SQL应用中存在的检索策略漏检率高和召回上下文的相关性不强等问题,提出一种分序检索重排序RAG(RAG-SRR)方法优化知识库构建、检索召回策略和提示词设计等环节。首先,从问答对、专业名词和数据库结构这3个方面进行领域知识库的构建:问答对根据文物艺术品拍卖监管的高频处理和查询的问题构建,专业名词根据拍卖行业标准构建,而数据库结构根据雅昌艺术拍卖网的数据构建;其次,在检索阶段采取分序检索的策略,并对3类知识库设置不同的优先级,且在召回阶段重排序检索的信息;最后,在提示词设计中给出提示词优化设计的原则及提示词模板。实验结果表明:在领域数据集、Spider数据集上,RAG-SRR方法与基于BERT(Bidirectional Encoder Representations from Transformers)模型和RESDSQL(Ranking-enhanced Encoding plus a Skeleton-aware Decoding framework for text-to-SQL)模型的方法的执行准确率分别至少提高了19.50、24.20和12.17、8.90个百分点。而在相同大语言模型下,RAG-SRR方法比未优化的RAG方法的执行准确率分别至少提高了12.83和15.60个百分点,与C3SQL方法相比,执行准确率分别至少提高了1.50和3.10个百分点。在使用Llama3.1-8B时,与DIN-SQL方法相比,执行准确率在中文语料数据集中提升0.30个百分点,在英文语料数据集中最多相差3.90个百分点;但在使用Qwen2.5-7B时,执行准确率分别提高1.60和4.10个百分点。可见,RAG-SRR方法具备较强的实用性和可移植性。