面向表格数据的大模型推理综述
1. 介绍
在大数据时代,从海量数据中高效提取用户所需的信息,已经成为一项核心挑战。而这些数据的主要存储形式,正是表格、数据库这类结构化数据。因此,构建能够从庞杂的结构化数据中准确推理出答案的系统——比如表格问答、事实判断——其重要性不言而喻。在计算机领域,尤其是自然语言处理(NLP)研究中,面向表格数据的推理任务一直是个关键课题[1](为简洁起见,后文统称为“表格推理任务”)。
回顾过去,表格推理的研究大致经历了基于规则[2]、基于神经网络[3]以及基于预训练模型(PLM)[4]几个阶段。而最近,大语言模型(LLM)的崛起带来了显著变化。它在各个NLP任务上的表现都相当亮眼[5],特别是在无需大规模数据微调就能迁移到新任务上的上下文学习能力,大大降低了对标注数据的需求。考虑到表格推理任务多样且标注成本高,很多工作已经开始将LLM应用到这一领域,并取得了优异的成果。不过,由于基于LLM的研究范式与过去差异较大,目前还缺乏对这一方向工作的系统性总结,这在一定程度上阻碍了研究的进一步发展。
因此,本文整理并梳理了当前基于LLM的表格推理相关研究,希望能为后续工作提供一些参考。文章的结构安排如下:第2节介绍任务定义和主流数据集,作为后续分析的基础;第3节给出方法的分类,并总结现有研究,帮助大家了解可能的研究方向;第4节则针对各类方法提出可能的改进思路。
2. 背景
2.1. 任务定义

图1:表格推理示意图
作为讨论的基础,先来明确一下表格推理任务的定义。简单来说,模型的输入是用户提出的问题或要求、对应的结构化数据,以及可选的表格文字说明;输出则是针对用户问题的回答。常见的任务包括表格问答、事实验证、table-to-text和text-to-SQL等,图1给出了一个整体的总结。
2.2. 相关数据集
尽管目前主流工作在使用LLM解决表格推理任务时,大多采用上下文学习的方法直接预测,不再需要大量训练数据,但人们仍然需要依赖标注数据来验证模型的性能。所以,这里针对四个主流任务,分别介绍几个关键数据集:
表格问答: WikiTableQuestions[3]是第一个表格问答类数据集,因其开放域的表格和复杂的查询问题,能充分检验模型的表格问答能力。
表格事实验证: TabFact[6]作为首个表格事实验证数据集,具备大规模跨领域的表格和复杂的推理需求,是检验模型在该任务上能力的标杆。
table-to-text: ToTTo[7]通过高亮特定表格内容来生成相关描述,因其大规模、高质量的数据,成为table-to-text任务的主流数据集。
text-to-SQL: Spider[8]是第一个在text-to-SQL任务上覆盖多领域、多表格的数据集,被广泛使用。
3. 前沿进展

图2:表格推理方法分类
为了帮助研究者更深入地理解提升模型表格推理能力的切入点,我们将现有基于LLM的相关研究分为五类:有监督微调(LLM Pre-Train)、模块化分解(Decomposed Pipeline)、上下文学习(In-Context Learning)、使用工具(Invoking Tools),以及提高鲁棒性(Robustness Improvement)。图2展示了这五个分类及其相互关系。下面,我们将详细介绍这个分类标准,以及每类方法的具体内容,具体措施可参考图3的总结。同时,也会讨论与PLM时代相比,基于LLM的研究发生了哪些变化。

图3:表格推理前沿进展总结
3.1. 有监督微调
有监督微调,顾名思义,就是利用标注数据来微调LLM,以增强其在表格推理任务上的能力。研究发现,部分开源大模型处理表格相关任务的能力相对较弱,因此希望通过微调来弥补这一短板。
现有工作主要分为两类:基于已有标注数据集的微调,和从LLM中蒸馏数据进行微调。
在基于已有数据集微调方面:受LLM在少量甚至无标注数据下也能有不错表现的启发,TabLLM[9](图4)通过少量标注数据微调T0,有效提升了模型在表格数据分类任务上的性能。TableGPT[10]则观察到LLM在解决特定领域问题时性能下降,因此使用精心挑选的领域内数据进行微调,以增强领域知识。TableLlama[11]考虑到此前工作仅支持特定类型的表格和任务,或模型只能学习预定义的表格操作,因此从广泛使用的数据集中选取代表性表格任务构建了TableInstruct数据集,微调后的模型泛化能力显著提升。

图4:TabLLM方法示意图
在从LLM蒸馏数据方面:有研究[12]发现开源小模型在复杂推理的table-to-text任务上性能落后于LLM,因此使用LLM作为教师模型,蒸馏出CoT推理和表格描述,再用这些数据微调开源模型,成功地将推理能力迁移到更小的模型上。HELLaMA[13]则关注到部分通用模型缺乏根据输入在表格中定位依据的能力,因此利用其他LLM预测表格描述在表格中的位置,生成训练数据来微调开源模型,使其能根据高亮部分完成表格摘要。
这两种思路——利用已有数据和蒸馏数据,体现了LLM时代有监督微调的两种不同路径。相比之下,在PLM时代,研究者虽然也会进行微调,但通常只能提升模型在某一类表格推理任务上的性能[32],受限于预训练模型的能力,无法通过微调提升在所有表格任务上的泛化能力。
3.2. 模块化分解
模块化分解的核心思路,是将一个复杂的表格推理任务显式地拆解成多个更简单的子任务。研究者发现,完成这些子任务比直接应对整个复杂任务要容易得多,从而可以有效提升LLM的性能。这方面的工作主要有:
DATER[14]和DIN-SQL[15]都注意到,将复杂问题分解为简单子问题能有效促进大模型的多步推理。因此,它们分别为表格推理任务和text-to-SQL任务设计了不同的流水线,以降低推理难度。

图5:DATER方法示意图
TableQAKit[16]则发现,TableQA任务面临着数据形式和任务差异巨大的问题,阻碍了研究便利性。它因此提出了一个统一工具包,将TableQA的框架划分为配置、数据统一、模型使用和评估四个模块,几乎能支持所有TableQA场景。
CRUSH4SQL[17]和OpenTab[18]关注开放域表格推理,它们将任务分解为“先检索相关表格,再用LLM推理”的流程,有效缓解了大量无关信息带来的推理难度。在PLM时代,人们也曾通过模块化分解来降低任务难度,但那时需要对每个子任务单独训练模型[32];而LLM凭借强大的上下文学习和泛化能力,不再需要为每个子任务专门训练。
3.3. 上下文学习
上下文学习指的是LLM无需微调,仅仅通过设计巧妙的提示(prompt)来增强表格推理能力。研究认为,部分LLM本身已经具备一定的表格推理潜力,但由于性能高度依赖输入的上下文,如何通过提示来更好地激发这种能力,就成了一个关键问题。
现有的工作大致沿两条思路展开:一是通过设计prompt来直接增强上下文学习能力;二是通过将推理过程分解为多步,降低单步推理的难度。
在prompt设计方面:有研究[19]首先探索并证明了LLM具备上下文学习的表格推理能力。ODIS[20]观察到,此前工作要么不提供示例,要么只提供领域外示例,而研究表明领域内示例能显著提升性能。因此,它基于SQL相似度合成领域内SQL,再用LLM生成对应问题作为示例。DAIL-SQL[21]则提出基于掩码后问题的相似度选择示例,并省略其数据库模式来缩短输入长度。而SEER[22]为了解决HybridQA任务中示例选择的挑战(图6),根据问题向量相似度和分类器预测的推理链,从数据中挑选示例。

图6:SEER方法示意图
在prompt分解推理过程方面:MURMUR[23]发现,直接提示LLM进行data-to-text推理容易产生幻觉,而提示CoT推理又缺乏步骤间的明确条件,且数据序列化顺序不同会造成较大方差。因此,它在每一步使用束搜索算法选择可能的正确范围,再由打分模型选出最佳结果及相应的输入形式。CHAIN-OF-TABLE[24]则为降低单步推理难度,预先给LLM提供一组表格操作,让模型从中选择并执行,形成一个操作链。
这两类方法并非互斥,可以组合使用:先提示LLM分解推理过程,再在每一步设计不同的prompt来引导。
LLM的上下文学习能力很好地缓解了PLM时代每个任务都需要大量训练数据的问题,但也带来了新挑战——由于我们尚不能完全探明其内在机理,只能从性能提升的角度,尝试探索不同prompt对不同模型的影响。
3.4. 使用工具
使用工具,指的是LLM在解决表格推理问题时,调用其他工具或模型来处理某些特定子任务。因为研究者发现,LLM在处理检索、数值计算等任务时,可能不如现有的专用工具或方法,这会拖累整体性能。那么,如何让LLM学会选择合适的工具,就成了一项挑战。
目前的工作可分为两类:一种调用的是已经写好并封装的工具,LLM只需生成调用代码;另一种则需要LLM根据具体需求生成代码,比如Python、SQL等,以实现某个模块的功能。
在调用封装工具方面:StructGPT[25]注意到结构化数据量过于庞大,无法全部输入,因此提供了数据抽取接口。模型通过调用这些接口获取有效数据,再将其输入模型进行推理(图7)。另一项研究[26]则设计了一个长对话数据库问答任务,来评估LLM智能体的推理和行动能力:LLM需要根据历史推理,决定与外部模型的交互策略,并生成具体的交互命令。此外,API[27]在将表格问题翻译成程序后,通过调用其他LLM的API,实现了外部知识查询和表格执行之外的操作。

图7:BINDER方法示意图
在需要LLM生成代码方面:BINDER[28]注意到神经系统缺乏可解释性,而符号方法又受语言语法限制,且现有融合方法针对特定模型和语言,需要大量训练数据。因此,它先解析问题中无法用目标程序语言表达的部分,通过调用LLM的API来求解,再将结果集成到程序中。ReAcTable[29]则针对如何自动转化任意表格及其列的问题,让LLM在每一步选择生成不同形式的代码并执行,逐步得到中间结果和最终答案。
LLM既可以调用现成函数,也可以生成代码接口再调用,这两种方式可以同时用于推理过程。与PLM时代不同,LLM借助工具进一步增强了专业能力,但也带来了新的问题:何时用工具、用哪种工具、以及如何使用工具。
3.5. 提高鲁棒性
鲁棒性,指的是LLM在输入发生微小变化(比如随机数种子不同、问题中含有无意义词)时,依然能稳定输出正确结果的能力。研究发现,LLM在这方面的不足会导致性能波动。
目前,提升LLM表格推理鲁棒性的主流方法,是先生成多个候选结果,再从中选出最佳答案。如图8所示,LEVER[30]专门训练一个打分器,对每个候选答案打分,选择分数最高的结果。而SQLPrompt[31]注意到,在固定prompt的情况下,LLM生成结果的多样性较差,容易集中在特定错误上。因此,它提出使用多个不同的prompt分别生成结果并集成,从而避免答案集中于某一类错误。

图8:LEVER方法示意图
提升鲁棒性在PLM时代就已经是个挑战,那时人们普遍通过额外训练来增强模型在表格推理任务上的鲁棒性[33]。而到了LLM时代,目前主要是通过对生成结果的后处理来达成目标。
4. 未来方向
为了给后续研究提供一些启发,这里针对五类方法,分别探讨可能的改进方向。
4.1. 有监督微调
现有方法主要聚焦于增强模型在某一领域或某一任务上的性能,或者挑选不同数据集进行联合训练,其涉及的领域和难度范围有限,导致微调后的泛化能力也受限。参考WizardLM[34]和WizardCoder[35],我们可以利用LLM蒸馏数据,提示它生成不同领域、不同任务、不同难度等级的大规模高质量训练数据,从而提升模型在表格推理任务上的综合能力。
此外,现有方法与其他NLP任务采用了统一的模型架构,并未针对表格任务做适配性修改。参考TaPas[4],可以通过设计新的、适用于结构化数据的模型架构来解决这个问题。
4.2. 模块化分解
现有方法需要人工预先将任务分解为流水线,但这种分解方式只适用于某一类表格任务,缺乏普适性。而如果对所有表格任务用一个过于通用的分解,又难以有效降低推理难度。参考ReAct[36],未来可以希望让LLM根据具体问题自主地将任务显式分解,这样既能适用于所有表格任务,又能减少人工干预。
另外,现有方法在分解后,并未对子任务进行改进和提升,导致系统容易受错误级联的影响。受[37]的启发,希望未来的LLM能够对中间步骤保持敏感,自主检测并修正错误的中间结果,从而推理出更准确的结果。
4.3. 上下文学习
现有研究大多在有限范围内通过人工比较或算法选择更好的prompt作为输入。由于比较范围有限,性能提升也受限,且不适用于可获取数据有限的场景。为了获得更好的输入上下文,可以借助LLM自动生成上下文,并根据表格和任务对prompt进行打分和优化[38],以更好地帮助模型理解并解决问题。
同时,现有研究并未关注如何针对结构化、半结构化数据改进LLM的嵌入层。参考[39],可以训练一个适用于LLM的嵌入层,使其能够编码表格的结构、单元格信息以及对齐的文本描述,从而帮助模型更好地理解表格并进行推理。
4.4. 使用工具
现有研究没有充分关注表格推理任务中可能遇到的知识密集型场景,无法灵活运用外部数据进行知识注入。参考WebGPT[40],希望在处理专家问题时,LLM能够自主借助搜索引擎查询相关领域知识,并将查询结果用于计算或推理。
4.5. 提高鲁棒性
当前工作主要针对模型生成的结果进行集成以提升性能,并没有关注推理路径的多样性及其对结果鲁棒性的影响。参考[41],可以在表格推理的路径上进行集成,充分利用多步推理的中间过程和中间结果,逐步提升模型的鲁棒性。
此外,现有方法在对候选结果进行选择时,需要额外训练一个小模型来打分。参考[42]和[43],未来或许可以无需额外训练,直接利用LLM本身对生成结果进行判别和选择,从而节省训练时间和成本。
5. 总结
本文对LLM时代表格推理的相关研究进行了一次梳理和展望。为了帮助研究者更清晰地思考提升性能的切入点,我们从方法和挑战的角度,将现有研究分为五类,并阐述了分类标准。随后,从有监督微调、模块化分解、上下文学习、使用工具和提高鲁棒性五个方面,回顾了现有工作。最后,针对每类方法讨论了未来可能的改进方向,希望能在如何提升LLM在表格推理任务上的性能方面,给读者带来一些启发。
参考文献
[1]Biehler, R., Frischemeier, D., Reading, C., & Shaughnessy, J. (2018). Reasoning About Data.
[2]Xu, X., Liu, C., & Song, D.X. (2017). SQLNet: Generating Structured Queries From Natural Language Without Reinforcement Learning. ArXiv, abs/1711.04436.
[3]Pasupat, P., & Liang, P. (2015). Compositional Semantic Parsing on Semi-Structured Tables. Annual Meeting of the Association for Computational Linguistics.
[4]Herzig, J., Nowak, P.K., Müller, T., Piccinno, F., & Eisenschlos, J.M. (2020). TaPas: Weakly Supervised Table Parsing via Pre-training. Annual Meeting of the Association for Computational Linguistics.
[5]Zhao, W.X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y., Min, Y., Zhang, B., Zhang, J., Dong, Z., Du, Y., Yang, C., Chen, Y., Chen, Z., Jiang, J., Ren, R., Li, Y., Tang, X., Liu, Z., Liu, P., Nie, J., & Wen, J. (2023). A Survey of Large Language Models. ArXiv, abs/2303.18223.
[6]Chen, W., Wang, H., Chen, J., Zhang, Y., Wang, H., LI, S., Zhou, X., & Wang, W.Y. (2019). TabFact: A Large-scale Dataset for Table-based Fact Verification. ArXiv, abs/1909.02164.
[7]Parikh, A.P., Wang, X., Gehrmann, S., Faruqui, M., Dhingra, B., Yang, D., & Das, D. (2020). ToTTo: A Controlled Table-To-Text Generation Dataset. ArXiv, abs/2004.14373.
[8]Yu, T., Zhang, R., Yang, K., Yasunaga, M., Wang, D., Li, Z., Ma, J., Li, I.Z., Yao, Q., Roman, S., Zhang, Z., & Radev, D.R. (2018). Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task. ArXiv, abs/1809.08887.
[9]Hegselmann, S., Buendia, A., Lang, H., Agrawal, M., Jiang, X., & Sontag, D.A. (2022). TabLLM: Few-shot Classification of Tabular Data with Large Language Models. ArXiv, abs/2210.10723.
[10]Zha, L., Zhou, J., Li, L., Wang, R., Huang, Q., Yang, S., Yuan, J., Su, C., Li, X., Su, A., Tao, Z., Zhou, C., Shou, K., Wang, M., Zhu, W., Lu, G., Ye, C., Ye, Y., Ye, W., Zhang, Y., Deng, X., Xu, J., Wang, H., Chen, G., & Zhao, J.J. (2023). TableGPT: Towards Unifying Tables, Nature Language and Commands into One GPT. ArXiv, abs/2307.08674.
[11]Zhang, T., Yue, X., Li, Y., & Sun, H. (2023). TableLlama: Towards Open Large Generalist Models for Tables. ArXiv, abs/2311.09206.
[12]Yang, B., Tang, C., Zhao, K., Xiao, C., & Lin, C. (2023). Effective Distillation of Table-based Reasoning Ability from LLMs. ArXiv, abs/2309.13182.
[13]Bian, J., Qin, X., Zou, W., Huang, M., & Zhang, W. (2023). HELLaMA: LLaMA-based Table to Text Generation by Highlighting the Important Evidence. ArXiv, abs/2311.08896.
[14]Ye, Y., Hui, B., Yang, M., Li, B., Huang, F., & Li, Y. (2023). Large Language Models are Versatile Decomposers: Decomposing Evidence and Questions for Table-based Reasoning. Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval.
[15]Pourreza, M.R., & Rafiei, D. (2023). DIN-SQL: Decomposed In-Context Learning of Text-to-SQL with Self-Correction. ArXiv, abs/2304.11015.
[16]Lei, F., Luo, T., Yang, P., Liu, W., Liu, H., Lei, J., Huang, Y., Wei, Y., He, S., Zhao, J., & Liu, K. (2023). TableQAKit: A Comprehensive and Practical Toolkit for Table-based Question Answering. ArXiv, abs/2310.15075.
[17]Kothyari, M., Dhingra, D., Sarawagi, S., & Chakrabarti, S. (2023). CRUSH4SQL: Collective Retrieval Using Schema Hallucination For Text2SQL. ArXiv, abs/2311.01173.
[18]Anonymous. OPENTAB: ADVANCING LARGE LANGUAGE MODELS AS OPEN-DOMAIN TABLE REASONERS. Submitted to The Twelfth International Conference on Learning Representations.
[19]Chen, W. (2022). Large Language Models are few(1)-shot Table Reasoners. ArXiv, abs/2210.06710.
[20]Chang, S., & Fosler-Lussier, E. (2023). Selective Demonstrations for Cross-domain Text-to-SQL. ArXiv, abs/2310.06302.
[21]Tonglet, J., Reusens, M., Borchert, P., & Baesens, B. (2023). SEER : A Knapsack approach to Exemplar Selection for In-Context HybridQA. ArXiv, abs/2310.06675.
[22]Gao, D., Wang, H., Li, Y., Sun, X., Qian, Y., Ding, B., & Zhou, J. (2023). Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation. ArXiv, abs/2308.15363.
[23]Saha, S., Yu, X.V., Bansal, M., Pasunuru, R., & Celikyilmaz, A. (2022). MURMUR: Modular Multi-Step Reasoning for Semi-Structured Data-to-Text Generation. ArXiv, abs/2212.08607.
[24]Anonymous. CHAIN-OF-TABLE: EVOLVING TABLES IN THE REASONING CHAIN FOR TABLE UNDERSTANDING. Submitted to The Twelfth International Conference on Learning Representations.
[25]Jiang, J., Zhou, K., Dong, Z., Ye, K., Zhao, W.X., & Wen, J. (2023). StructGPT: A General Framework for Large Language Model to Reason over Structured Data. ArXiv, abs/2305.09645.
[26]Nan, L., Zhang, E., Zou, W., Zhao, Y., Zhou, W., & Cohan, A. (2023). On Evaluating the Integration of Reasoning and Action in LLM Agents with Database Question Answering. ArXiv, abs/2311.09721.
[27]Cao, Y., Chen, S., Liu, R., Wang, Z., & Fried, D. (2023). API-Assisted Code Generation for Question Answering on Varied Table Structures. ArXiv, abs/2310.14687.
[28]Cheng, Z., Xie, T., Shi, P., Li, C., Nadkarni, R., Hu, Y., Xiong, C., Radev, D.R., Ostendorf, M., Zettlemoyer, L., Smith, N.A., & Yu, T. (2022). Binding Language Models in Symbolic Languages. ArXiv, abs/2210.02875.
[29]Zhang, Y., Henkel, J., Floratou, A., Cahoon, J., Deep, S., & Patel, J.M. (2023). ReAcTable: Enhancing ReAct for Table Question Answering. ArXiv, abs/2310.00815.
[30]Ni, A., Iyer, S., Radev, D.R., Stoyanov, V., Yih, W., Wang, S.I., & Lin, X.V. (2023). LEVER: Learning to Verify Language-to-Code Generation with Execution. ArXiv, abs/2302.08468.
[31]Sun, R., Arik, S.Ö., Sinha, R., Nakhost, H., Dai, H., Yin, P., & Pfister, T. (2023). SQLPrompt: In-Context Text-to-SQL with Minimal Labeled Data. ArXiv, abs/2311.02883.
[32]Wang, B., Shin, R., Liu, X., Polozov, O., & Richardson, M. (2019). RAT-SQL: Relation-Aware Schema Encoding and Linking for Text-to-SQL Parsers. Annual Meeting of the Association for Computational Linguistics.
[33]Pi, X., Wang, B., Gao, Y., Guo, J., Li, Z., & Lou, J. (2022). Towards Robustness of Text-to-SQL Models Against Natural and Realistic Adversarial Table Perturbation. Annual Meeting of the Association for Computational Linguistics.
[34]Xu, C., Sun, Q., Zheng, K., Geng, X., Zhao, P., Feng, J., Tao, C., & Jiang, D. (2023). WizardLM: Empowering Large Language Models to Follow Complex Instructions. ArXiv, abs/2304.12244.
[35]Luo, Z., Xu, C., Zhao, P., Sun, Q., Geng, X., Hu, W., Tao, C., Ma, J., Lin, Q., & Jiang, D. (2023). WizardCoder: Empowering Code Large Language Models with Evol-Instruct. ArXiv, abs/2306.08568.
[36]Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., & Cao, Y. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. ArXiv, abs/2210.03629.
[37]Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T., Leike, J., Schulman, J., Sutskever, I., & Cobbe, K. (2023). Let's Verify Step by Step. ArXiv, abs/2305.20050.
[38]Yang, C., Wang, X., Lu, Y., Liu, H., Le, Q.V., Zhou, D., & Chen, X. (2023). Large Language Models as Optimizers. ArXiv, abs/2309.03409.
[39]Sun, C., Li, Y., Li, H., & Qiao, L. (2023). TEST: Text Prototype Aligned Embedding to Activate LLM's Ability for Time Series. ArXiv, abs/2308.08241.
[40]Nakano, R., Hilton, J., Balaji, S.A., Wu, J., Long, O., Kim, C., Hesse, C., Jain, S., Kosaraju, V., Saunders, W., Jiang, X., Cobbe, K., Eloundou, T., Krueger, G., Button, K., Knight, M., Chess, B., & Schulman, J. (2021). WebGPT: Browser-assisted question-answering with human feedback. ArXiv, abs/2112.09332.
[41]Xie, Y., Kawaguchi, K., Zhao, Y., Zhao, X., Kan, M., He, J., & Xie, Q. (2023). Self-Evaluation Guided Beam Search for Reasoning.
[42]Madaan, A., Tandon, N., Gupta, P., Hallinan, S., Gao, L., Wiegreffe, S., Alon, U., Dziri, N., Prabhumoye, S., Yang, Y., Welleck, S., Majumder, B., Gupta, S., Yazdanbakhsh, A., & Clark, P. (2023). Self-Refine: Iterative Refinement with Self-Feedback. ArXiv, abs/2303.17651.
[43]Li, X., Zhu, C., Li, L., Yin, Z., Sun, T., & Qiu, X. (2023). LLatrieval: LLM-Verified Retrieval for Verifiable Generation. ArXiv, abs/2311.07838.
