什么是 RAGAS?
RAGAS(Retrieval Augmented Generation Assessment)是一套专门用于评估 RAG(检索增强生成)系统性能的评估框架和指标集。它系统性地衡量 RAG 系统的各个环节——从检索到生成——帮助开发者发现瓶颈并持续优化。
RAGAS 的核心指标
忠实度(Faithfulness):模型的回答是否基于检索到的文档,还是编造了内容。回答应该忠实于提供的上下文,不添加额外信息。
答案相关性(Answer Relevance):模型的回答是否回答了用户的问题。一个"忠实"但跑题的答案仍然不是好答案。
检索精度(Context Precision):检索到的文档片段中,有多少是真正相关的。精度低说明检索到了很多无关内容。
检索召回率(Context Recall):所有相关的文档片段中,有多少被成功检索到。召回率低说明好内容被遗漏了。
答案正确性(Answer Correctness):综合评估答案与标准答案的匹配程度。
RAGAS 的评估方式
RAGAS 可以自动进行大规模评估——使用大语言模型作为"裁判",对 RAG 系统的输出进行自动评分。这比人工评估快得多、成本低得多,可以支持持续迭代优化。
RAGAS 的意义
RAGAS 提供了一套标准化的评估方法,让 RAG 系统开发从"凭感觉调优"升级为"数据驱动调优"。开发者可以量化每次改进的效果,有针对性地优化检索器、生成模型或提示词。