这些指标都是在自然语言处理(NLP)和大语言模型评测(尤其是你之前提到的 CRUD-RAG 等大模型问答、摘要系统)中,用来量化评估模型生成文本质量的核心算法。

我们可以把它们分成两大类:基于字词表面匹配的传统指标,以及基于语义理解的现代指标。用大白话帮你通俗地解释一下:


一、 传统字词匹配指标(看词对得准不准)

这类指标不理解文本的意思,只像“查字典”一样,看模型回答的字词和标准答案(Reference)重合了多少。

1. BLEU (Bilingual Evaluation Understudy)
  • 大白话准确率(Precision)导向。看模型吐出来的词,有几个是真正对的。
  • 原理:它最初用于机器翻译。它会统计模型生成的句子中,有百分之多少的字词(或连续的词组 N-gram)在标准答案里出现过。
  • 特点模型越不敢瞎说,得分越高。 如果模型为了投机取巧,只说了一个很有把握的词,哪怕漏掉了很多核心信息,BLEU 也会很高。因此它更看重生成内容的“精准度”。
bleu-1
看 1-gram 重合,也就是单个词/字片段重合。

bleu-2
看连续 2 个词/片段重合。

bleu-3
看连续 3 个词/片段重合。

bleu-4
看连续 4 个词/片段重合。

bleu-avg
综合 BLEU。
2. ROUGE-L (Recall-Oriented Understudy for Gisting Evaluation - LCS)
  • 大白话召回率(Recall)导向。看标准答案里的关键信息,模型答全了没有。
  • 原理:这里的 -L 代表最长公共子序列(Longest Common Subsequence)。它会寻找模型回答和标准答案之间,最长的、顺序一致的共同字串。
  • 特点模型说得越全面,得分越高。 它是做“文本摘要(Delete)”任务最常用的指标,用来检查模型有没有把文章的重点给漏掉。

二、 现代智能语义指标(看意思对不对)

上面的 BLEU 和 ROUGE 都有个致命弱点:死板。如果标准答案是“开心”,模型回答“快乐”,虽然意思完全一样,但因为字不同,传统指标会直接判错。为了解决这个问题,诞生了基于大模型的现代评测指标:

3. BERTScore
  • 大白话作弊神器。不管字一不一样,只要意思对了就给分。
  • 原理:它利用预训练模型(如 BERT)将模型回答和标准答案的每个词都转化为向量(Embedding),然后去计算这些向量在空间里的距离(余弦相似度)。
  • 特点:它能够识别同义词、近义词。比如“自行车”和“单车”,BERTScore 知道它们是一个东西,从而给出很高的分数,这比单纯数格子(看字词重合)要聪明得多。

三、 问答任务专属指标(针对 QA 场景的微观微调)

在 RAG 或问答(QA)评测中,针对模型给出的具体答案片段(通常是抽取式或简短问答),需要更精确的数学统计,这就有了 QA_recallQA_avg_F1

4. QA_recall (问答召回率)
  • 大白话“有没有漏考点?”
  • 公式概念 Q A _ r e c a l l = 模型答对的关键信息量 标准答案包含的全部关键信息量 QA\_recall = \frac{\text{模型答对的关键信息量}}{\text{标准答案包含的全部关键信息量}} QA_recall=标准答案包含的全部关键信息量模型答对的关键信息量
  • 解释:假设标准答案里有 3 个核心考点,你的模型回答出了其中 2 个,哪怕你顺便长篇大论扯了一堆废话,你的 QA_recall 也是 66.7 % 66.7\% 66.7%。它只在乎标准答案里的东西你捕捉到了多少。
5. QA_avg_F1 (问答平均 F1 值)
  • 大白话“综合得分,既不许漏,也不许瞎扯。”
  • 原理:它是准确率(Precision)召回率(Recall)调和平均数
  • 解释
  • 如果模型是个“话痨”,为了凑齐考点写了上万字(Recall 很高,但 Precision 极低),F1 分数会拉跨。
  • 如果模型是个“高冷哥”,只蹦出一个绝对正确的词,其他啥也不说(Precision 很高,但 Recall 极低),F1 分数同样会拉跨。
  • 只有当模型回答得既精准、又全面时,F1 值才会高。QA_avg_F1 就是把所有测试题目的 F1 值加起来求了个平均。

总结一张表

指标名称 它是干什么的? 它的核心关注点
BLEU 传统字词匹配 模型的回答里,错字、废话多不多(准确率)
ROUGE-L 传统字词匹配 标准答案里的字,被模型漏掉了多少(召回率)
BERTScore 现代语义匹配 模型回答的核心意思和标准答案是否一致(不管用词)
QA_recall 问答专项指标 针对问答题,标准答案的考点采分点拿到了多少
QA_avg_F1 问答专项综合 针对问答题,综合评估模型“答得全”和“不瞎扯”的平衡性

在 CRUD-RAG 这种项目里,通常会把这几个指标结合起来看。如果一个模型的 BERTScore 和 QA_avg_F1 很高,说明它的 RAG 检索和生成质量已经非常接近人类的真实理解了。

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐