Bleu,rouge-L,bertScore,QA_avg_F1 , QA_recall 是什么意思(大白话解说板)
·
文章目录
这些指标都是在自然语言处理(NLP)和大语言模型评测(尤其是你之前提到的 CRUD-RAG 等大模型问答、摘要系统)中,用来量化评估模型生成文本质量的核心算法。
我们可以把它们分成两大类:基于字词表面匹配的传统指标,以及基于语义理解的现代指标。用大白话帮你通俗地解释一下:
一、 传统字词匹配指标(看词对得准不准)
这类指标不理解文本的意思,只像“查字典”一样,看模型回答的字词和标准答案(Reference)重合了多少。
1. BLEU (Bilingual Evaluation Understudy)
- 大白话:准确率(Precision)导向。看模型吐出来的词,有几个是真正对的。
- 原理:它最初用于机器翻译。它会统计模型生成的句子中,有百分之多少的字词(或连续的词组 N-gram)在标准答案里出现过。
- 特点:模型越不敢瞎说,得分越高。 如果模型为了投机取巧,只说了一个很有把握的词,哪怕漏掉了很多核心信息,BLEU 也会很高。因此它更看重生成内容的“精准度”。
bleu-1
看 1-gram 重合,也就是单个词/字片段重合。
bleu-2
看连续 2 个词/片段重合。
bleu-3
看连续 3 个词/片段重合。
bleu-4
看连续 4 个词/片段重合。
bleu-avg
综合 BLEU。
2. ROUGE-L (Recall-Oriented Understudy for Gisting Evaluation - LCS)
- 大白话:召回率(Recall)导向。看标准答案里的关键信息,模型答全了没有。
- 原理:这里的 -L 代表最长公共子序列(Longest Common Subsequence)。它会寻找模型回答和标准答案之间,最长的、顺序一致的共同字串。
- 特点:模型说得越全面,得分越高。 它是做“文本摘要(Delete)”任务最常用的指标,用来检查模型有没有把文章的重点给漏掉。
二、 现代智能语义指标(看意思对不对)
上面的 BLEU 和 ROUGE 都有个致命弱点:死板。如果标准答案是“开心”,模型回答“快乐”,虽然意思完全一样,但因为字不同,传统指标会直接判错。为了解决这个问题,诞生了基于大模型的现代评测指标:
3. BERTScore
- 大白话:作弊神器。不管字一不一样,只要意思对了就给分。
- 原理:它利用预训练模型(如 BERT)将模型回答和标准答案的每个词都转化为向量(Embedding),然后去计算这些向量在空间里的距离(余弦相似度)。
- 特点:它能够识别同义词、近义词。比如“自行车”和“单车”,BERTScore 知道它们是一个东西,从而给出很高的分数,这比单纯数格子(看字词重合)要聪明得多。
三、 问答任务专属指标(针对 QA 场景的微观微调)
在 RAG 或问答(QA)评测中,针对模型给出的具体答案片段(通常是抽取式或简短问答),需要更精确的数学统计,这就有了 QA_recall 和 QA_avg_F1。
4. QA_recall (问答召回率)
- 大白话:“有没有漏考点?”
- 公式概念: Q A _ r e c a l l = 模型答对的关键信息量 标准答案包含的全部关键信息量 QA\_recall = \frac{\text{模型答对的关键信息量}}{\text{标准答案包含的全部关键信息量}} QA_recall=标准答案包含的全部关键信息量模型答对的关键信息量
- 解释:假设标准答案里有 3 个核心考点,你的模型回答出了其中 2 个,哪怕你顺便长篇大论扯了一堆废话,你的
QA_recall也是 66.7 % 66.7\% 66.7%。它只在乎标准答案里的东西你捕捉到了多少。
5. QA_avg_F1 (问答平均 F1 值)
- 大白话:“综合得分,既不许漏,也不许瞎扯。”
- 原理:它是准确率(Precision)和召回率(Recall)的调和平均数。
- 解释:
- 如果模型是个“话痨”,为了凑齐考点写了上万字(Recall 很高,但 Precision 极低),F1 分数会拉跨。
- 如果模型是个“高冷哥”,只蹦出一个绝对正确的词,其他啥也不说(Precision 很高,但 Recall 极低),F1 分数同样会拉跨。
- 只有当模型回答得既精准、又全面时,F1 值才会高。
QA_avg_F1就是把所有测试题目的 F1 值加起来求了个平均。
总结一张表
| 指标名称 | 它是干什么的? | 它的核心关注点 |
|---|---|---|
| BLEU | 传统字词匹配 | 模型的回答里,错字、废话多不多(准确率) |
| ROUGE-L | 传统字词匹配 | 标准答案里的字,被模型漏掉了多少(召回率) |
| BERTScore | 现代语义匹配 | 模型回答的核心意思和标准答案是否一致(不管用词) |
| QA_recall | 问答专项指标 | 针对问答题,标准答案的考点采分点拿到了多少 |
| QA_avg_F1 | 问答专项综合 | 针对问答题,综合评估模型“答得全”和“不瞎扯”的平衡性 |
在 CRUD-RAG 这种项目里,通常会把这几个指标结合起来看。如果一个模型的 BERTScore 和 QA_avg_F1 很高,说明它的 RAG 检索和生成质量已经非常接近人类的真实理解了。
更多推荐


所有评论(0)