ragas官方文档中文版(二)
·
快速开始
快速入门:快速启动评估
在几分钟内开始使用 Ragas。只需几个命令即可创建完整的评估项目。
步骤 1:创建项目
选择以下方法之一:
1、uvx(推荐)
无需安装。uvx 会自动下载并运行 ragas:
uvx ragas quickstart rag_eval
cd rag_eval
2、先安装 Ragas
先安装 ragas,然后创建项目:
pip install ragas
ragas quickstart rag_eval
cd rag_eval
步骤 2:安装依赖
安装项目依赖:
uv sync
或者如果您更喜欢使用 pip:
pip install -e .
步骤 3:设置 API 密钥
默认情况下,快速入门示例使用 OpenAI。设置您的 API 密钥即可开始使用。您也可以通过少量更改使用其他提供商:
1、OpenAI(默认)
export OPENAI_API_KEY="your-openai-key"
2、Anthropic Claude
设置您的 Anthropic API 密钥:
export ANTHROPIC_API_KEY="your-anthropic-key"
然后在 evals.py 中更新 LLM 初始化:
from anthropic import Anthropic
from ragas.llms import llm_factory
client = Anthropic(api_key=os.environ.get("ANTHROPIC_API_KEY"))
llm = llm_factory("claude-3-5-sonnet-20241022", provider="anthropic", client=client)
3、Google Gemini
设置您的 Google 凭据:
export GOOGLE_API_KEY="your-google-api-key"
然后在 evals.py 中更新 LLM 初始化:
选项 1:使用 Google 官方库(推荐)
import google.generativeai as genai
from ragas.llms import llm_factory
genai.configure(api_key=os.environ.get("GOOGLE_API_KEY"))
client = genai.GenerativeModel("gemini-2.0-flash")
llm = llm_factory("gemini-2.0-flash", provider="google", client=client)
# Adapter is auto-detected as "litellm" for google provider
更多 Gemini 选项和详细设置,请参阅 Google Gemini 集成指南。
4、本地模型(Ollama)
在本地安装并运行 Ollama,然后在 evals.py 中更新 LLM 初始化:
from openai import OpenAI
from ragas.llms import llm_factory
# Create an OpenAI-compatible client for Ollama
client = OpenAI(
api_key="ollama", # Ollama doesn't require a real key
base_url="http://localhost:11434/v1"
)
llm = llm_factory("mistral", provider="openai", client=client)
5、自定义/其他提供商
对于任何具有 OpenAI 兼容 API 的 LLM:
from openai import OpenAI
from ragas.llms import llm_factory
client = OpenAI(
api_key="your-api-key",
base_url="https://your-api-endpoint"
)
llm = llm_factory("model-name", provider="openai", client=client)
有关更多详细信息,请了解 LLM 集成。
项目结构
生成的项目包含:
rag_eval/
├── README.md # Project documentation
├── pyproject.toml # Project configuration
├── rag.py # Your RAG application
├── evals.py # Evaluation workflow
├── __init__.py # Makes this a Python package
└── evals/
├── datasets/ # Test data files
├── experiments/ # Evaluation results
└── logs/ # Execution logs
步骤 4:运行评估
运行评估脚本:
uv run python evals.py
或者如果您使用 pip 安装:
python evals.py
评估将:从 evals.py 中的 load_dataset() 函数加载测试数据
- 使用测试问题查询您的 RAG 应用
- 评估响应
- 在控制台显示结果
- 将结果保存到 CSV 文件(位于 evals/experiments/ 目录)

恭喜!您已成功运行完整的评估设置。🎉
自定义评估
添加更多测试用例
编辑 evals.py 中的 load_dataset() 函数以添加更多测试问题:
from ragas import Dataset
def load_dataset():
"""Load test dataset for evaluation."""
dataset = Dataset(
name="test_dataset",
backend="local/csv",
root_dir=".",
)
data_samples = [
{
"question": "What is Ragas?",
"grading_notes": "Ragas is an evaluation framework for LLM applications",
},
{
"question": "How do metrics work?",
"grading_notes": "Metrics evaluate the quality and performance of LLM responses",
},
# Add more test cases here
]
for sample in data_samples:
dataset.append(sample)
dataset.save()
return dataset
自定义评估指标
模板包含用于自定义评估逻辑的 DiscreteMetric。您可以通过以下方式自定义评估:
1、修改指标提示 - 更改评估标准
2、 调整允许值 - 更新有效的输出类别
3、 添加更多指标 - 为不同方面创建额外指标
修改指标的示例:
from ragas.metrics import DiscreteMetric
from ragas.llms import llm_factory
my_metric = DiscreteMetric(
name="custom_evaluation",
prompt="Evaluate this response: {response} based on: {context}. Return 'excellent', 'good', or 'poor'.",
allowed_values=["excellent", "good", "poor"],
)
下一步
- 学习概念:阅读评估简单 LLM 应用指南以深入了解
- 自定义指标:使用简单的装饰器创建您自己的指标
- 生产集成:将评估集成到您的 CI/CD 管道中
- RAG 评估:使用专门的指标评估 RAG 系统
- 智能体评估:探索 AI 智能体评估
- 测试数据生成:为您的评估生成合成测试数据集
获取帮助
- 📚 完整文档
- 💬 加入我们的 Discord 社区
- 🐛 报告问题
更多推荐
所有评论(0)