快速开始

快速入门:快速启动评估

在几分钟内开始使用 Ragas。只需几个命令即可创建完整的评估项目。

步骤 1:创建项目

选择以下方法之一:

1、uvx(推荐)

无需安装。uvx 会自动下载并运行 ragas:

uvx ragas quickstart rag_eval
cd rag_eval
2、先安装 Ragas

先安装 ragas,然后创建项目:

pip install ragas
ragas quickstart rag_eval
cd rag_eval

步骤 2:安装依赖

安装项目依赖:

uv sync

或者如果您更喜欢使用 pip:

pip install -e .

步骤 3:设置 API 密钥

默认情况下,快速入门示例使用 OpenAI。设置您的 API 密钥即可开始使用。您也可以通过少量更改使用其他提供商:

1、OpenAI(默认)
export OPENAI_API_KEY="your-openai-key"
2、Anthropic Claude

设置您的 Anthropic API 密钥:

export ANTHROPIC_API_KEY="your-anthropic-key"

然后在 evals.py 中更新 LLM 初始化:

from anthropic import Anthropic
from ragas.llms import llm_factory

client = Anthropic(api_key=os.environ.get("ANTHROPIC_API_KEY"))
llm = llm_factory("claude-3-5-sonnet-20241022", provider="anthropic", client=client)
3、Google Gemini

设置您的 Google 凭据:

export GOOGLE_API_KEY="your-google-api-key"

然后在 evals.py 中更新 LLM 初始化:

选项 1:使用 Google 官方库(推荐)

import google.generativeai as genai
from ragas.llms import llm_factory

genai.configure(api_key=os.environ.get("GOOGLE_API_KEY"))
client = genai.GenerativeModel("gemini-2.0-flash")
llm = llm_factory("gemini-2.0-flash", provider="google", client=client)
# Adapter is auto-detected as "litellm" for google provider

更多 Gemini 选项和详细设置,请参阅 Google Gemini 集成指南。

4、本地模型(Ollama)

在本地安装并运行 Ollama,然后在 evals.py 中更新 LLM 初始化:

from openai import OpenAI
from ragas.llms import llm_factory

# Create an OpenAI-compatible client for Ollama
client = OpenAI(
    api_key="ollama",  # Ollama doesn't require a real key
    base_url="http://localhost:11434/v1"
)
llm = llm_factory("mistral", provider="openai", client=client)
5、自定义/其他提供商

对于任何具有 OpenAI 兼容 API 的 LLM:

from openai import OpenAI
from ragas.llms import llm_factory

client = OpenAI(
    api_key="your-api-key",
    base_url="https://your-api-endpoint"
)
llm = llm_factory("model-name", provider="openai", client=client)

有关更多详细信息,请了解 LLM 集成。

项目结构

生成的项目包含:


rag_eval/
├── README.md              # Project documentation
├── pyproject.toml         # Project configuration
├── rag.py                 # Your RAG application
├── evals.py               # Evaluation workflow
├── __init__.py            # Makes this a Python package
└── evals/
    ├── datasets/          # Test data files
    ├── experiments/       # Evaluation results
    └── logs/              # Execution logs

步骤 4:运行评估

运行评估脚本:

uv run python evals.py

或者如果您使用 pip 安装:

python evals.py

评估将:从 evals.py 中的 load_dataset() 函数加载测试数据

  • 使用测试问题查询您的 RAG 应用
  • 评估响应
  • 在控制台显示结果
  • 将结果保存到 CSV 文件(位于 evals/experiments/ 目录)

在这里插入图片描述

恭喜!您已成功运行完整的评估设置。🎉

自定义评估

添加更多测试用例

编辑 evals.py 中的 load_dataset() 函数以添加更多测试问题:

from ragas import Dataset

def load_dataset():
    """Load test dataset for evaluation."""
    dataset = Dataset(
        name="test_dataset",
        backend="local/csv",
        root_dir=".",
    )

    data_samples = [
        {
            "question": "What is Ragas?",
            "grading_notes": "Ragas is an evaluation framework for LLM applications",
        },
        {
            "question": "How do metrics work?",
            "grading_notes": "Metrics evaluate the quality and performance of LLM responses",
        },
        # Add more test cases here
    ]

    for sample in data_samples:
        dataset.append(sample)

    dataset.save()
    return dataset
自定义评估指标

模板包含用于自定义评估逻辑的 DiscreteMetric。您可以通过以下方式自定义评估:

1、修改指标提示 - 更改评估标准
2、 调整允许值 - 更新有效的输出类别
3、 添加更多指标 - 为不同方面创建额外指标

修改指标的示例:

from ragas.metrics import DiscreteMetric
from ragas.llms import llm_factory

my_metric = DiscreteMetric(
    name="custom_evaluation",
    prompt="Evaluate this response: {response} based on: {context}. Return 'excellent', 'good', or 'poor'.",
    allowed_values=["excellent", "good", "poor"],
)

下一步

  • 学习概念:阅读评估简单 LLM 应用指南以深入了解
  • 自定义指标:使用简单的装饰器创建您自己的指标
  • 生产集成:将评估集成到您的 CI/CD 管道中
  • RAG 评估:使用专门的指标评估 RAG 系统
  • 智能体评估:探索 AI 智能体评估
  • 测试数据生成:为您的评估生成合成测试数据集

获取帮助

  • 📚 完整文档
  • 💬 加入我们的 Discord 社区
  • 🐛 报告问题
Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐