来自 Hugging Face 排行榜和评估团队的闪电般快速、灵活的 LLM 评估首选工具包。
[](https://github.com/huggingface/lighteval/actions/workflows/tests.yaml?query=branch%3Amain)
[](https://github.com/huggingface/lighteval/actions/workflows/quality.yaml?query=branch%3Amain)
[](https://www.python.org/downloads/)
[](https://github.com/huggingface/lighteval/blob/main/LICENSE)
[](https://pypi.org/project/lighteval/)
---
---
**Lighteval** 是您的*一体化工具包*,用于评估多个领域的法学硕士
后端——无论您的模型是**在某个地方**还是**已经加载到内存中**。
通过保存和探索*详细、深入了解模型的性能,
逐个样本结果* 进行调试并查看模型的叠加情况。
*触手可及的定制*:让您可以浏览我们所有现有的任务和[指标](https://huggingface.co/docs/lighteval/metric-list),或者轻松创建您自己的[自定义任务](https://huggingface.co/docs/lighteval/adding-a-custom-task)和[自定义指标](https://huggingface.co/docs/lighteval/adding-a-new-metric),根据您的需求量身定制。
## 可用任务
Lighteval 支持跨多个领域的 **1000 多个评估任务**
语言。使用[这个
space](https://huggingface.co/spaces/OpenEvals/open_benchmark_index) 查找内容
您需要,或者,这里是一些*流行基准*的概述:
### 📚 **知识**
- **常识**:MMLU、MMLU-Pro、MMMU、BIG-Bench
- **问答**:TriviaQA、自然问题、SimpleQA、人类最后的考试 (HLE)
- **专业**:GPQA、AGIEval、LEXam
### 🧮 **数学和代码**
- **数学问题**:GSM8K、GSM-Plus、MATH、MATH500
- **竞赛数学**:AIME24、AIME25
- **多语言数学**:MGSM(10 多种语言的小学数学)
- **编码基准**:LCB (LiveCodeBench)
### 🎯 **聊天模型评估**
- **指示