MMLU(Massive Multitask Language Understanding)即“大规模多任务语言理解”,是加州大学伯克利分校团队于2020年9月提出的大模型评测基准。它通过57项跨领域任务(如数学、历史、计算机科学、法律等)全面测试模型对英文知识的掌握和理解能力,是目前最权威的大模型语义理解测评之一。
该测试的特点在于:
- 任务多样性:覆盖STEM、人文社科等多学科,考察模型是否具备广泛知识储备;
- 难度分级:包含基础概念题到专业级问题,能区分模型能力层次;
- 英文场景:所有题目使用英文,侧重评估国际通用语言下的理解水平。
MMLU通过让模型直接回答选择题或开放式问题,量化其知识覆盖广度与逻辑推理深度,成为衡量大模型“智力水平”的重要标尺。例如,GPT-3.5在该测试中达到约70%准确率,而人类专家可达90%,这一差距直观反映了AI的当前能力边界。
功能亮点
学科全覆盖
57个学科横跨人文、社科、理工、法律、医学,知识维度无死角
题库规模庞大
约15,000道选择题,足以检验模型在广泛领域的记忆与推理
多提示模式
支持零样本与少样本评估,灵活适配不同模型测试需求
标准化评测
统一题目格式与评分规则,结果可跨模型横向对比
优缺点分析
优点
- 评测维度全面,能暴露模型在细分学科上的短板
- 题目质量高,涵盖常识与专业深度,区分度明显
- 社区认可度高,已成为大模型能力对比的“标配”基准
不足之处
- 题库静态固定,存在数据污染风险,模型可能通过记忆刷分
- 纯选择题形式,难以评估生成式推理与开放问答能力
常见问题 FAQ
为什么MMLU被广泛使用?
它覆盖多学科且题量充足,能快速给出模型知识广度的量化参考
零样本和少样本测试有何区别?
零样本直接提问,少样本给示例后提问,后者更能反映模型遵循指令的能力
MMLU能替代其他评测基准吗?
不能,它侧重知识记忆与推理,建议结合代码、对话等专项基准综合判断
同类工具对比
| 工具名称 | 核心功能 | 价格 | 易用性 |
|---|---|---|---|
| MMLU | 57学科覆盖、1.5万道选择题、零样本/少样本评估 | 免费开源 | 中,需自行搭建评测环境 |
| Open LLM Leaderboard | 6项基准自动评测、社区驱动、动态排名对比 | 免费开源 | 高,提交模型自动评测 |
站点档案
面向AI研究者的多学科大语言模型能力评估基准,提供标准化知识推理测试。
