C-Eval是一个专为评估大语言模型中文能力设计的测试工具包,由上海交大、清华和爱丁堡大学团队于2023年5月联合发布。其核心特点如下:
- 规模与结构
包含13948道选择题,覆盖52个学科(如数学、法律、医学等)和4个难度等级(从基础到专业级),形成多层次评估体系。 - 评测目标
聚焦模型的中文理解能力,通过真实学科题目检验模型在知识掌握、逻辑推理和语言处理上的综合表现,而非简单对话能力。 - 应用价值
为研究人员提供标准化中文测评基准,帮助开发者量化模型在不同领域的表现,推动中文大模型优化。
简言之,C-Eval如同\”中文高考\”,通过海量学科考题全面检验大模型的知识广度与深度,成为衡量中文AI水平的重要标尺。
功能亮点
中文全学科覆盖
52个学科、1.4万道中文选择题,横跨中国教育体系全阶段
多难度梯度
初中至专业级题目分层,可精准定位模型知识深度
双评测模式
支持零样本与思维链(CoT)提示,兼顾基础能力与推理过程分析
本土化场景
题目内容贴合中文语境与本土知识,避免翻译偏差影响评估
优缺点分析
优点
- 评测维度全面,覆盖文理工医等主流学科,结果参考性强
- 题目来源规范,基于中国课程标准设计,适合国内模型研发迭代
- 提供标准化评测脚本,支持横向对比不同模型的学科能力短板
不足之处
- 选择题形式限制,对生成式开放性任务的评估覆盖不足
- 题库更新频率未知,可能滞后于快速演进的知识场景
常见问题 FAQ
适合哪些模型评测?
主要面向中文大语言模型,也可用于多语言模型的中文能力专项测试
如何获取评测结果?
官网提交模型预测结果,系统自动计算各学科及总体准确率
CoT模式有何优势?
可观测模型推理步骤,帮助定位逻辑错误而非仅看最终答案
同类工具对比
| 工具名称 | 核心功能 | 价格 | 易用性 |
|---|---|---|---|
| MMLU | 57学科覆盖、1.5万道选择题、零样本/少样本评估 | 免费开源 | 中,需自行搭建评测环境 |
| C-Eval | 52个中文学科、1.4万道题、零样本/CoT双模式 | 免费开源 | 中,需配置中文评测环境 |
站点档案
面向中文AI研发者的本土化大模型评测基准,覆盖中国教育体系全学科。