MMLU(Massive Multitask Language Understanding)是一个大规模多任务语言理解基准测试集,用于评估大语言模型在57个学科领域中的知识广度和推理能力。 57个学科覆盖:涵盖人文、社科、理工、法律、医学等领域,评估维度全面 超大规模题库:包含约15,000道多项选择题,测试模型在广泛知识上的表现 零样本与少样本评估:支持不同提示方式...
Open LLM Leaderboard是Hugging Face社区推出的开源大语言模型排行榜,通过标准化评测任务对社区中提交的模型进行自动基准测试,并以排行榜形式公开展示。 自动化评测流程:提交模型后自动运行多个基准测试,结果实时更新至排行榜 多维度评分:涵盖ARC、HellaSwag、MMLU等6项核心基准测试,综合反映模型能力 开源社区驱动:所有模型权重与评测...
C-Eval是一个专为评估中文大语言模型设计的综合评测基准,涵盖52个学科、约1.4万道选择题,旨在全面衡量中文AI模型的知识储备与推理能力。 中文场景定制:题目均以中文呈现,覆盖中国教育体系下的学科知识,贴合本土应用 多难度层级:包含初中、高中、大学至专业级别题目,可评估模型在垂直领域的深度 零样本与思维链评测:支持标准提示和思维链(CoT)两种评测模式,分析模型推...