CMMLU CMMLU 是一个用于评估大语言模型中文知识与多任务理解能力的基准测试项目,涵盖人文、社会科学、理工、法律、医学等多个领域。项目提供数据集、评测任务及相关说明,适合研究人员用于中文语言模型的能力测试、对比分析与性能研究。 AI学习资源 # 中文大模型 # 中文知识
MMMLU MMMLU 是 OpenAI 在 Hugging Face 发布的多语言大规模多任务语言理解评测数据集,基于 MMLU 扩展,覆盖多种语言与学科领域,用于评估大语言模型在知识理解、推理和跨语言能力方面的表现。该数据集适合研究人员、模型开发者和评测平台用于多语言模型基准测试、能力对比与相关实验分析。 AI学习资源 # Hugging Face # 基准测试
Open LLM Leaderboard Open LLM Leaderboard 是 Hugging Face 提供的开放大语言模型评测排行榜,用于展示和比较各类开源 LLM 在标准基准测试中的表现。页面汇总模型分数、参数规模、许可证等信息,方便研究人员、开发者和用户了解不同模型的能力差异,辅助模型选型、实验对比与开源 AI 生态研究。 AI学习资源 # Hugging Face # LLM对比
SuperCLUE SuperCLUE 是面向中文大模型能力评测的综合基准与榜单平台,围绕中文理解、知识、推理、数学、代码、多轮对话等任务,对主流大语言模型进行系统测试与结果展示。网站提供 SuperCLUE 评测体系、模型排名、测评说明和相关研究资料,帮助研究者、开发者和企业用户了解不同模型在中文场景下的表现与差异,适合用于大模型选型参考、能力对比和中文 AI 评测信息查询。 AI学习资源 # AI研究 # 中文大模型