MMLU MMLU(大规模多任务语言理解)是用于评估人工智能模型综合知识与语言理解能力的基准测试,涵盖 STEM、人文、社会科学及专业领域等 57 个学科。该页面由 Papers with Code 提供,收录 MMLU 任务的最新模型表现、排行榜、论文及代码资源,便于研究人员比较不同模型的评测结果。 AI学习资源 # AI基准测试 # MMLU
C-Eval C-Eval 是一个中文基础模型综合能力评测基准,涵盖多个学科和专业领域,提供标准化的多项选择题数据集与评测结果,用于衡量大语言模型在知识理解、推理和问题解答等方面的能力,支持模型性能对比与研究分析。 AI学习资源 # AI基准测试 # 中文基础模型
MMBench MMBench 是由 OpenCompass 提供的多模态大模型评测基准与榜单平台,面向视觉语言模型等多模态 AI 系统,提供标准化测试集、评测结果和模型性能对比信息。网站可用于了解主流多模态模型在图像理解、推理、感知等任务中的表现,适合研究人员、开发者和 AI 从业者参考模型能力与评测进展。 AI开发平台 # AI基准测试 # OpenCompass
FlagEval FlagEval 是由北京智源人工智能研究院推出的大模型评测平台,面向人工智能模型提供多维度能力评估与榜单展示。网站涵盖模型趋势、评测任务、数据集与结果对比等内容,支持用户了解不同模型在语言理解、生成、推理等方面的表现,适合研究人员、开发者和行业用户参考模型能力与技术进展。 AI开发平台 # AI基准测试 # 大模型评测