MMLU MMLU(大规模多任务语言理解)是用于评估人工智能模型综合知识与语言理解能力的基准测试,涵盖 STEM、人文、社会科学及专业领域等 57 个学科。该页面由 Papers with Code 提供,收录 MMLU 任务的最新模型表现、排行榜、论文及代码资源,便于研究人员比较不同模型的评测结果。 AI学习资源 # AI基准测试 # MMLU