AGI-Eval AGI-Eval 是一个面向人工智能能力评测与体验的平台,提供与 AGI 相关的模型测试、能力验证和应用展示入口。网站适合关注大模型评测、AI 产品对比、智能体能力分析及前沿人工智能发展的用户访问,可用于了解相关评估服务和平台功能。 AI开发平台 # AGI评测 # AI能力测试
FlagEval FlagEval 是由北京智源人工智能研究院推出的大模型评测平台,面向人工智能模型提供多维度能力评估与榜单展示。网站涵盖模型趋势、评测任务、数据集与结果对比等内容,支持用户了解不同模型在语言理解、生成、推理等方面的表现,适合研究人员、开发者和行业用户参考模型能力与技术进展。 AI开发平台 # AI基准测试 # 大模型评测
MMMLU MMMLU 是 OpenAI 在 Hugging Face 发布的多语言大规模多任务语言理解评测数据集,基于 MMLU 扩展,覆盖多种语言与学科领域,用于评估大语言模型在知识理解、推理和跨语言能力方面的表现。该数据集适合研究人员、模型开发者和评测平台用于多语言模型基准测试、能力对比与相关实验分析。 AI学习资源 # Hugging Face # 基准测试