StableVicuna StableVicuna 是由 LMSYS Chatbot Arena 提供访问的开源对话模型相关服务入口,用户可通过在线聊天界面体验不同大语言模型的对话能力,并参与模型效果对比与评测。网站聚合了多种 AI 聊天机器人,适合用于了解开源语言模型表现、进行简单问答测试、文本生成体验及模型横向比较。 AI开发平台 # AI聊天 # Chatbot Arena
书生 书生是面向人工智能大模型研发与应用的开放平台,提供书生大模型相关介绍、开源项目、开发工具、技术文档、教程资源及社区动态,帮助开发者了解模型能力,开展大模型学习、部署、评测与应用开发。 AI学习资源 # 大语言模型 # 应用开发
PromptPilot PromptPilot 是火山引擎推出的面向大模型应用的 Prompt 优化平台,覆盖提示词生成、开发部署、评测调优与持续迭代等流程。平台可基于用户意图和模型回复数据进行分析,帮助开发者优化大语言模型 Prompt 表现,并通过 API 接入获取实时反馈,构建 AI 应用与业务数据之间的反馈闭环,适用于大模型应用开发、模型回复评分和提示词管理等场景。 AI开发平台 # AI提示词工具 # API接入
SuperCLUE SuperCLUE 是面向中文大模型能力评测的综合基准与榜单平台,围绕中文理解、知识、推理、数学、代码、多轮对话等任务,对主流大语言模型进行系统测试与结果展示。网站提供 SuperCLUE 评测体系、模型排名、测评说明和相关研究资料,帮助研究者、开发者和企业用户了解不同模型在中文场景下的表现与差异,适合用于大模型选型参考、能力对比和中文 AI 评测信息查询。 AI学习资源 # AI研究 # 中文大模型
Open LLM Leaderboard Open LLM Leaderboard 是 Hugging Face 提供的开放大语言模型评测排行榜,用于展示和比较各类开源 LLM 在标准基准测试中的表现。页面汇总模型分数、参数规模、许可证等信息,方便研究人员、开发者和用户了解不同模型的能力差异,辅助模型选型、实验对比与开源 AI 生态研究。 AI学习资源 # Hugging Face # LLM对比
MagicArena MagicArena 是一个视觉大模型公开对战与效果对比平台,支持用户免费体验图片生成、视频生成等主流 AI 模型能力。平台覆盖 Midjourney、FLUX、可灵、海螺、即梦等模型,提供文生图、文生视频、图生视频等场景的生成结果对比,并可通过参与模型对战形成个人化的大模型排行榜,适合用于 AI 图像生成、视频生成模型评测与选择参考。 AI绘画 # AI 对战 # AI 排名
MMLU MMLU(大规模多任务语言理解)是用于评估人工智能模型综合知识与语言理解能力的基准测试,涵盖 STEM、人文、社会科学及专业领域等 57 个学科。该页面由 Papers with Code 提供,收录 MMLU 任务的最新模型表现、排行榜、论文及代码资源,便于研究人员比较不同模型的评测结果。 AI学习资源 # AI基准测试 # MMLU
CMMLU CMMLU 是一个用于评估大语言模型中文知识与多任务理解能力的基准测试项目,涵盖人文、社会科学、理工、法律、医学等多个领域。项目提供数据集、评测任务及相关说明,适合研究人员用于中文语言模型的能力测试、对比分析与性能研究。 AI学习资源 # 中文大模型 # 中文知识