chinese-llm-benchmark - 聚合AI导航网聚合AI导航网

SuperCLUE（中文通用大模型综合性测评基准），是针对中文可用的通用大模型的一个测评基准。它主要要回答的问题是：在当前通用大模型大力发展的情况下，中文大模型的效果情况。包括但不限于：这些模型哪些相对效果情况、相较于国际上的代表性模型做到了什么程度、这些模型与人类的效果对比如何？它尝试在一系列国内外代表性的模型上使用多个维度能力进行测试。SuperCLUE，是中文语言理解测评基准（CLUE）在通用人工智能时代的进一步发展。目前包括三大基准：OPEN多轮开放式基准、OPT三大能力客观题基准、琅琊榜匿名对战基准。

Chatbot Arena

Chatbot Arena是由伯克利大学主导团队LMSYS Org发布的一个基准平台，用于大型语言模型（LLM）的对抗评测。该平台采用匿名和随机的方式，让不同的大型模型进行对抗评测，并通过众包方式收集用户反馈和评分。Chatbot Arena使用Elo评分系统，这是一种在国际象棋等竞技游戏中广泛使用的评分方法，以确保评测的客观性和公正性。 Chatbot Arena不仅是一个评测平台，还提供了一个开放的社区驱动的环境，用户可以通过投票来评估不同模型的表现。此外，该平台还支持多模态评测，允许用户与视觉-语言模型进行交互并进行比较。总的来说，Chatbot Arena已成为全球业界公认的基准标杆，广泛应用于大型语言模型的开发和评估。

FlagEval

FlagEval（天秤）大模型评测体系及开放平台，旨在建立科学、公正、开放的评测基准、方法、工具集，协助研究人员全方位评估基础模型及训练算法的性能，同时探索利用 AI 方法实现对主观评测的辅助，大幅提升评测的效率和客观性。FlagEval（天秤）创新构建了“能力 - 任务 - 指标”三维评测框架，细粒度刻画基础模型的认知能力边界，可视化呈现评测结果。目前已推出语言大模型评测、多语言文图大模型评测及文图生成评测等工具，并对广泛的语言基础模型、跨模态基础模型实现了评测。后续将全面覆盖基础模型、预训练算法、微调 / 压缩算法等三大评测对象，包括自然语言处理（NLP）、计算机视觉（CV）、音频须（Audio）及多模态（Multimodal）等四大评测场景和丰富的下游任务。 FlagEval 是智源 FlagOpen 大模型开源技术体系的重要组成部分。FlagOpen 旨在打造全面支撑大模型技术发展的开源算法体系和一站式基础软件平台，支持协同创新和开放竞争，共建共享大模型时代的“Linux”开源开放生态。

HELM

Holistic Evaluation of Language Models (HELM) 是由斯坦福大学推出的一个综合评估语言模型的平台，旨在提高语言模型的透明度和全面性。HELM 通过多维度的评估方法，涵盖多个不同的自然语言处理任务，如文本分类、命名实体识别和关系抽取等。该评测体系包括场景、适配和指标三个模块，能够为大型语言模型提供全面的质量评估。 HELM 的主要目标是通过标准化评估方法和广泛的覆盖范围，帮助用户了解和选择适合自己需求的语言模型。它采用多指标测量方法，并实现标准化，从而对众多语言模型进行评估。此外，HELM 还提供了一个统一的 API，使得研究人员可以方便地访问和测试不同的语言模型。总之，HELM 是一个先进的语言模型评估框架，通过多维度的评估方法和广泛的覆盖范围，全面了解和提升语言模型的性能和透明度。

OpenCompass

OpenCompass 是一个由上海人工智能实验室发布的开源大模型评测平台，旨在提供公平、公开和可复现的大模型评测方案。它构建了一个包含学科、语言、知识、理解、推理五大维度的通用能力评测体系，能够全面评估大模型的能力。此外，OpenCompass还支持多模态模型的评测，并定期公布评测结果。 OpenCompass不仅支持多种先进的自然语言处理模型，如InternLM2、GPT-4、LLaMa2、Qwen以及GLM和Claude等，还整合了丰富的数据集和问题库，提供了70多个数据集和约40万个问题的模型评估方案。它的评测系统设计灵活，用户可以根据需要增加新模型或数据集，甚至自定义更高级的任务分割策略。 OpenCompass已经成为目前权威的大型模型评估平台，广泛应用于大语言模型和多模态模型的评测中。

MMLU Benchmark

MMLU Benchmark （Massive Multitask Language Understanding）是一个用于评估多任务语言理解模型性能的基准测试。它通过提供多个语言理解任务和模型对比，适用于各种需要进行多任务语言理解的场景。该基准测试覆盖了57个主题，包括STEM、人文学科、社会科学等领域。MMLU Benchmark旨在衡量模型在零样本（zero-shot）和少样本（few-shot）设置下的多任务能力，并通过统一的评估框架来全面评估语言模型的整体性能。此外，MMLU Benchmark包含一个包含15908个问题的数据集，分为几组开发集、验证集和测试集，以测量文本模型在不同任务中的多任务准确率。这个基准测试不仅用于评估模型的知识水平，还强调模型在理解和生成语言方面的能力，涵盖机器翻译、文本摘要和情感分析等多种任务。

相关导航