
FlagEval
FlagEval(天秤)是北京智源人工智能研究院(BAAI)推出的科学、公正、开放的大模型评测体系及开放平台,为研究人员提供全面评估基础模型及训练算法性能的工具和方法。FlagEval采用“能力-任务-指标”三维评测框架,从多个维度对大模型的认知能力进行评估,涵盖对话、问答、情感分析等多种应用场景,提供超过22个数据集和8万道评测题目。
官网域名
flageval.baai.ac.cn
平台
Web
语言
中文
核验时间
2026-05-16
覆盖 14 个实用分类,持续更新优质 AI 工具
精选常用 AI 网站与工具,按分类和关键词快速找到适合你的工具,直接查看官网、平台与功能简介。
收录工具
31,832
一级分类
10
统一标签
267
官网入口
31,832

FlagEval(天秤)是北京智源人工智能研究院(BAAI)推出的科学、公正、开放的大模型评测体系及开放平台,为研究人员提供全面评估基础模型及训练算法性能的工具和方法。FlagEval采用“能力-任务-指标”三维评测框架,从多个维度对大模型的认知能力进行评估,涵盖对话、问答、情感分析等多种应用场景,提供超过22个数据集和8万道评测题目。
官网域名
flageval.baai.ac.cn
平台
Web
语言
中文
核验时间
2026-05-16

H2O EvalGPT 是 H2O.ai 用于评估和比较 LLM 大模型的开放工具,它提供了一个平台来了解模型在大量任务和基准测试中的性能。无论你是想使用大模型自动化工作流程或任务,H2O EvalGPT 都可以提供流行、开源、高性能大模型的详细排行榜,帮助你为项目选择最有效的模型完成具体任务。
官网域名
evalgpt.ai
平台
Web
语言
未标注
核验时间
2026-05-16

LLMEval是由复旦大学NLP实验室推出的大模型评测基准,最新的LLMEval-3聚焦于专业知识能力评测,涵盖哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、军事学、管理学、艺术学等教育部划定的13个学科门类、50余个二级学科,共计约20W道标准生成式问答题目。
官网域名
llmeval.com
平台
Web
语言
未标注
核验时间
2026-05-16

AI Ping是一站式大模型服务评测与模型API调用平台,通过持续监测和专业评测,AI Ping整合数十家供应商的数百个模型服务,如无问芯穹、SophNet、PPIO派欧云等,和知名模型,如DeepSeek、GLM、Kimi、Hunyuan等,为开发者呈现清晰的性能榜单,助力高效选型。
官网域名
aiping.cn
平台
Web
语言
中文
核验时间
2026-05-16

AI Ping是一站式大模型服务评测与模型API调用平台,通过持续监测和专业评测,AI Ping整合数十家供应商的数百个模型服务,如无问芯穹、SophNet、PPIO派欧云等,和知名模型,如DeepSeek、GLM、Kimi、Hunyuan等,为开发者呈现清晰的性能榜单,助力高效选型。
官网域名
aiping.cn
平台
Web
语言
中文
核验时间
2026-05-15

AI Ping是一站式大模型服务评测与模型API调用平台,通过持续监测和专业评测,AI Ping整合数十家供应商的数百个模型服务,如无问芯穹、SophNet、PPIO派欧云等,和知名模型,如DeepSeek、GLM、Kimi、Hunyuan等,为开发者呈现清晰的性能榜单,助力高效选型。
官网域名
aiping.cn
平台
Web
语言
中文
核验时间
2026-05-15

SuperCLUE是一个专注于中文大模型综合测评的权威平台,其产品定位是“中文大模型综合性测评基准”。它为模型研发与应用提供科学、独立、前沿的评测标准,以及客观、公正的参考依据。
官网域名
superclueai.com
平台
Web
语言
中文
核验时间
2026-05-15

官网域名
github.com
平台
Web
语言
中文
核验时间
2026-05-15

官网域名
fm.ai.tsinghua.edu.cn
平台
Web
语言
中文
核验时间
2026-05-15

官网域名
agi-eval.cn
平台
Web
语言
中文
核验时间
2026-05-15

FlagEval (天秤)大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准、方法、工具集,协助研究人员全方位评估基础模型及训练算法的性能,同时探索利用AI方法实现对主观评测的辅助,大幅提升评测的效率和客观性。
官网域名
flageval.baai.ac.cn
平台
Web
语言
中文
核验时间
2026-05-15

官网域名
rank.opencompass.org.cn
平台
Web
语言
中文
核验时间
2026-05-15

Skywork-13B 不仅在 C-Eval,MMLU 等基准测试上全面超越了 LLaMA2-13B,而且这次开源范围包括了 Skywork-13B-Base 模型、Skywork-13B-Math 模型以及每个模型的量化版模型。此外,昆仑万维还同时开源了 600GB、150B Tokens 的高质量中文语料数据集「Skypile/Chinese-Web-Text-150B」。昆仑万维还宣布,Skywork-13B 系列大模型将全面开放商用 —— 开发者无需申请,0 门槛商用。
官网域名
modelscope.cn
平台
Web
语言
中文
核验时间
2026-05-15

KwaiYii快意大模型是快手AI团队研发的大规模语言模型,它在多个权威Benchmark上展现出卓越的性能,尤其在中英文跨学科专业能力、数理逻辑及代码能力方面表现突出。
官网域名
github.com
平台
Web
语言
未标注
核验时间
2026-05-16

官网域名
aigclab.cn
平台
Web
语言
中文
核验时间
2026-05-16

官网域名
agi-eval.cn
平台
Web
语言
中文
核验时间
2026-05-16

官网域名
aiping.cn
平台
Web
语言
中文
核验时间
2026-05-16

Hi Echo是网易有道发布的搭载子曰教育大模型的全球首个虚拟人口语教练。为你提供随时随地的一对一口语练习,覆盖多个对话场景和话题,比真人口语教练更专业地道;提供对话分数及完整对话评测报告,帮助快速提…
官网域名
ziyue-media.youdao.com
平台
Web
语言
未标注
核验时间
2026-05-16

SWE-Lancer 是 OpenAI 开源的一款 大模型能力评估基准,旨在测试大语言模型在实际软件开发任务中的表现。与传统的测试基准不同,SWE-Lancer采用了端到端测试方法,通过模拟真实的开发…
官网域名
github.com
平台
Web
语言
未标注
核验时间
2026-05-16

在人工智能和大语言模型持续发展的时代,如何全面准确地评估和选择适合的AI模型已成为技术从业者面临的重要问题。AGI-Eval评测社区正是在这样的背景下应运而生,为用户提供业内大语言模型的能力得分排名榜单,并以其透明、权威的数据分析帮助用户了解每个模型的优缺点,从而做出明智的选择。全方位评估工具及榜单AGI-Eval的核心是...
官网域名
agi-eval.cn
平台
Web
语言
中文
核验时间
2026-05-15