AI评测
共收录 13 款AI评测相关的AI工具

HELM
HELM是斯坦福大学CRFM推出的AI大模型评测平台,提供多维度基准测试与排行榜,助力模型选型与学术研究。

LMArena
LMArena是一个通过用户盲测投票来评估和排名全球AI大模型的开放平台,提供文本、图像、代码等多维度模型排行榜。

LLMEval3
LLMEval3是复旦大学NLP实验室打造的大语言模型评测基准,覆盖13+学科、医学AI与22万+生成式问题,提供公开排行榜。

睿小鉴AI检测智能体
睿小鉴AI检测智能体,由中科睿鉴推出,支持图片、视频、音频、文本的全模态AI伪造检测,输出可信度判断与专业鉴伪报告。

MagicArena
MagicArena汇集主流AI大模型,通过竞技对战与多维度评测,帮助用户快速找到最适合的AI工具。

MMLU
MMLU是衡量大语言模型在多学科知识上综合理解能力的权威基准测试,覆盖57个学科领域。

Open LLM Leaderboard
Open LLM Leaderboard是Hugging Face推出的开源大语言模型评测排行榜,通过标准化基准测试追踪和比较全球开源LLM性能表现。

C-Eval
C-Eval是一个涵盖52个学科、13948道题的中文大语言模型评估套件,提供排行榜与在线探索功能。

FlagEval
FlagEval是由北京智源研究院推出的AI大模型评测平台,提供多维度、多模态的模型能力评估与榜单排名。

SuperCLUE
SuperCLUE是中文通用大模型综合性测评基准,通过多轮开放式、客观题与匿名对战等维度,对国内外主流大模型进行月度评测与排名。

AGI-Eval
AGI-Eval 是一个专注于通用人工智能能力评估的模型评测平台,帮助用户系统化衡量各类 AI 模型的综合表现。

OpenCompass
OpenCompass是开源、高效、全面的大模型评测平台,提供权威榜单与评测工具,助力模型能力评估与选型。

MMBench
MMBench是OpenCompass团队推出的多模态大模型评测基准,通过丰富题库全面衡量AI模型的视觉理解与推理能力。
