Chatbot Arena

Chatbot Arena

以众包方式进行匿名随机对战的LLM基准平台

标签：AI模型评测

链接直达手机查看

Chatbot Arena是一个大型语言模型 (LLM) 的基准平台，以众包方式进行匿名随机对战，该项目方LMSYS Org是由加州大学伯克利分校、加州大学圣地亚哥分校和卡内基梅隆大学合作创立的研究组织。

通过demo体验地址进入对战平台，输入自己感兴趣的问题，提交问题后，匿名模型会两两对战，分别生成相关答案，需要用户对答案做出评判，从4个评判选项中选择一个：模型A更好、模型B更好、平手、都很差。支持多轮对话。最终使用Elo评分系统对大模型的能力进行综合评估。(可以自己指定模型看效果，但不计入最终排名情况)。

数据统计

相关导航

LLMEval3

由复旦大学NLP实验室推出的大模型评测基准

MMBench

全方位的多模态大模型能力评测体系

FlagEval

智源研究院推出的FlagEval（天秤）大模型评测平台

OpenCompass

OpenCompass

上海人工智能实验室推出的大模型开放评测体系

PubMedQA

生物医学研究问答数据集和模型得分排行榜

CMMLU

一个综合性的大模型中文评估基准

暂无评论

暂无评论...

懒猪导航收录了国内外数百个不同类型的AI工具，每日更新和添加最新AI工具，帮助你加入人工智能浪潮，自动化高效完成任务！ Ctrl + D 或 ⌘ + D 收藏本站到浏览器书签栏。

lazypig.net 隐私协议免责声明业务合作文章博客

Copyright © 2024 懒猪导航晋ICP备17005780号-3