LMArena 是全球领先的 AI 大模型评测平台,通过真人盲测对比的方式,为各类大语言模型提供公正、透明的性能评估。
核心特点
真人盲测评测
- 匿名对比:用户不知道正在测试哪个模型
- 并排比较:同时测试两个模型,用户投票选择更好的回答
- 公正透明:基于真实用户反馈,而非固定题库
- 动态更新:排行榜实时更新,反映模型最新表现
多维度评测
- 综合能力:整体模型表现排名
- 中文能力:专门的中文榜单
- 编程能力:代码生成和编程任务评测
- 硬提示词:测试模型处理复杂指令的能力
- 创意写作:评估模型创意和表达能力
丰富的模型库
- 全球模型:涵盖 OpenAI、Anthropic、Google、Meta 等主流模型
- 国产模型:DeepSeek、通义千问、文心一言、智谱等
- 开源模型:LLaMA、Mistral、Qwen 等
- 持续更新:新模型发布后尽快纳入评测
使用方式
竞技场模式
- 选择评测类别(综合、中文、编程等)
- 输入提示词
- 查看两个匿名模型的回答
- 投票选择更好的回答
- 揭晓模型身份
直接对话
- 选择特定模型进行对话
- 对比不同模型的回答风格
- 测试模型在特定任务上的表现
应用价值
- 模型选择:帮助用户选择最适合的 AI 模型
- 性能基准:为模型开发者提供行业基准
- 技术趋势:了解 AI 领域最新发展动态
- 公平比较:避免营销宣传的干扰,获得真实评测
项目背景
- 发起方:LMSYS(Large Model Systems Organization)
- 开源项目:代码和数据开源透明
- 学术界支持:由 UC Berkeley、CMU 等高校研究人员发起
- 社区驱动:全球用户参与评测和投票