Boogie专注于NLP应用测试与管理,基于先进GPT-4技术。
Aguru Safeguard提供本地化LLM监控,助力企业优化AI模型应用性能。
nat.dev 提供便捷的语言模型测试与分析工具,助力用户深入理解与优化模型。
Openlit开源平台专注生成式AI与大语言模型的可观测和性能评测。
LLMO Metrics为品牌提供AI平台表现跟踪与优化工具,助力提升模型效能。
权威、公正、透明的大模型评测平台,助力AI模型科学评估。
AI Ping提供专业AI大模型服务性能评测,助力高效选型。
PinchBench专注AI大模型Agent能力评测,数据实时、完全开源,为智能体开发提供权威参考。
OpenCompass司南评测榜单,聚合大语言模型性能排名,助力模型选择与研究分析。
AGI-Eval评测社区汇集高校与机构,打造权威AI大模型评测平台。
Arize.com助力企业高效监控与优化AI模型,提升可观测性与透明度。
全面评估与对比各类AI模型,为用户提供深入分析与选型建议。
Accesssgpts助您发现并评价热门GPT模型,轻松筛选最优AI工具。
LLM Playground 提供免费大型语言模型测试,便于用户体验最新 AI 技术。
ModelFusion为用户提供多AI模型对比及聊天互动,助力智能模型选型与评测。
LLM Price Check帮助用户快速对比主流LLM API价格,优化AI模型选型。
Lakera Guard专注于保护LLM应用安全,防御多种安全威胁,保障AI模型运行环境。
LMArena 是专注于大型语言模型评测与比较的开源平台,支持众包投票与排行榜展示。
Hugging Face推出的开源大模型排行榜单
大规模多任务语言理解基准
中文通用大模型综合性测评基准
H2O.ai推出的基于Elo评级方法的大模型评估系统
生物医学研究问答数据集和模型得分排行榜
智源研究院推出的FlagEval(天秤)大模型评测平台
由复旦大学NLP实验室推出的大模型评测基准
一个全面的中文基础模型评估套件
上海人工智能实验室推出的大模型开放评测体系
一个综合性的大模型中文评估基准
斯坦福大学推出的大模型评测体系
全方位的多模态大模型能力评测体系
以众包方式进行匿名随机对战的LLM基准平台