当前位置：YY分类目录 » 站长资讯 » 资讯文章 » 站长新闻 » 文章详细

智源研究院开源JudgeLM 可评测各类大模型并输出评分(北京智源研究院加班吗)

来源：网络　浏览：10次　时间：2023-11-13

11月13日消息:智源研究院开源了一种名为 JudgeLM 的裁判模型，可以高效准确地评判各类大模型。

与 GPT-4相比，JudgeLM 仅需1/120的成本，就能达到90% 以上的评判结果一致性。它可以应用于纯文本、多模态等多种评判场景，并可以输出评分、判断和阐述理由。

微信截图_20231113082912.png

通过创新方法，JudgeLM 与参考答案的一致性最高超过了90%，接近人类表现。JudgeLM 有三个不同参数版本，分别为70亿、130亿和330亿参数，能力和表现随着参数规模的增大而提升。

此外，智源研究院还开源了一个包含训练和验证样本的数据集，用于深入研究大语言模型裁判。JudgeLM 的评判效率高，成本低于基于 API 的评判方法。

未来，JudgeLM 团队将进一步完善这一裁判模型，提供更准确、高效、覆盖更多场景的大语言模型评判。

JudgeLM 相关资源:

github :https://github.com/baaivision/JudgeLM

arxiv :https://arxiv.org/abs/2310.17631

demo（33B） :https://218.91.113.230:9004/

推荐站点

66网站目录
66网站目录是免费收录各行业优秀网站,提供网站分类目录检索,关键字搜索,提交网站即可免费推广,增加外链,提升网站流量。
www.66dir.com
265分类目录
网址目录网站网址大全,收集正规的中文官方网站,用户自主提交网站,265分类目录努力打造互动新颖的网站分类目录导航收录平台
www.265dir.com
YY分类目录
YY分类目录全人工编辑的开放式网站分类目录，收录国内外、各行业优秀网站，旨在为用户提供网站分类目录检索、优秀网站参考、网站推广服务。
www.yydir.com
名人百科网
名人百科网(mrenbaike.net)--为大家提供各行各业的名人资料、资讯、图片等,致力于打造国内专业的名人百科平台！
www.mrenbaike.net
菜鸟教程
菜鸟教程提供了基础编程技术教程。菜鸟教程的 Slogan 为：学的不仅是技术，更是梦想！记住：再牛逼的梦想也抵不住傻逼似的坚持！本站域名为 runoob.com, runoob 为 Running Noob 的缩写，意为：奔跑吧！菜鸟。本站包括了HTML、CSS、Javascript、PHP、C、Python等各种基础编程教程。同时本站中也提供了大量的在线实例，通过实例，您可以更好地学习如何建站。本站致力于推广各种编程语言技.
www.runoob.com
中国社会公益网
陕西省社会公益基金会是经陕西省民政厅批准的公募基金会，下设秘书处、公益项目部、筹款募捐部、宣传策划部、社会活动部、专项基金部、资金管理部、公关联络部、青年志愿者工作委员会、青年志愿者爱心乐团等部门机构
www.cpf.net.cn
CNMO科技新媒体
CNMO=Connect More,致力于通过内容成为人与科技、人与产品、人与品牌、人与服务对接的桥梁,让产业、产品的价值与服务得到专业且有趣的解读和适配,引领用户畅享科技带来的美好生活!
www.cnmo.com
国外主机测评
国外主机测评，国外VPS、云服务器，国外服务器，国外主机的相关优惠信息、商家背景、网络带宽、线路走法、售前和售后技术支持等，是目前最好的一家国外主机评测平台。
www.zhujiceping.com
赵容部落
赵容部落，一个收集国内，国外便宜主机，VPS，云服务器，独立服务器优惠促销信息，提供VPS新手教程，VPS评测，VPS代购代付服务的博客。
www.zrblog.net

智源研究院开源JudgeLM 可评测各类大模型并输出评分(北京智源研究院加班吗)

推荐文章

推荐站点