首页
AI资讯
文章详情

GPT-4不服被Bard反超：最新模型已入场

2024-11-20
AI资讯
原创文章

4
0
0
0

0°

帅气的我简直无法用语言描述！

2762 文章
0 粉丝
0 关注

最近更新

1.「法外狂徒」ChatGPT！30年老律师用它旁征博引，结果被禁止执业

2.三个Agent顶个GPT-4，基于开源小模型的那种｜中大阿里联合出品

3.奥特曼兄弟合砍7.00015万亿美元，弟弟：山姆你给我留点露脸机会吧

文章目录

GPT-4不服被Bard反超：最新模型已入场

网友：Bard联网不公平

西风发自凹非寺

量子位 | 公众号 QbitAI

“大模型排位赛”权威榜单Chatbot Arena刷新：

谷歌Bard超越GPT-4，排名位居第二，仅次于GPT-4 Turbo。

GPT-4不服被Bard反超：最新模型已入场

然鹅，众多网友对此却表示“不服”、“不公平”。

GPT-4不服被Bard反超：最新模型已入场

原来，谷歌AI掌门人Jeff Dean透露，Bard性能大幅提升，是因为搭载了新版大模型——Gemini Pro-scale。

GPT-4不服被Bard反超：最新模型已入场

这也就意味着，打“排位赛”的Bard具备了联网功能。

GPT-4不服被Bard反超：最新模型已入场

网友的质疑正是围绕着这一点展开：

在同一个排行榜上混合在线和离线大模型，是极易引起误解的。

GPT-4不服被Bard反超：最新模型已入场

Hugging Face的“首席羊驼官”Omar Sanseviero也表示：

既然如此…我也可以向lmsys提交具有搜索功能的Mixtral吗？

GPT-4不服被Bard反超：最新模型已入场

面对种种质疑声，Imsys官方做出了回应，其中指出：

Arena排行榜是实时的，大家如有疑问，可在Arena中直接比较模型并投票；
投票数据公开透明，还会即将发布关于用户提示多样性和投票质量的研究以及相应的数据集；

对于网友们最关心的被Bard超越的GPT-4是不联网版本的问题，Imsys表示“如果实时数据的接入能够提升用户体验，排行榜将予以体现”。

并且直接@了OpenAI和Bing以及微软高管Mikhail Parakhin，表示非常乐意在竞技场中加入GPT-4联网版或Bing Copilot。

最新消息是，OpenAI的最新模型gpt-4-0125-preview现已入驻竞技场，等待用户参与投票。

GPT-4不服被Bard反超：最新模型已入场

Bard超越GPT-4是怎么回事？

Chatbot Arena是一个大模型权威榜单，由UC伯克利研究人员主导的Imsys（Large Model Systems Organization）组织创建。

该排行榜采用匿名1V1battle的投票规则，基于Elo评级系统排名。

具体来说，投票页面如下，两个模型Model A和B均匿名，用户在提出多个问题后对模型的回答打分，总共有四个选项：A更好、B更好、A和B一样好，A和B都不好。

GPT-4不服被Bard反超：最新模型已入场

值得一提的是，如果在问答过程中，模型身份泄露，那么该投票作废。

GPT-4不服被Bard反超：最新模型已入场

根据当前榜单，竞技场中有56个大模型：

GPT-4不服被Bard反超：最新模型已入场

此前GPT-4凭借“遥遥领先”的评分，长期霸榜，然而新版Bard发布后，直接超越GPT-4的两个版本冲到了第二名，和GPT-4 Turbo只差34分：

GPT-4不服被Bard反超：最新模型已入场

更详细一点，在所有没有平局的Model A对B的对决中，Model A获胜的比例如下：

GPT-4不服被Bard反超：最新模型已入场

还有每一对模型组合的单挑次数（无平局）：

GPT-4不服被Bard反超：最新模型已入场

此外，Chatbot Arena排行榜还使用自助法对Elo评分估计进行1000次随机抽样，从而评估置信区间等。

GPT-4不服被Bard反超：最新模型已入场

单个模型相对于其他所有模型的平均胜率如下：

GPT-4不服被Bard反超：最新模型已入场

不过值得注意的是，Arena排行榜是实时的，Bard目前虽然排名第二，但总共只有3000多票。

相较而言，GPT-4 Turbo的票数已经达到了30000+，被超越的两个版本的票数也都是Bard的数倍。

GPT-4不服被Bard反超：最新模型已入场

而现在GPT-4最新版本已入场（虽然还没有在排行榜上更新），后续榜单还要再坐等一波～

参考链接：https://twitter.com/lmsysorg/status/1752035632489300239

技术前沿到规模量产：毫末智行&清华2023自动驾驶公开课圆满结课

腾讯云轻量应用服务器上线幻兽帕鲁应用模板，10秒自动化开服

发评论，每天都得现金奖励！超多礼品等你来拿

后，在评论区留言并审核通过后，即可获得现金奖励，奖励规则可见：查看奖励规则

暂无评论...

关联网址

关联标签

相关文章

三个Agent顶个GPT-4，基于开源小模型的那种｜中大阿里联合出品

三个Agent顶个GPT-4，基于开源小模型的那种｜中大阿里联合出品

Agent像人一样分工协作，还能“群聊”交换信息｜ICLR2024 Oral

Agent像人一样分工协作，还能“群聊”交换信息｜ICLR2024 Oral

全栈智能才能兑现AI红利？

全栈智能才能兑现AI红利？

年轻人的第一个多模态大模型，1080Ti轻松运行，已开源在线可玩

年轻人的第一个多模态大模型，1080Ti轻松运行，已开源在线可玩

ChatGPT惊艳更新！一个@让三百万GPTs为你打工

ChatGPT惊艳更新！一个@让三百万GPTs为你打工