注册

4和Claude3都跪了

首页标签4和Claude3都跪了

站长资讯
大模型测试题爆火，GPT-4和Claude3都跪了，LeCun转发：新Benchmark
一项新的“大模型Benchmark”在推特上爆火，LeCun也点赞转发了!而且无论是GPT-4还是Claude3，面对它都如同被夺了魂，无法给出正确答案。难倒一众大模型的，是逻辑学当中经典的“动物过河”问题，有网友发现，大模型对此类问题表现得很不擅长。甚至有人观察到，几个不同的模型都给出了一致的（错误）答案，让人怀疑他们是不是用了相同的训练数据。
站长网2024-06-25 05:03:57
0001

热点

《哪吒2》改写中国影史背后，这些配角燃爆了社交媒体
2025-02-10 03:21:53
对于那些出来卖的DeepSeek课程，我有些话想说。
2025-02-11 18:23:40
抖音、小红书“反精致”崛起，为何粗糙真实更得人心？
2025-02-12 10:27:31
DeepSeek下棋靠忽悠赢了ChatGPT，网友：孙子兵法都用上了
2025-02-10 03:17:44
字节跳动放大招！OmniHuman数字人模型即将上线：一张图+一段音频即可生成视频
2025-02-10 03:06:06
为训练AI不择手段！Meta被曝下载数十TB盗版电子书
2025-02-10 08:38:57
中国AI新秀爆火 DeepSeek成史上最快突破3000万日活App
2025-02-10 08:38:56
雷军驾驶小米YU7参与冬测：表现不错测试任务圆满完成
2025-02-10 05:11:19
用DeepSeek“赚钱”网课泛滥专家：普通用户不用花钱学
2025-02-10 05:11:18
索尼PSN严重宕机！超过24小时才恢复：实体游戏零售商在线补刀
2025-02-10 05:11:17

关注

《哪吒2》登顶，谁赚麻了？
2025-02-07 15:41:39
《封神2》崩的越惨，DeepSeek的刀就越锋利。
2025-02-06 18:40:06
雷军去小米汽车工厂上班了：确认要进一步提产冲击年销30万辆
2025-02-07 15:06:26
一周打赏20万，各个品牌为做“榜一大哥”正在疯狂撒钱。
2025-02-06 18:38:10
小米眼镜官博上线旗下首款AI眼镜将发布
2025-02-07 10:20:34
过年三件套平替爆火：商家月入200万，订单“根本发不完”
2025-02-06 01:10:59
模型优惠进入倒计时 DeepSeek因服务器暂停API服务充值
2025-02-07 03:18:38
一个行业的AI样板：教培的不同环节怎么被改写
2025-02-05 23:37:52
小米眼镜官微上线：智能眼镜赛道要爆发
2025-02-07 02:59:11
黄仁勋喊话年轻人：学会用AI 才能更出色
2025-02-05 23:36:32

推荐