谷歌DeepMind新方法Gecko,为测试AI图像生成器引入严格新标准
划重点:
⭐ 谷歌 DeepMind 发布了新的基准 Gecko,揭示了当前文本到图像 AI 评估方法的缺陷,并引入了一个包含超过10万份人类评分的严格新标准。
⭐ “Gecko” 基准通过2000个文本提示对文本到图像模型全面评估,同时提供了增强的自动评估指标,揭示了先前未被发现的模型优和劣势。
⭐ 研究人员希望通过 “Gecko” 基准的引入,能够更准确地评估和诊模型的能力,促进 AI 技术的进一步发展。
谷歌 DeepMind 最近的研究示了当前我们对文本到图像 AI 模型性能评估的隐藏局限性。在其发布在预印本服务器 ariv 上的研究中,他们引入了一种全新的方法称为 “Gecko”,承诺提供一个更全和可靠的基准,以评估这一蓬勃发展的技术。

研究团队在其题为 “用 Gecko 审视文本到图像评估:对度量、提示和人类评分” 的论文中警告称:“虽然文到图像生成模型已经变得无处不在,但它们并不一定生成与给定提示相一致的图。” 他们指出,目前主要用于评估 DALL-E、Midjourney 和 Stable Diffusion 等模型能力数据集和自动度量并不能全面反映实际情况。
小规模的人类评估提供了有限的解,而自动度量可能会忽略重要细微之处,甚至与人类评委产生分歧。 为了揭示这些问题,研究人员开发了 “Gecko”—— 一个新的基准套件,它为文本到图模型提供了更高难度的测试。Gecko基准通过2000个文本提示对模型进行全面考核,探究各种技能和复杂程度。它将这些提示分成具体的子技能,超越模糊的类,以准确找出限制模型的确切弱点。
研究人员还收集了对数个领先模型生成的图像进行的超过10万份人类评分。这一基准可以揭示模型性能差距是源自模型真正的局限性、模糊的提示,还是评估方法的不一致。
“Gecko” 基准还采用了一个基于问的增强自动评估指标,与人类判断更为相关。当用于比较新基准下的最先进模型时,这一组合揭示了先前未被发现的模型优势和劣势。 研究人员希望他的工作能够证明使用多样的基准和评估方法来真正了解文本到图像 AI 在实际部署前能做什么,不能做什么的重要性。他们计划免费公开 “Gecko” 代码和数据,推动进一步的进展。 因此,尽管那些看似令人印象深刻的作品可能乍一看令人印象深刻,但我们仍然需要严格的测试来区分真假。Gecko为我们展示了如何做到这一。
论文:https://arxiv.org/pdf/2404.16820
阿里天猫精灵推出AI治理开源数据集 预计在6月份开放第一批问答数据
日前,阿里巴巴旗下的天猫精灵与通义大模型团队联合多位领域学者和组织,推出了一个名为100PoisonMpts的大语言模型治理开源中文数据集,宣布十余位知名专家学者成为首批“给AI投100瓶毒药”的标注工程师。标注人各提出100个含有偏见和歧视回答的棘手问题,并标注出大型模型的回答,完成由AI"投毒"和"解毒"的攻防。站长网2023-06-03 16:23:150000中国汽车行业第一!比亚迪总市值达5723亿元
快科技1月1日消息,据媒体报道,截至2023年年末,比亚迪的总市值为5723.37亿元,以绝对的优势位居中国汽车行业上市公司市值榜单第1。报道表示,汽车是拉动内需、扩大消费的重要领域之一,在新能源汽车发展最火热的土地上,中国的新能源汽车相关领域也在高速发展。站长网2024-01-01 14:58:250000与辉同行因没东西卖停播一天 董宇辉首场直播带货超1.5亿
站长之家(ChinaZ.com)1月12日消息:“与辉同行”公众号近日发文表示,将停播一天,原因是“没东西卖了”。据悉,1月9日晚上7点,“与辉同行”的首场直播准时开始,作为东方甄选为董宇辉全新开辟的账号,直播间开播不到1分钟在线人数迅速超过10万,开播20分钟就收获了2亿点赞,更成为抖音小时榜、人气榜双料冠军。站长网2024-01-12 10:25:300000视频号电商走出黑盒?
被称作腾讯「全场希望」的视频号,2023年开始释放商业能量。去年这个时候,视频号电商还处于一片浓雾之中。当时,还有很多基础工具等待补齐,模糊的客群画像需要更清晰,用户标签也需要时间沉淀。除了自带强大私域能力,大部分商家都像丈二和尚,摸不着头脑。一年过去,这个黑匣子逐渐可视化。这一年是视频号蓄力也是发力的一年。0000从3个核心维度,理解百度战略布局电商业务的底层逻辑
1最近几年,百度公司的表现让笔者刮目相看。除了在搜索引擎主战场稳住基本盘之外,其正在多个新业务领域遍地开花。站长网2023-05-26 18:12:070001