谷歌推出通用AI代理:能自动执行600多种动作,游玩复杂3D游戏
谷歌DeepMind的研究人员推出了一种面向3D环境的通用AI代理——SIMA。
SIMA无需访问游戏的源代码,也不需要定制的API。只需要输入图像和用户提供的简单自然语言文本指令,SIMA就能像人类玩家一样执行走路、跑步、建造、打开地图等各种游戏中的操作。
为了测试、训练SIMA的性能,研究人员与8个游戏工作室合作,在《无人深空》、《模拟山羊3》、《Teardown》、《挖矿模拟器》等知名复杂3D游戏上进行了综合测试。
结果显示,用户只需要在游戏中提供简单的文本、图像提示,SIMA就能执行挖矿、开飞船、制作装备、打开外骨骼、搜集任务、爬楼梯等600多种基本操作,每个动作可以在大约10秒内完成。
技术报告:https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/sima-generalist-ai-agent-for-3d-virtual-environments/Scaling%20Instructable%20Agents%20Across%20Many%20Simulated%20Worlds.pdf
在游戏场景中测试AI代理是一个重要课题,与传统的沙盒2D方法不同的是,SIMA选择了操作、环境、视觉难度更高的3D游戏。
SIMA使用了大模型的训练方法,通过广泛的数据分布来识别那些复杂的动作,同时无需为每个新游戏设计特定的控制、观察模块,就能理解人类的文本指令,并将其转化为具体的行动。
多种大模型组成的“人体”
从SIMA的总体架构来看,由多种大模型组合而成像是在模仿人体。视觉感知模型充当“眼睛”、大语言模型充当“大脑”、建模规划模型充当“思维”、控制和执行模型充当“四肢”。
也就是说SIMA在接收到指令后,会用人的方式去思考、规划接收到的任务,然后再去执行。
视觉感知模型:视觉感知模块负责处理AI代理的图像观察,并提取关键信息以辅助语言指令的理解和环境的交互。该模块使用卷积神经网络(CNN)等深度学习技术对输入的图像数据进行处理和特征提取。
使得SIMA能够识别和分析图像中的物体、场景和空间位置等重要信息,以帮助AI代理更好地理解语言指令,并在虚拟世界中进行准确的交互和操作。
大语言模型:主要负责解析和理解输入的自然语言指令。使用了NLP、词嵌入、序列模型和注意力机制等技术,将语言指令转化为机器可理解的表示。
使得AI代理能够准确地理解和解释指令中的动作和目标,为后续的建模和规划提供基础。
建模规划模型:通过强化学习和规划算法,与环境的交互和反馈来学习最佳的行动策略。AI代理通过不断尝试和优化,逐渐掌握了在不同环境下执行任务的能力。
可根据语言指令、视觉感知信息和当前环境状态,生成有效的动作序列,以实现任务的完成。
控制和执行模型:主要负责将生成的动作序列转化为实际的动作控制指令,并映射到键盘、鼠标上,以驱动AI代理在3D游戏中执行任务,例如,移动、跳跃、奔跑、挖矿等,同时可根据环境的反馈进行自适应调整和优化。
数据收集和预处理
数据收集和预处理是SIMA的核心模块之一,主要获取、准备和处理用于训练和评估AI代理的数据。
研究人员从商业游戏等环境搜集了海量数据,搜集完成后对数据进行了清洗、转换和标准化数据操作,方便后续的训练和分析。
数据清洗:对原始数据进行去噪和异常值处理,可能会存在一些噪声或异常数据,例如,图像中的视觉干扰或语言指令中的错误字符。研究人员通过采用图像去噪和文本纠错的方式,来消除这些干扰因素。
数据转换:在进行训练之前,需要将原始数据转换为机器可处理的格式。图像数据,可以使用图像处理技术进行特征提取或缩放操作,以便于模型的训练和推理;
文本数据,可以进行词汇化、分词和编码等处理,将其转换为数值表示形式输入到深度学习模型中。
数据标准化:为了确保数据的一致性和可比性,需要对数据进行标准化处理。包括对图像进行归一化或标准化,以使其具有相似的亮度、对比度和颜色分布。对于文本数据,可以进行词干化、停用词移除和词向量化等操作。
经过一系列数据清洗、转换、标准化后,可以帮助SIMA更好地去学习游戏中的物体、动作、交互等,从而提升整体的动作指令准确率。
研究人员表示,未来,会持续迭代SIMA的通用代理能力,希望可以在实际生活中帮助用户做更多的事情。
抖音旗下公司申请醒言AI、简涌AI商标
天眼查App显示,近日,抖音集团旗下北京有竹居网络技术有限公司申请注册“醒言AI”“简涌AI”“问问子贡”商标,国际分类为科学仪器、网站服务、教育娱乐,当前商标状态均为等待实质审查。股东信息显示,该公司由抖音集团(香港)有限公司全资持股。站长网2023-10-26 16:43:070002抖音测试付费短视频 客服回应:内测范围将逐步开放
近日,抖音测试付费短视频的话题登上热搜,此次测试的范围不再局限于短剧类目,而是涵盖了日常、知识、娱乐等视频内容。据报道,抖音客服表示,如果遇到付费视频,用户可以选择划走。目前,付费视频功能的开通针对的是10万粉丝以上、账号状态正常、无违规情况、原创度高的部分个人用户进行内测,后续会逐步开放内测范围。在观看付费视频时,App将不支持手机录屏,以保护创作者权益。站长网2023-11-16 14:11:090000机器人还会炒菜、颠锅和喂猪?单条视频获赞超10万
日前,视频号创作者“人工智能应用助手”发布了一条“AI机器人炒菜”的视频。在视频中,机器人一手掌勺,一手打蛋,颠锅翻炒,动作一气呵成。观众纷纷惊呼“全都用机器人,那还要人类干什么”。然而,实际上这是用AI制作的特效视频,机器人与背景之间有模糊虚化的边界,锅铲也没有被机器人的手握住。作者在描述中也明确表示,仅供娱乐,不要当真。站长网2024-01-22 14:36:540000仿劲舞团直播32.1万人在线 团播会是下一个风口?
几个月前,直观曾给大家分享过“非主流”席卷午夜娱播的案例。本来以为这股怀旧风只限于唱歌的直播间,没想到现在团播也被席卷。最近在抖音的团播中,很多团队主播开始以一身“非主流”的妆造出现在屏幕前,并以80/90曾经最流行的音游作为背景,将整场直播打造成一个怀旧的游戏场景。站长网2023-11-20 20:37:38000010万人围观竞拍,82年雪碧如何用老梗在抖音玩出新增长?
来瓶82年的雪碧不再是玩笑。曾经的网络热梗“1982年的雪碧”,被官方玩梗致敬,成为了⌈雪碧致敬1982⌋;抖音网友的DIY版“1982雪碧礼盒”开箱热潮,也成为了雪碧与抖音电商超级品牌日的灵感来源,创新推出了「雪碧致敬1982」抖音电商超级品牌日限定木桶礼盒。站长网2023-07-13 08:59:580000