Mobile-Agent: 具有视觉感知 可以像人类样操作手机的自主多模态AI代理
划重点:
📱 纯视觉解决方案,无需系统代码,通过图像分析理解和操作手机
🤖 能完成多种任务,如购物、播放音乐、使用导航APP、写便签和发邮件
🔍 特点包括独立于XML和系统元数据、即插即用、自主任务规划和执行、自反思能力
Mobile-Agent是一款具有视觉感知的自主多模式移动设备代理,由北京交通大学联合阿里巴巴团队共同开发。简单的说,Mobile-Agent相当于一个可以模拟人类操作手机的自主多模态AI代理。
该代理采用纯视觉解决方案,独立于XML和系统元数据,不需要任何系统代码,完全通过分析图像来理解和操作手机。
它能够自动完成各种任务,比如可以在淘宝加购物车车,在APP播放音乐,自主使用导航APP,收发邮件等等。
Mobile-Agent的主要特点包括操作范围不受限制,多应用操作,以及采用纯视觉解决方案。其无需探索和培训,用户可随时使用。项目团队通过 Mobile-Eval 进行了性能评估,包括10个主流单应用场景和1个多应用场景,为用户提供了详细的评估结果。该评估覆盖了阿里巴巴、亚马逊音乐、谷歌地图等10个应用场景,以及一个多应用场景。
每个场景设计了三个不同难度的指令,以评估 Mobile-Agent 在各种任务下的表现,具体如下
应用操作说明阿里巴巴1.帮我在阿里巴巴找帽子。
2.帮我在阿里巴巴找帽子。如果商品信息页面中显示“添加到购物车”,请将商品添加到我的购物车。
3.我想买一顶帽子。我听说阿里巴巴的东西很便宜。也许你可以帮我找到它。
亚马逊音乐1.在亚马逊音乐中搜索歌手周杰伦。
2. 在亚马逊音乐中搜索一首关于“特工”的音乐并播放。
3.我想听音乐放松一下。寻找一个应用程序来帮助我。
谷歌浏览器1. 搜索今天湖人队比赛的结果。
2. 搜索有关泰勒·斯威夫特的信息。
3. 我想知道今天湖人队比赛的结果。寻找一个应用程序来帮助我。
邮箱1. 发送一封空电子邮件至 {address}。
2. 发邮件到{address}n告诉我的新作品。
3. 我想让我的朋友知道我的新作品,他的地址是{address}。寻找一个应用程序来帮助我。
谷歌地图1.导航至杭州西湖。
2. 导航到附近的加油站。
3.我想去杭州西湖,但不认识路。寻找一个应用程序来帮助我。
谷歌游戏1. 在 Play 商店下载 WhatsApp。
2. 在 Play 商店下载 Instagram。
3. 我想要在手机上安装 WhatsApp。寻找一个应用程序来帮助我。
笔记1. 在Notes中创建一个新笔记。
2. 在Notes中创建一个新笔记并写入“您好,这是一条笔记”,然后保存。
3.我突然有事要记录,帮我找个App,写下以下内容:下午3点开会。
设置1.开启深色模式。
2. 打开飞行模式。
3. 我想查看电池电量下的实时网速,请帮我打开此设置。
抖音1. 在 TikTok 中滑动一段有关宠物猫的视频,并为该视频点“赞”。
2、在抖音里刷一段关于宠物猫的视频并评论“哦哦哦,好可爱的猫!”。
3.在TikTok中滑动视频。点击“喜欢”3只宠物视频猫。
YouTube1. 在 YouTube 上搜索有关斯蒂芬·库里的视频。
2. 在 YouTube 上搜索有关斯蒂芬·库里的视频,然后打开“评论”评论“哦,厨师,你的篮球精神一直激励着我”。
3. 我需要你帮助我在 YouTube 上表达我对斯蒂芬·库里的喜爱。
多应用程序1. 打开日历并查看今天的日期,然后转到“注释”并创建一个新注释以写入“今天是{今天的数据}”。
2.查看未来5天的温度,然后在笔记中新建一条笔记,写下温度分析。
3. 搜索今天湖人队比赛的结果,然后在注释中创建注释,为该结果撰写体育新闻。
MobileAgent的特点包括依赖于纯视觉解决方案、独立于XML和系统元数据、具备多种视觉感知工具进行操作定位、无需探索和训练即插即用。其工作原理涵盖视觉感知工具、自主任务规划和执行、自反思等关键模块,使其能够准确识别和操作手机屏幕上的各种元素。团队宣布即将发布移动代理的演示视频,展示其在实际操作中的性能和应用场景。
腾讯:2023年查处触犯“腾讯高压线”案件70余起 解聘120余人
今日,腾讯集团发布反舞弊通报称,为防止和打击商业贿赂、职务侵占等舞弊行为,腾讯建立了严格的风险管理体系,制定了“腾讯高压线”等反舞弊制度。一旦员工被发现违反这些规定,将立即被解聘,并可能被列入公司黑名单,禁止与腾讯再度合作。对于涉嫌违法犯罪的行为,腾讯将与公安司法机关紧密合作,深入调查,并追究相关人员的法律责任。站长网2024-02-02 17:58:580000短剧赛道再迎高潮,银行为什么开始讨好年轻人
重生、逆袭、霸总……你是否也正沉迷于土味短剧?短剧到底有多火?快手平台7月短剧日活用户达3亿,每日观看10集以上的用户约1.4亿,同比增长55.3%;抖音短剧比去年同期,付费用户增长10倍,付费金额增长5倍。站长网2024-09-23 01:14:360000怎么劝ChatGPT干活效果最好?我们尝试了100种方法,有图有真相
在ChatGPTAPI中,系统提示是一项很有亮点的功能,它允许开发人员控制LLM输出的「角色」,包括特殊规则和限制。系统提示中的命令比用户输入提示中的命令要有效得多,这让开发人员拥有了更大的发挥空间,而不是像现在使用ChatGPT网页应用程序和移动应用程序那样仅仅使用用户提示。举个例子,一个很有趣的Trick就是「给小费」。站长网2024-03-10 18:00:290001轻松识别Midjourney等AI生成图片,开源GenImage
AIGC时代,人人都可以使用Midjourney、StableDiffusion等AI产品生成高质量图片,其逼真程度肉眼难以区分真假。这种虚假照片有时会对社会产生不良影响,例如,生成公众人物不雅图片用于散播谣言;合成虚假图片用于金融欺诈,造成信任危机等。站长网2024-01-16 10:08:2000003D模型生成工具Meshy-2发布 模型质量显著增强
3D模型生成工具Meshy发布了Meshy-2,这一3D模型生成工具在模型质量和用户体验方面经过显著增强,同时引入了更多的艺术风格、增强的几何和纹理细节,以及方便的网格设置。产品入口:https://top.aibase.com/tool/meshy-2站长网2024-02-06 10:44:190000