首页站长资讯AI视野：OpenAI推新模型GPT-4-0125-preview；阿里Qwen-VL升级更新；苹果播客新增转录功能；AI写真项目InstantID在GitHub爆火

AI视野：OpenAI推新模型GPT-4-0125-preview；阿里Qwen-VL升级更新；苹果播客新增转录功能；AI写真项目InstantID在GitHub爆火

站长网2024-01-31 15:57:510阅

欢迎来到【AI视野】栏目!这里是你每天探索人工智能世界的指南，每天我们为你呈现AI领域的热点内容，聚焦开发者，助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解：https://top.aibase.com/

🤖📱💼AI应用

OpenAI不服GPT-4被Bard反超推出最新模型GPT-4-0125-preview

【AiBase提要:】

😲 Bard搭载了新版大模型Gemini Pro-scale

😠 网友质疑混合在线和离线大模型

🔄 模型GPT-4-0125-preview已入场竞技场

Finalframe即将推出适用于AI生成视频的剪辑界面

要点:

⭐ Finalframe支持文本转视频和图像转视频

⭐ 支持创建、打开、保存项目，以及导出完整时间轴

⭐ 即将推出的新功能让视频剪辑方式更直观方便

官网地址:https://top.aibase.com/tool/finalframe

WhisperKit开源!可在iPhone和Mac流畅体验实时语音转录

【AiBase提要:】

😃Argmax公司将WhisperKit作为首个项目。

😃WhisperKit以MIT许可证的形式开源。

😃WhisperKit实现了实时语音转文本。

项目入口:https://top.aibase.com/tool/whisperkit

苹果iOS17.4更新:播客应用新增转录功能

【AiBase提要:】

⭐ 转录功能自动生成播客节目文字稿

⭐ 初期支持英语、法语、德语和西班牙语

⭐ 转录文本不包含动态插入音频和音乐歌词

Mistral-Medium意外泄露神秘新模型“Miqu”击败GPT-4之外的所有大模型

【AiBase提要:】

🤔 Mistral-Medium模型意外泄露，引发AI社区热议，与名为"Miqu"的新模型有关。

🔥 Miqu在EQ-Bench基准上表现强大，与Mistral-Medium相近，但发布者身份神秘。

💥 Miqu身份存疑，是否Mistral-Medium早期版本或Llama70B。

开源地址:https://top.aibase.com/tool/miqu-1-70b

Vary-toy:具有高级视觉词汇视觉语音模型

【AiBase提要:】

📌 挑战与潜力: 大型视觉语言模型在计算机视觉和自然语言处理任务表现出色，但在图像感知能力方面仍有潜力待发。

📌 模型结构: LVLMs采用图像标记作为前缀或交叉注意力进行特征融合，效率受视觉词汇网络的限制。

📌 解决方案: MEGVII Technology的研究人员提出Vary-toy，用于提高LVLMs的图像感知能力。

项目入口:https://top.aibase.com/tool/vary-toy

阿里巴巴多模态模型Qwen-VL升级更新推出这2个版本

【AiBase提要:】

⭐ Qwen-VL-Plus和Qwen-VL-Max版本推出

⭐ 在多模态任务上与GeminiUltra和GPT-4V相当

⭐ Qwen-VL-Max在视觉推理方面展现卓越能力

试用地址:https://huggingface.co/spaces/Qwen/Qwen-VL-Max

AI实时对话系统WhisperFusion:集成大模型，与AI无缝语音对话

【AiBase提要:】

1. 🎙️ 实时语音转文本:利用OpenAI WhisperLive实现即时将口语转换为文本。

2. 🧠 大型语言模型整合:集成Mistral大型语言模型，提升对转录文本的理解和上下文把握。

3. ⚙️ TensorRT优化:LLM和Whisper均经过TensorRT引擎优化，确保高性能和低延迟处理。

📰🤖📢AI新鲜事

Midjourney使用1.6万名艺术家数据库进行训练遭批判

【AiBase提要:】

📌 艺术家反应:艺术家指责公司侵权

📌 法律诉讼:涉及多方提起集体诉讼

📌 艺术家作品未经许可被用于训练AI程序

Open AI否认报告称ChatGPT泄露了用户密码

【AiBase提要:】

😡 OpenAI否认ChatGPT泄露密码

😡 Ars Technica报道泄露工单及网站登录凭证

😡 ChatGPT遭指控为漏洞百出

AI写真项目InstantID在GitHub引爆热潮

【AiBase提要:】

⭐ AI写真项目InstantID在全网刷屏

⭐ 项目背后是来自小红书的 InstantX 团队

⭐ InstantID出图速度快，不需模型训练，支持多种风格

项目地址:https://top.aibase.com/tool/instantid

微软等公司财报低于预期美股AI相关巨头市值一夜蒸发1900亿美元

【AiBase提要:】

📉 微软、Alphabet和超微公布季度业绩低于预期。

💻 与AI相关的公司市值一夜蒸发1900亿美元。

📉 英伟达的股价在1月份上涨了27%，但在盘后交易中也回落了2%以上。

美国点评网站Yelp将加强AI功能部分功能已在iOS版上线

【AiBase提要:】

👉 Yelp的新功能包括AI生成的摘要和首页重新设计

👉 AI生成的摘要将简洁地介绍商家的特色和服务

👉 摘要功能已在iOS上推出，未来会扩展到Android和网页

MIT最新研究:纯文本模型也能训练出视觉表征用代码就能作画

【AiBase提要:】

👁️ 纯文本模型训练视觉概念表征的新可能性

💻 语言模型无法直接处理像素形式的视觉信息

🌈 语言模型在生成复杂场景方面表现出色

论文地址:https://arxiv.org/pdf/2401.01862.pdf

首个图像序列基准测试Mementos开源 GPT-4V/Gemini竟看不懂漫画!

【AiBase提要:】

🤔 Mementos测试的关键目的是测试多模态大语言模型的推理能力。

😟 对于GPT-4V和Gemini等模型，在图像序列推理中表现不足20%。

🤯 Mementos测试发现模型容易产生对象幻觉和行为幻觉。

项目地址:https://mementos-bench.github.io/

200GB!AutoMathText:专注数学文本的超大规模数据集

【AiBase提要:】

1. AutoMathText是一个庞大的数学文本数据集，总体规模达到200GB，汇聚了来自多个来源的数据，适用于多种应用场景。

2. 数据集包含10亿到100亿的数据量级，提供丰富的资源供大规模模型训练。

3. AutoMathText提供了详细的领域标签，涵盖数学推理、推理、微调等方面。

高效机器人学习软件SERL25分钟学会一个任务

【AiBase提要:】

⭐ 机器人学习软件SERL通过更少的尝试快速学会新任务

⭐ SERL可执行多种复杂任务，如组装电路板、布线或移动物体

⭐ 这一软件工具包已经教会机器人执行多种任务，包括组装电路板、布线或移动物体到新位置

项目地址:https://top.aibase.com/tool/serl

AI视野OpenAI推新模型GPT4 0125preview阿里QwenVL升级更新苹果播客新增转录功能AI写真项目InstantID在GitHub爆火

0000

评论列表

共(0)条

相关推荐

站长资讯
ChatGPT正在测试原生文件分析功能，DALL·E 3能P图啦！
10月29日，有部分用户在社交平台上分享，ChatGPTPlus正在测试原生文件上传、分析功能，可以通过文本问答的方式，对上传的PDF等数据文件进行提问、搜索。例如，上传一份50页的员工手册PDF文件，然后向ChatGPT提问，能帮我总结一下手册的5个核心观点吗?;新入职员工触犯规则后，会遭遇哪些处罚?
站长网2023-10-30 09:20:45
0000
站长资讯
用AI陪玩家玩《我的世界》，华人AI创业者融资千万美金
近日，由华人RobertYang创立的AI创企Altera推出了一个可以陪玩《Minecraft》的AIAgent「AlteraBots」，并宣布完成900万美元种子轮融资，加上之前融到的200万美元，公司的融资额已经过了千万美金。
站长网2024-05-12 04:04:53
0000
站长资讯
微信视频号合规治理白皮书发布
2023年5月10日，《视频号合规治理白皮书》发布，从平台规则体系、内容生态体系、未成年人保障体系、个人信息保护体系、机构用户管控体系、知识产权保护体系等六大维度，系统性地分享了视频号在合规及生态治理方面的举措及成效。
站长网2023-05-17 08:23:26
0000
站长资讯
京东：618期间将推出总裁AI数字人直播带来真5折低价
5月31日晚8点，京东将正式开启“京东618，又便宜又好”活动。活动以用户体验为核心，旨在提供优质、低价的购物体验。京东CEO许冉强调，用户体验是京东的核心价值观，从过去的百亿补贴、春晓计划到现在的优质服务和技术创新，京东一直致力于不断提升用户体验。
站长网2024-05-29 17:58:00
0000
站长资讯
Google Photos将推出Ask Photos功能动动嘴就能搜索照片和视频
GooglePhotos即将推出一项名为AskPhotos的实验性功能，该功能利用AI模型Gemini，允许用户通过自然语言搜索来查找照片和视频，并辅助完成相关任务。AskPhotos的主要功能:自然语言搜索:用户可以使用自然语言问题搜索照片和视频，而无需记住具体的关键词或拍摄日期。
站长网2024-05-17 10:19:14
0000