MosaicML推开源大语言模型MPT-7B-8K 上下文长度达8k
站长之家(ChinaZ.com)7月20日 消息:MosaicML 发布了名为 MPT-7B-8K 的7B 参数开源语言模型(LLM),支持8K 的上下文长度。与以前的模型相比,MPT-7B-8K LLM 在摘要和回答任务方面展现出卓越的能力。
据该公司称,该模型在 MosaicML 平台上进行训练,并从 MPT-7B 检查点开始进行预训练过程。预训练阶段使用Nvidia H100进行,另外在256个 H100上进行了三天的训练,包含了令人印象深刻的5000亿个token数据。
MosaicML 发布的 MPT-30B 在人工智能社区引起了轰动,MPT-30B 是一种开源且商业许可的基于解码器的 LLM。该公司声称其比GPT-3-175B更强大,参数只有GPT-3的17%,相当于300亿。
MPT-30B 在各种任务中的性能都超过了 GPT-3,并且证明比类似大小的模型训练效率更高。例如,LLaMA-30B 所需的 FLOPs 预算比 MPT-30B 大约高1.44倍,而 Falcon-40B 的 FLOPs 预算比 MPT-30B 高1.27倍。
MosaicML 声称,与之前发布的所有型号相比,新型号 MPT-7B-8K 在文档摘要和问答任务方面表现出卓越的熟练程度。该模型专门针对加速训练和推理进行了优化,以获得更快的结果。此外,它还允许在 MosaicML 平台内微调特定领域的数据。
该公司还宣布提供 MPT-7B-8k 的商用版本,强调其在包含1.5万亿token的广泛数据集上的出色训练,超越了 XGen、LLaMA、Pythia、OpenLLaMA 和 StableLM 等类似模型。
MosaicML 声称,通过使用 FlashAttention 和 FasterTransformer,该模型在快速训练和推理方面表现出色,同时受益于llm-foundry 存储库提供的开源训练代码 。
该公司发布了三种版本的模型:
MPT-7B-8k-Base: 这种解码器式 Transformer 基于 MPT-7B 进行预训练,并进一步优化,扩展序列长度为8k。它接受了5000亿个令牌的额外训练,产生了包含文本和代码的1.5万亿个token的大量语料库。
MPT-7B-8k-Instruct: 该模型专为长格式教学任务而设计,包括总结和问答。它是通过使用精心策划的数据集对 MPT-7B-8k 进行微调而制作的。
MPT-7B-8k-Chat: 此变体充当类似聊天机器人的模型,专注于对话生成。它是通过使用约15亿个聊天数据token对 MPT-7B-8k 进行微调而创建的。
Mosaic 声称,MPT-7B-8k 模型表现出与当前其他具有8k 上下文长度的开源模型相当或更好的性能,该公司的上下文学习评估工具证实了这 一点。
官方博客:https://www.mosaicml.com/blog/long-context-mpt-7b-8k
微软启动“AI奥德赛”项目,助力印度培训10万开发人员掌握最新AI技术
今日,全球科技巨头微软推出了一项雄心勃勃的人工智能项目,名为“AI奥德赛”(AIOdyssey)。该项目的宗旨是在印度培训10万名开发人员,使他们掌握最新的AI技术和工具,以便在处理重要项目时能够充分发挥人工智能的潜力。0000何小鹏:技术的争鸣定能让用户受益 感谢余承东
最近,国内汽车圈因为AEB(自动紧急制动系统)的技术路线争论,几位大佬们隔空互怼,引发了广泛关注。而今天,小鹏汽车CEO何小鹏发文表示,他相信这种技术的争鸣最终会让用户受益。何小鹏表示,他和余承东一起讨论了技术路线,相信通过OTA(空中下载技术)拓展AEB功能,能够引领智驾科技创新,共赢智能电动汽车新时代。他还感谢余承东的建议和大度,表示有时候误会之后更容易成为好朋友。站长网2023-11-09 11:52:550000强大的AI演示制作器“万兴智演” 3秒完成PPT大纲
万兴智演是一款全面的AI演示制作器,具备强大的功能,旨在帮助用户轻松创建具有影响力的虚拟演示。它的核心功能包括快速AI演示制作、画布编辑和场景安排、AI提升效率、一键呈现和高性价比,使每个人都能够以更智能、更高效的方式表达和分享他们的想法。无论您是在知识共享、培训、商业还是教育领域,万兴智演都能满足您多样化的制作需求,提供出色的演示制作体验。站长网2023-10-20 18:14:330000外媒如何报道GPT-4o,有没有“炸裂”?
今日凌晨,OpenAI宣布推出GPT-4o。该模型是GPT-4型号的更新版本,将向免费客户开放。据介绍,GPT-4o(“o”代表“omni”)。它可以实现文本、音频和图像的任意组合作为输入,并生成文本、音频和图像输出的任意组合。且有诸多惊艳应用:这确实是一项很棒的更新升级,推动了人工智能技术进一步发展。站长网2024-05-15 17:48:450000阿里对口型项目EMO开启内测 可将照片转为唱歌视频
千呼万唤始出来!阿里对口型项目EMO终于开启内测了。它能够将一张简单的照片转化为唱歌视频,为用户提供了一种全新的数字人出镜体验。EMO模型的特点:简便的操作:用户只需提供一张照片和克隆的语音模型,即可定制自己的数字人像。低成本:与Heygen等需要录制长视频和高算力成本的产品相比,EMO模型提供了一种免费且高效的解决方案。站长网2024-04-26 04:10:480000