清华唐杰团队新作:一口气生成2万字,大模型开卷长输出
一口气生成2万字,大模型输出也卷起来了!
清华&智谱AI最新研究,成功让GLM-4、Llama-3.1输出长度都暴增。
相同问题下,输出结果直接从1800字增加到7800字,翻4倍。
要知道,目前大模型的生成长度普遍在2k以下。这对于内容创作、问题回答等都存在影响,可能导致模型回答问题不全面、创造性降低等。
该研究由智谱AI创始人、清华大学教授李涓子和唐杰共同领衔。
论文及代码都已放在GitHub上开源。
有网友已经抢先体验。LongWriter-llama3.1-8b可生成万字长文《罗马帝国衰落史》,在MacBook Pro2018(32GB)上就能运行。
输出内容很准确,可以得A 。
9B模型搞定万字输出
本项研究主要包括3方面工作。
分析文本生成长度限制因素
提出AgentWrite
扩展LLM输出窗口大小
首先,研究人员构建了一个测试工具LongWrite-Ruler。通过测试多个大模型,他们发现所有模型在生成超过2000字的文本时都遇到了困难。
进一步分析用户和大模型的交互日志,研究人员发现只有超过1%的用户请求明确提到要生成超过2000字的文本。
为此,他们改变了模型在监督式微调(SFT)阶段使用的数据集的最大输出长度。
结果发现,模型的最大输出长度与SFT数据集中的最大输出长度呈显著正相关。
所以得出结论,现有模型在输出长度上受限主要是因为SFT数据集中缺少长输出样本。
即使模型在预训练阶段见过更长的序列,但是SFT阶段缺乏长文本样本,还是会影响输出长度。
为了克服这个限制,研究人员提出了AgentWrite。
这是一个基于Agent的pipline。
它允许将超长文本生成任务分解为多个子任务,每个子任务处理其中的一段。
具体流程是AgentWrite先根据用户指令制定出一个详细的写作计划,计划包括每个段落的主要内容点和目标词数。根据计划,AgentWrite依次提示模型生成每个段落的内容。
在AgentWrite基础上,团队利用GPT-4o生成了6000个长输出SFT数据,输出长度在2k到32k词之间,构成了数据集LongWriter-6k。并将这些数据添加到训练过程中。
为了验证方法的有效性,团队还提出了一个LongBench-Write。其中包含了多样化的用户写作指令,输出长度规格分别为0-500词、500-2000词、2000-4000词以及4000词以上。
评估结果显示,使用AgentWrite后模型输出长度明显增加。
通过直接偏好优化(DPO),GLM-4-9B在一众模型中实现了最佳性能。
手速快的网友已经抢先实测。
Reddit上一位网友让LongWriter-llama3.1-8b生成罗马帝国衰败史,整体需要22分钟(与硬件有关),平均每秒生成3.34个token。
生成内容比较公式化,回答不同问题的结构、节奏相似。
无论如何这是个好的开始,带来的提升很明显。
研究团队也表示未来将进一步扩展模型的输出长度和输出质量,同时也会开始研究如何在不牺牲生成质量的情况下提高效率。
参考链接:
https://github.com/THUDM/LongWriter
—完—
英伟达人工智能软件存在安全漏洞 可被操控泄露个人信息
根据一项最新研究显示,英伟达的人工智能软件中的一个功能存在安全限制的漏洞,可以被操控以透露私人信息。英伟达开发了一个名为「NeMoFramework」的系统,允许开发人员使用各种大型语言模型,这些模型是生成式AI产品(如聊天机器人)的核心技术。站长网2023-06-11 22:41:490000邢波团队提出全开源倡议LLM360 让大模型实现真正的透明
要点:LLM360是邢波团队提出的全方位开源倡议,旨在使大型语言模型的训练过程真正透明,包括训练数据、代码、模型检查点和性能指标等全方位开放。LLM360的框架包括训练数据集与处理代码、训练代码与配置、模型检查点以及性能指标,提供了标准以确保更好地在社区中流通与共享,推动人工智能领域的开放合作研究。站长网2023-12-13 22:00:380000技术融合:Automattic将Tumblr博客转战WordPress平台
Automattic公司周三宣布了一项重大决策,将把旗下Tumblr平台的全部5亿个博客迁移至基于WordPress的新后端系统。作为WordPress.com和Tumblr的母公司,Automattic此举意在整合两大平台的技术优势,为用户带来更稳定、功能更丰富的博客体验。站长网2024-08-31 16:11:200000浙大、蚂蚁集团推出MaPa:文本生成超真实3D模型
浙江大学、蚂蚁集团、深圳大学联合推出了创新模型MaPa。与传统纹理方法不同的是,MaPa通过文本能直接生成高分辨率、物理光照、超真实材质的3D模型,可以极大提升游戏、VR、AR、影视等行业的开发效率。研究人员在多个知名平台对MaPa进行了综合测试。结果显示,在无参考图像的情况下MaPa生成的模型材质、分辨率、局部细节,比TEXTure、Text2tex、Fantasia3D等模型的效果更好。站长网2024-06-11 17:20:350001AMD最新驱动程序曝光:锐龙8000系列要来了
快科技11月12日消息,根据相关爆料,最新的AMD芯片组驱动程序通过了WHQL认证,不过该驱动并不适用于当前的锐龙7000系列,而是支持尚未发布的锐龙8000系列。该驱动更新表明,AMD已经完成了其新锐龙8000APU的芯片组驱动程序开发,并且准备好了发布新APU。站长网2023-11-12 15:16:270000