大模型总结摘要靠谱吗?比人类写的流畅,用GPT-4幻觉还少
以后文本摘要总结任务,可以放心交给大模型了。
文本摘要,作为自然语言生成(NLG)中的一项任务,主要用来将一大段长文本压缩为简短的摘要,例如新闻文章、源代码和跨语言文本等多种内容都能用到。
随着大模型(LLM)的出现,传统的在特定数据集上进行微调的方法已经不在适用。
我们不禁会问,LLM 在生成摘要方面效果到底如何?
为了回答这一问题,来自北京大学的研究者在论文《 Summarization is (Almost) Dead 》中进行了深入的探讨。他们使用人类生成的评估数据集评估了 LLM 在各种摘要任务(单条新闻、多条新闻、对话、源代码和跨语言摘要)上的表现。
在对 LLM 生成的摘要、人工撰写的摘要和微调模型生成的摘要进行定量和定性的比较后发现,由 LLM 生成的摘要明显受到人类评估者的青睐。
接着该研究在对过去3年发表在 ACL、EMNLP、NAACL 和 COLING 上的100篇与摘要方法相关的论文进行抽样和检查后,他们发现大约70% 的论文的主要贡献是提出了一种总结摘要方法并在标准数据集上验证了其有效性。因此,本文表示「摘要(几乎)已死( Summarization is (Almost) Dead )」。
尽管如此,研究者表示该领域仍然存在挑战,例如需要更高质量的参考数据集、改进评估方法等还需要解决。
论文地址:https://arxiv.org/pdf/2309.09558.pdf
方法及结果
该研究使用最新的数据来构建数据集,每个数据集由50个样本组成。
例如在执行单条新闻、多条新闻和对话摘要任务时,本文采用的方法模拟了 CNN/DailyMail 、Multi-News 使用的数据集构建方法。对于跨语言摘要任务,其策略与 Zhu 等人提出的方法一致。关于代码摘要任务,本文采用 Bahrami 等人提出的方法。
数据集构建完成之后,接下来就是方法了。具体来说,针对单条新闻任务本文采用 BART 和 T5;多条新闻任务采用 Pegasus 和 BART;T5和 BART 用于对话任务;跨语言任务使用 MT5和 MBART ;源代码任务使用 Codet5。
实验中,该研究聘请人类评估员来比较不同摘要的整体质量。结果如图1所示,LLM 生成的摘要在所有任务中始终优于人工生成的摘要和微调模型生成的摘要。
这就提出了一个问题:为什么 LLM 能够胜过人类撰写的摘要,而传统上人们认为这些摘要是完美无缺的。此外,经过初步的观察表明,LLM 生成的摘要表现出高度的流畅性和连贯性。
本文进一步招募注释者来识别人类和 LLM 生成摘要句子中的幻觉问题,结果如表1所示,与 GPT-4生成的摘要相比,人工书写的摘要表现出相同或更高数量的幻觉。在多条新闻和代码摘要等特定任务中,人工编写的摘要表现出明显较差的事实一致性。
人工撰写的摘要和 GPT-4生成摘要中出现幻觉的比例,如表2所示:
本文还发现人工编写的参考摘要存在这样一个问题,即缺乏流畅性。如图2(a) 所示,人工编写的参考摘要有时存在信息不完整的缺陷。并且在图2(b) 中,一些由人工编写的参考摘要会出现幻觉。
本文还发现微调模型生成的摘要往往具有固定且严格的长度,而 LLM 能够根据输入信息调整输出长度。此外,当输入包含多个主题时,微调模型生成的摘要对主题的覆盖率较低,如图3所示,而 LLM 在生成摘要时能够捕获所有主题:
由图4可得,人类对大模型的偏好分数超过50%,表明人们对其摘要有强烈的偏好,并凸显了 LLM 在文本摘要方面的能力:
荣耀MagicOS 9.0来了个全局智能体,AI手机方向变了
「太可怕了。」在直播间里,赵明向周鸿祎现场展示了真正的技术,找AI智能体整点咖啡。只需要拿起手机说:「点三杯瑞幸的美式咖啡,大杯。」手机内的AI智能体在明确需求后,就会自动阅读理解手机屏幕上的内容,自动操作手机上的美团APP,无需传统语音助手的多轮次对话,你只需要最后点击下单付钱的按钮就行了。视频连线还可以做到AI换脸检测。站长网2024-10-24 09:05:010000美国版「妙鸭」走红,用「虚假」定义新社交
不久前,「妙鸭相机」App的爆火,不仅造成了「拍照行业」的大地震,而且向人们证明,除了对话机器人,AI在图像领域同样能整出各种爆款。同时间的欧美,一款和AI沾边的自拍同样火了起来,不过。和妙鸭「相对真实」的路线相对,这款名为BeFake的完全走向了AI自拍的反面。站长网2023-09-15 09:12:030001高通宣布骁龙X Elite首发合作厂商 小米荣耀等在列
站长之家(ChinaZ.com)10月26日消息:10月26日消息,高通昨天召开的骁龙峰会上公布了首批将搭载骁龙XElite处理器的PC制造商名单,其中包括小米、荣耀、联想等9家知名品牌。高通产品管理高级总监NitinKumar透露,首批合作厂商将在2024年年中起陆续发布搭载骁龙XElite处理器的产品,包括笔记本电脑和二合一产品等。站长网2023-10-26 11:56:580000颠覆性设计!苹果新专利曝光:实现iPhone正面反向无线充电
快科技10月11日消息,现在的电子行业,产品越出越多,功能也是越来越多。但是不管哪种电子产品,使用的时候都要考虑到续航问题。许多手机厂商也考虑到了这个问题,并且给手机增加了反向无线充电的功能。这样在手表、耳机等电池较小的产品没电时,可以通过这个功能来应急。站长网2023-10-11 20:22:300000高通骁龙8 Gen3跑分创新高
今年高通将会发布骁龙8Gen3,按照正常的产品进度,这款旗舰处理器已经完成研发,部分OEM厂商可能已经获得初期的工程样品来进行测试和研发了。最新的消息显示,骁龙8Gen3的超大核已经升级为Cortex-X4,其频率最高可达3.7GHz,同时采用了152的架构设计,并将小核升级为大核。相比前代产品,其性能提升巨大,并且GPU方面也升级至Adreno750。站长网2023-05-13 12:57:320000