自动文摘

更新时间:2024-05-21 17:37

自动文摘,利用计算机自动地从原始文献中提取文摘,文摘是全面准确地反映某一文献中心内容地简单连贯的短文。

自动文摘

所谓自动文摘就是利用计算机自动地从原始文献中提取文摘,文摘 是全面准确地反映某一文献中心内容地简单连贯的短文。

自动文摘技术主要有机械文摘和理解文摘两种。机械文摘能够适用于非受限域,这符合当前自然语言处理技术面向真实语料、面向实用化的总趋势,但是由于它局限于对文本表层结构地分析,所以经过近40年的发展已接近技术极限,文摘质量很难再有质的飞跃。理解文摘牺牲领域宽度,换取了理解深度,它作为理论探索的价值很高,但实用性较低,在可预见的未来中前景黯淡。

为了适应大规模真实语料的需要,自动文摘应立足于面向非受域,不断提高文摘质量。篇章结构属于语言学范畴,不触及领域知识,因而基于篇章结构的自动文摘方法不受领域的限制。同时篇章结构比语言表层结构深入了一大步,根据篇章结构能够更准确地探测文章的中心内容所在,因而基于篇章结构的自动文摘能够避免机械文摘的许多不足,保证文摘质量。

自动摘录将文本试为句子的线性序列,将句子视为词的线性序列。它通常分4步进行:

(1)计算词的权值;

(2)计算句子的权值;

(3)将原文中的所有句子按权值高低降序排列,权值最高的若干句子被确定为文摘句;

(4)将所有文摘句按照它们在原文中的出现顺序输出。在自动文摘中,计算词权、句权、选择文摘句的依据是文本的6种形式特征:词频、标题、位置、句法结构、线索词和指示性短语

免责声明
隐私政策
用户协议
目录 22
0{{catalogNumber[index]}}. {{item.title}}
{{item.title}}