%A 唐亮, 李倩, 许洪波, 易绵竹 %T 基于多策略过滤的汉日多词短语抽取和对齐 %0 Journal Article %D 2015 %J 《山东大学学报(理学版)》 %R 10.6040/j.issn.1671-9352.3.2014.016 %P 21-28 %V 50 %N 09 %U {http://lxbwk.njournal.sdu.edu.cn/CN/abstract/article_1727.shtml} %8 2015-09-20 %X 在跨语言文本分析任务中,多词短语比单个词汇歧义小,语义表达更加准确,有助于提高文本理解的准确性。现有方法主要关注单个词的跨语言对齐。将多词短语抽取和跨语言对齐相融合,提出了一种基于多策略过滤的汉日多词短语抽取和对齐的方法。首先从一个语种出发,通过重复串、左右邻接熵、内部关联度、多词嵌套、停用词等方法提取并过滤得到具备完整语义的多词短语,然后利用平行语料库计算汉日多词短语的相似度,实现跨语言对齐。在整个过程中可结合日语语言规则与特点,根据语料规模、相关领域对过滤阈值进行动态调整,提高了多词短语的领域适用性。实验结果表明,该方法可有效抽取汉日多词短语并进行准确对齐,以多词短语为对齐单元,语义表达更完整,实用价值更大。