语篇构造标注研究的综述.docx
《语篇构造标注研究的综述.docx》由会员分享,可在线阅读,更多相关《语篇构造标注研究的综述.docx(11页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、语篇构造标注研究的综述语篇构造标注研究的综述论文关键词:修辞构造理论篇章构造标注论文摘要:语篇构造标注起步较晚,但以修辞构造理论(RST)为指导的篇章修辞构造标注近期获得了令人瞩目的成绩。目前,已经建成并公布的篇章构造标注语料库是由美国南加州大学信息科学学院的一个课题小组完成的,由385篇文章组成,是一个大规模、高质量、高一致性的带多层语言学标注信息的参照篇章语料库。语料库建设的主要成就为:确立了怎样将语篇切分为基本语篇单位的理论,扩展了修辞关系集,为RST理论的运用提供了广阔的前景。本文综述该语料库建设的研究成果。0.概述随着计算机技术的普及和发展,语料为机器可读成为语料库建设的最基本的要求
2、之一。要到达语料机读化这一目的,关键在于语料的标注。所谓标注,就是对语料库中的原始语料进行加工,把各种表示语言特征的附码标注在相应的语言成分上,以便计算机的识读。语料标注的类型主要包括语篇背景信息、词性、词形、句法分析、语义、语篇构造等。从当前的研究现状来看,固然语篇构造标注起步较晚,但以修辞构造理论(RST)为指导的篇章修辞构造标注近期获得了令人瞩目的成绩。目前,已经建成并已公布的篇章构造标注语料库是由美国南加州大学信息科学学院的一个课题小组完成的,由385篇文章组成,是一个大规模、高质量、高一致性的带多层语言学标注信息的参照篇章语料库。在这基础上研究小组还进行了自动篇章标注算法、自动文摘、
3、机器翻译等详细应用工程方面的研究。该参照篇章语料库的建成不但为篇章构造标注建立了理论体系,而且为语篇构造的应用研究开拓了新的领域。本文将综述该参照篇章语料库建设的研究成果。1.理论支撑的建立根据Carlson(2001)的介绍,用于话语分析的理论有很多,如Groz和Sidner(1986)Mann和Thompson(1987)等都提出了本人的篇章分析理论,但这些理论主要用于单个的文本分析,往往着眼于语篇的某一个方面,如指代关系、语篇的风格、语篇的多维性以及某一理论在语篇中的体现等,很少被用于大规模的语料分析或语料标注。在建立参照语料库时,Carlson(2001)等研究者将Mann和Thomp
4、son(1987)提出的修辞构造理论(RST)用于大批量的语篇标注和语篇分析。他们以为用修辞构造理论(RST)对语篇进行标注有三点优势:能够同时捕捉到特定文本的交际意图、语义信息和文本本身的特征;先前的研究表明该理论能够使不同的标注者在标注不同的文本时到达一定的统一;用该理论标注的语篇树形图对构建自然语篇生成系统、自动文摘系统、文本测评系统起着关键的作用,可以以用来加强机器翻译的自然性。参照篇章语料库的建成确立了篇章构造标注的理论基础。2.基本语篇单位确实定语篇构造标注的另一成就是确定了英语基本语篇单位。在确定基本语篇单位时,不同的研究者往往运用不同的理论。Givon(1983)以为从句应该成
5、为语篇的基本单位,Sacks(1974)以为谈话的话轮应该成为语篇的基本单位,Polanyi(1988)坚持语篇应该以自然句为切分单位,Grosz和Sindner(1986)以为语篇的基本单位应该从语篇的上下文中获取,它是由一定的符号所反映的信息载体,能反映事物的单个状态或部分状态,最有影响的修辞构造理论以为从句应该是语篇的基本单位,不管从句有没有语法标记或词汇标记。然而,在详细标注时,Marcu等研究者对基本语篇单位有了新的规定:所有有词汇或句法标记的起状语作用的从句都属于基本语篇单位,包括起状语作用的非谓语动词词组;充当主语、宾语、补语的从句不属于基本语篇单位;定语从句、后置的名词修饰短语
6、或将其他基本语篇单位割裂开的从句或非谓语动词短语为内置语篇单位;除此而外,还有一定数量的有明显语篇标记的短语作为基本语篇单位,如由inspiteof(尽管),accordingto(根据)等引导的短语。Marcu的切分方法综合了Grosz和Sindner(1986)和Mann(1987)和Thompson(1987)的理论,在确定基本语篇单位时考虑到词汇、句法、语义和在句中的位置等因素。3.修辞关系的扩展当初,Mann和Thompson(1987)提出修辞构造理论时只给出20多种修辞关系,但他们明确指出这是一个开放关系集,既然是开放性的,就意味着读者在给定话语的内部能够定义出其他的关系类型。M
7、arcu(2000)根据标注的语料库总结出53种单层核心关系和25种多层核心关系,78种定义关系又分成16个组别,每组都具有一样的修辞功能。就好像当初的定义关系集一样,这些关系覆盖了基本语篇单位、语段乃至整个语篇。通过这些关系,不同层级的语言片段被连接起来,构成一定的抽象形式。4.标注标准和方法的制定为了建立高质量的前后一致的标注标准和方法,Carlson(2001)等研究者采用人工标注的方法。他们所选用的标注者都是有过标注经历的、从事语篇分析和新闻报道的专业人员。在正式标注之前,他们都接受专门的语篇构造标注培训,培训包括3个阶段。在第一阶段,向标注者介绍修辞构造理论和语篇分析工具。在培训的第
8、二阶段,标注者开场探索语篇构造的特征。在培训的最后一个阶段,标注小组谋求在构建语篇总构造图时保持一致,尽量减少分歧。最终,标注小组研制出两个基本策略用于文献分析并建立相关的语篇构造图。策略之一是对文本的直接分析,能够在页边空白处标出记号,可以以将文献切分成一定的语段并标出记号,根据这些标注建立语篇构造图。以这种方式建立树型构造图,标注者必须预测到随后的语篇构造。然而,其后语段的修辞关系,尤其是较大的语段,可能不是太明显,这就是为什么这一标注策略更适用于短篇文献的标注。另一策略是将文本分析与建立语篇构造两项任务同时进行,很可能是成块地标注而不是循序渐进地一步一步地增加。以这种策略进行标注,标注者
9、一次能够切分很多语篇单位,并为每个自然句建立构造图,然后将相邻的自然句连接起来,构成较大的语段构造树。最终的语篇构造树是通过连接语篇构造中主要语块而建成的。5.标注质量的检验标注质量的控制是通过标注者对标注结果的反复修改和局部随机的自动穿插核实来实现的。为了确保标注语料库的质量,研究小组采取了很多措施,这些措施主要涉及到两个方面,即检验语篇构造树的效度和保持标注者内部的一致性。5.1效度检验效度检验从两个方面进行,即句法和语义。句法检验确保每棵树只要一个根结,并将树与文献进行比照以防句子或语段被遗漏。语义检验主要是关系到核心语段的指派、修辞关系的选择以及语篇构造树的层次。为了保证检验质量,研究
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 构造 标注 研究 综述
限制150内