文档名:基于众包标注的语文教材句子难易度评估研究
该文提出了一种基于成对比较的众包标注方法,该方法可以通过非专业人士的简单判断获取标准统一的句子难度标注结果.基于该方法,构建了基于语文教材的汉语句子难度语料库.面向单句绝对难度评估和句对相对难度评估两项基本的句子难易度评估任务,使用机器学习方法训练汉语句子难度评估模型,并进一步探讨了不同层面语言特征对模型性能的影响.实验结果显示,基于机器学习的分类模型可以有效预测句子的绝对难度和相对难度,最高准确率分别为63.37%和67.95%.语言特征可以帮助提升模型的性能,相比于词汇和句法层面的特征,加入汉字层面特征的模型在两项任务上的准确率最高,说明汉字特征对句子难度的预测作用最强.
作者:于东 吴思远 耿朝阳 唐玉玲
作者单位:北京语言大学信息科学学院,北京100083北京语言大学信息科学学院,北京100083;北京语言大学汉语国际教育研究院,北京100083
母体文献:第十八届中国计算语言学大会暨中国中文信息学会2019学术年会论文集
会议名称:第十八届中国计算语言学大会暨中国中文信息学会2019学术年会
会议时间:2019年10月18日
会议地点:昆明
主办单位:中国中文信息学会
语种:chi
分类号:
关键词:文本可读性 句子难易度 自动评估 众包标注 成对比较
在线出版日期:2021年8月24日
基金项目:
相似文献
相关博文
- 文件大小:
- 822.83 KB
- 下载次数:
- 60
-
高速下载
|
|