热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

[论文笔记]CrowdsourcingTranslation:ProfessionalQualityfromNon-Professionals(ACL,2011)

Time:4hoursTimespan:Apr15–May3,2012OmarZaidan,ChrisCallison-Burch:CrowdsourcingTra



Time:    4 hours
Timespan: Apr 15 – May 3, 2012
Omar Zaidan, Chris Callison-Burch: Crowdsourcing Translation: Professional Quality from Non-Professionals. ACL 2011: 1220-1229


 


    作者Omar Zaidan是Johns Hopkins University的博士生,主要对NLP感兴趣,专注于text classification and machine translation,编写过一个软件MAISE(Java编写,帮助在mTurk上创建任务、上传文件等)。


下面是主要内容:


1. 本文介绍了一种基于众包的翻译流程,通过redundancy、post edit、rank等手段,来获得质量接近专业水准的译文。


2. (S3) 介绍了整个流程



  • (S3.1) 本文使用的数据集是"Urdu-to-English 2009 NITS Evaluation", 包含1792句Urdu语,每句Urdu语有四句参考翻译(由专业人士提供)。

  • (S3.2) 作者将这些句子放到了mTurks上,任务是获取这些句子的英文翻译,进行了两轮:第一轮的任务是翻译整个文档,每句Urdu语获得了一份翻译;第二轮进行了改进,拆分了文档,每个任务是翻译10句,并且这些待翻译的句子是以图片的形式展示给worker,这一轮每句Urdu语获得了三份翻译。

  • (S3.3) 然后进入Post-editing和Ranking(没找到文中具体描述如何ranking的文字)的步骤,这个步骤的任务也是在mTurk上以任务形式完成,但要求US-based worker才能参与。第一轮获得的翻译被编辑一次,第二轮获得的三份翻译各被编辑三次(不明白为什么要这样区分处理),这样对于一句Urdu语,总共就得到了10份编辑后的翻译和4份初始翻译。


3. 通过(S3)介绍的流程,一份Urdu语获得了14份翻译,而在(S4)中便在介绍如果通过建立恰当的模型以便从这14份中找出最佳的一份。


作者在(S4.1)中介绍了一些features(分为三类):


 


































































类别 Feature名称 描述
Sentence-level Language model features 一种判断句子质量高低的属性,具体不太清楚 (use a 5-gram language model trained on the English Gigaword corpus)
Sentence-level Sentence length features 质量高的句子长度应该适中
Sentence-level Web n-gram match percentage 一种根据n-gram百分比来给句子打分的方法,具体不太清楚(使用了Google N-Gram Database)
Sentence-level Web n-gram geometric average 一种根据n-gram匹配百分比来给句子进行打分的方法,具体不太清楚
Sentence-level Edit rate to other translations edit rate distance from the other translation(使用了TER metric)
Worker-level Aggregate features 该worker所有translation的sentence-level feature值计算而得
Worker-level Language abilities 是否母语,使用年限等
Worker-level Worker location 所在地
Ranking Average rank 根据ranking label而来
Ranking Is-Best percentage 根据ranking label而来
Ranking Is-Better percentage 根据ranking label而来


打分的函数方法是这样定义的:image


其中f(ti,j)是上面定义的feature,w是权重向量, (S4.2)介绍如何调试出较优的权重值(使用了"linear search method of Och")。这个打分方法算是一种多属性决策方法吧,比较容易理解。


4.  其他可关注的信息
(S1)中提到了SMT(Statistical Machine Translation),对于有大量配对语句的语言来说,这种翻译技术会比较有效。
(S2)中提到mTurks上的一个不足之处是不能提供Turkers的个人背景(比如教育背景、母语等信息)。





推荐阅读
  • 解决FCKeditor应用主题后上传问题及优化配置
    本文介绍了在Freetextbox收费后选择FCKeditor作为替代方案时遇到的上传问题及其解决方案。通过调整配置文件和调试工具,最终解决了上传失败的问题,并对相关配置进行了优化。 ... [详细]
  • 网络运维工程师负责确保企业IT基础设施的稳定运行,保障业务连续性和数据安全。他们需要具备多种技能,包括搭建和维护网络环境、监控系统性能、处理突发事件等。本文将探讨网络运维工程师的职业前景及其平均薪酬水平。 ... [详细]
  • 深入理解Tornado模板系统
    本文详细介绍了Tornado框架中模板系统的使用方法。Tornado自带的轻量级、高效且灵活的模板语言位于tornado.template模块,支持嵌入Python代码片段,帮助开发者快速构建动态网页。 ... [详细]
  • PHP 5.2.5 安装与配置指南
    本文详细介绍了 PHP 5.2.5 的安装和配置步骤,帮助开发者解决常见的环境配置问题,特别是上传图片时遇到的错误。通过本教程,您可以顺利搭建并优化 PHP 运行环境。 ... [详细]
  • 本文探讨了如何在 PHP 的 Eloquent ORM 中实现数据表之间的关联查询,并通过具体示例详细解释了如何将关联数据嵌入到查询结果中。这不仅提高了数据查询的效率,还简化了代码逻辑。 ... [详细]
  • PostgreSQL 10 离线安装指南
    本文详细介绍了如何在无法联网的服务器上进行 PostgreSQL 10 的离线安装,并涵盖了从下载安装包到配置远程访问的完整步骤。 ... [详细]
  • 创建项目:Visual Studio Online 入门指南
    本文介绍如何使用微软的 Visual Studio Online(VSO)创建和管理开发项目。作为一款基于云计算的开发平台,VSO 提供了丰富的工具和服务,简化了项目的配置和部署流程。 ... [详细]
  • 本文详细介绍了 Flink 和 YARN 的交互机制。YARN 是 Hadoop 生态系统中的资源管理组件,类似于 Spark on YARN 的配置方式。我们将基于官方文档,深入探讨如何在 YARN 上部署和运行 Flink 任务。 ... [详细]
  • 本文详细介绍了如何使用 Yii2 的 GridView 组件在列表页面实现数据的直接编辑功能。通过具体的代码示例和步骤,帮助开发者快速掌握这一实用技巧。 ... [详细]
  • 如何配置Unturned服务器及其消息设置
    本文详细介绍了Unturned服务器的配置方法和消息设置技巧,帮助用户了解并优化服务器管理。同时,提供了关于云服务资源操作记录、远程登录设置以及文件传输的相关补充信息。 ... [详细]
  • 本文探讨了如何在发布 XenApp 应用时,通过命令行参数实现启动时的参数传递。特别介绍了静态和动态参数传递的方法,并详细解释了 ICA 文件中两种参数传递方式的区别及安全检查机制。 ... [详细]
  • DNN Community 和 Professional 版本的主要差异
    本文详细解析了 DotNetNuke (DNN) 的两种主要版本:Community 和 Professional。通过对比两者的功能和附加组件,帮助用户选择最适合其需求的版本。 ... [详细]
  • 本文介绍了如何使用PHP代码实现微信平台的媒体素材上传功能,详细解释了API接口的使用方法和注意事项,确保文件路径正确以避免常见的错误。 ... [详细]
  • 从零开始构建完整手机站:Vue CLI 3 实战指南(第一部分)
    本系列教程将引导您使用 Vue CLI 3 构建一个功能齐全的移动应用。我们将深入探讨项目中涉及的每一个知识点,并确保这些内容与实际工作中的需求紧密结合。 ... [详细]
  • 帝国CMS多图上传插件详解及使用指南
    本文介绍了一款用于帝国CMS的多图上传插件,该插件通过Flash技术实现批量图片上传功能,显著提升了多图上传效率。文章详细说明了插件的安装、配置和使用方法。 ... [详细]
author-avatar
再体验初体验g_154
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有