10000小时中英混读语音采集标注项目
本文档为“中英混读项目”实施规范,对语料制作、录音规范、标注规范做了详细说明,请根据具体要求内容进行实施。本项目共需要2000名录音人,每人录制450句。
数据量 | 1000小时;2000人 |
句数 | 每人450句,每句4s左右 |
性别 | 男女比例1:1 |
年龄 | 18~25岁70%,26~40岁20%,>40岁10%;可上下浮动5% |
语言 | 普通话为主,每句夹杂数个(大部分在3个或以下)英文单词 |
地域分布 | 覆盖七大方言区,详见下方3.1.4地域分布具体要求 |
录音环境 | 相对安静的环境,无回声 |
录音工具 | APP采集 |
语料 | 大约需要30万句,每句语料可重复3遍,详见下方具体要求 |
正确率 | 句正确率97% |
交付内容 | 采集并标注 |
3.1 录音人要求
要求说普通话,英文发音准确。符合条件的录音人录制语音数据,录音人需通过大学英语四级考试。
3.1.1发音标准:
发音清楚,避免说话不清、语速过快和有方言等现象。
例如:“我是北京人”发音为“e4(四声)shi4 bei3 jing1 ren2”
这里“我”的发音是属于方言式发音。
3.1.2性别比例:
男女比例为1:1。男女比例可以在1:1的基础上浮动5%(控制在45%到55%范围内)。
3.1.3年龄比例:
年龄段 | 比例范围 |
18~25岁 | 65%~75% |
26~40岁 | 15%~25% |
>40岁 | 5%~15% |
3.1.4地域分布:
在录音人寻找的时候应控制在比例内。
方言区 | 范围 | 参考城市举例 | 比例 |
北方官话 | 东北、西北、华北、山东、安徽人等省份北方标准普通话,没有口音 | 哈尔滨、绥化、齐齐哈尔、长春、沈阳、吉林通辽、北京、呼和浩特、赤峰、保定、石家庄、潍坊、天津、青岛、大连、兰州、银川、乌鲁木齐、南阳、郑州、洛阳、临沂、阜阳、亳州、徐州、运城、西安、西宁等 | 30% |
西南官话 | 中国西南的四川、重庆、贵州、云南等几乎全部的汉语地区以及陕西南部、甘肃南部、广西北部和湖南西北部、南部 | 重庆、成都、南充、绵阳、武汉、荆州、襄阳、孝感、遵义、贵阳、昆明、桂林、凉山、常德等 | 20% |
吴语 | 江浙沪等省份 | 上海、温州、杭州、台州、宁波、金华、苏州等 | 10% |
粤语 | 广东广西香港澳门等省份 | 广州、深圳、东莞、佛山、南宁、玉林、香港、澳门等 | 10% |
闽语 | 福建、海南、台湾、广东等省份 | 泉州、福州、厦门、海口、三亚、万宁、台北、高雄、台中等 | 10% |
湘语 | 湖南省 | 长沙、衡阳、邵阳、岳阳等 | 10% |
赣语 | 江西、安徽、湖北等省份 | 上饶西部、宜春、南昌、吉安等 | 10% |
※控制在比例范围内浮动。
注意事项:
1)口齿清楚,态度认真,避免说话结巴、大舌头、嗓音嘶哑等病理性发音的人。
2)参加录音的人必须事先了解录音要求(录音方法、录音环境、朗读要求、合格指标)。
3)每人只能录制一份该项目录音。如出现一人录制多份数据的现象将取消相应报酬。
4)录制人员对录音人的录音号段做好分配,避免号段重复使用。
3.3录音环境
相对安静的录音环境,不能有其他人说话的声音及其他噪音,无回音。
(避免在空旷的场地采集。例如:教室、礼堂、厕所、酒店大厅等)
周边噪音关联事项:
1)录音人外其他人的声音不采用。如有第二说话人的声音算无效。
2)其他噪音不采用。例如:摔东西的声音、喝水声、笑声、翻书的声音、音乐声、咳嗽声、车声等。
3.5录音人录音
1)普通话为主,每句夹杂数个(大部分在1-2个)英文单词,录制完450句。
2)自然的复述方式,自然流利清晰,禁止压低嗓子录音;禁止用耳语方式录音;禁止夸张语气,笑着说话。
3)录音人严禁刻意变声、模仿等说话方式。
4)说话人语速适中,吐字清楚不能每个字一停顿的说,尽量避免结巴。
5)手机离说话人嘴边距离在20-25厘米为宜。避免喷麦、和耳机采集的情况。
6)禁止在没有朗读完毕前抢停,如读错字、咳嗽、偶然噪音等现象应暂停录制,做准备后重新录制。
7)录音时,尽量以提供的原始句子为准。如果遇到不通顺或错字等影响正常朗读的句子,朗读时可稍作修改。
8)禁止一人多号,录制多个任务。450句必须由同一录音人完成。
9)朗读应为普通话方式,口音应为当地人自然发音习惯,不要讲方言。
3.6录音合格指标
数据采集完毕,项目负责人员要认真判断数据质量是否达到合格要求,并提醒录音人及时修改,如不满足以下指标均按照不合格处理。
相关指标项 | 具体说明 |
中文普通话夹杂英文 | 如方言口音较重或发音不清晰数据算无效 |
450句 | 不够450句算无效 |
每一句都朗读完整 | 抢停、或开始录制后不发音、句子录制不完整的情况算无效 |
环境安静 | 过大噪音、有第二说话人、回音等算无效。 因不同设备硬件问题,降噪处理的方式不统一。如果噪音过大也算无效,但是有电流声等出现,如果不影响正常声音可算合格,相反有明显的算为无效处理。 |
录音人信息真实有效 | 录制前填写的录音人信息完整、真实,相反无效。例如:信息填写男、25,实际是男、35或女、25等。 |
一人录制450句 | <p style=";text-align:c推荐文章爱数语音标注登陆网址babel.magicdatatech.com/processmore/index.php用谷歌浏览器,鼠标拖动截取分段,内容右键,选择符号爱数这个任务非常简单,很好做,需要的看下文档1、需要根据说话人变化切换说话人,角色根据出场前后顺序标注2、根据说话人内容进行转写,不得漏字、错字、多字3、严重方言允许舍弃,带口音的普通话请尽量转写。4、在说话人说话的过程中,如果背景中有噪音,则需标注噪音符号,音乐早已标注MUSIC、其他人声噪音标注NOISE。5、如果两个说话人同时说话的,允许丢弃两个人同时说话的部分,但一个人说话的地方请保留。 (不要断句太散,如果句子中有一个字听不懂的,请联系前后语境,推测出最可能的字,尽量整句标注)一、开始标注语音文件一 时间边界定位:• 用鼠标选中波形,即为要标注的一段时间边界,此时会自动跳出对应的编辑框 图中的红蓝方框即为选中一段需要标注的时间边界。• 听音,在整段电话语音的基础上,根据语义和停顿时间等因素,在音频信号中每一句话的句首和句尾分别添加时间边界。即,一段标注框内,即为一段标注的话。• 每段前后需预留0.3s的空白段,但在没有可预留空白的情况下,不做预留,同理,叠加也不做预留,仅是说话段、并且能有前后留白的地方预留0.3s。二 文件标注:• • 此处主要标注语音文件的一些全局信息,包括说话人性别信息和语种信息(方言区)。标注时请按照实际情况选择。• 关于说话人的选择,客服标注奇数,用户标注偶数;• 如果第三个人的情况:点击“+”号,即可添加。• 编辑框内需要标注的是该句对应的文字• 如果是汉语交谈,则只能用简体汉字。对于语音中的数字部分需根据发音情况转换为对应的汉字,例如“27”→“二十七”;“我的电话是2381832”→“我的电话是二三八幺八三二(与发音相同)”。• 编辑框内正常语音的标注• 如果此语段为某一个人的汉语对话语音,请在标注时间边界后,选择对应的1或者2,编辑框内输入相应的文本。• 如果此语段为两个人交叉语音,关于重叠(交叉)的语音,即对于某个人的一句话未完,另一个人的一句话已经开始的情况:请不要标注该语段,空置就行。• 在整个语音中,需根据说话人的变换来增加时间边界(不同说话人分段标注)。• 如果同一说话人说话时间较长,则应根据其语义来增加时间边界,每个时间段的长度最多不能超过8s,但断句也不要太散太短。根据标注经验,每个自然语言段平均在5-6秒左右即可。• 单字或者两个字的叠加(如:好,嗯,行,好的),声音较小,不影响主要说话人内容,那么可以不标叠加,直接写主要说话人的内容就行了。在说话人说话的过程中,如果背景中有噪音,则需标注噪音符号,音乐早已标注MUSIC、其他人声噪音标注NOISE。如:我们是最好的朋友NOISE在背景是人发出的噪音的情况标注NOISE,整条有电流声或非人声的底噪不用加NOISE 比如说话的同时有另一个人咳嗽声和语音重叠了就标NOISE如果主说话人的声音重叠了舍弃 • 英文:(英文都是小写)只有符号英文是大写!【单词】对于语音中简单的英文单词,在能听懂的情况下,直接标出即可。例如:“网址是三w点sina点com”;“二三八幺八三二at qq点com”(不要写这个@)“请以井号键结束”;(不要写这个#) 【字母】每个字母中间用空格隔开。例如:单词读音,g o o d则表示字母读音;例如:我的编号是f m s幺三二;• 语气词除了“诶”其他的语气词都是带口字旁的汉字标注。如果发音是表示应答的“嗯”,统一都用“嗯”,不要用“恩”或者“厄”。比如哦,啊,诶等.除[G]表示整句舍弃外,其他无任何符号,遇到噪音,直接空置,不标注即可。如遇到系统播报音,请用此方式标注,欢迎致电中国保险TTS标注10分钟请点击一次临时保存,并刷新网页!如果停顿有0.5秒了,前后语音就要断开截取关于噪音:1、 一个人说了一句话,是连续没有停顿的,但一半有需要标噪音符号的一半不需要标噪音符号的,合一条截取且标噪音符号2、 若突发噪音与语音很近的话,不能截取突发噪音,从突发噪音后面开始截取,如果是底噪的话就可以正常前后预留了,如下图,红框里的是一个咳嗽声,这种情况下就不要0.3秒的预留了,咳嗽声切出去 3、 如果主说话人与旁听人员的语音重叠了,主说话的声音很大,旁听人的声音特别小的,就是有人在旁边一直小声的说话这样的当做背景人声,这属于环境背景人声,加NOISE原文件下载magic-talking标注规范-20180321.docx 热门文章一、标注环境1. 请使用谷歌浏览器进行标注。2.标注平台地址:http://label.xiaojukeji.com/labelerTaskList二、标注内容1. 语音有效性标注无效语音请在有效性一项选择“无效”,并在标注文本一项标注大写字母“NULL”。有效语音请在有效性一项选择“有效”。当语音出现下列任意一种情况,即可标注为无效语音:1) 说话人声音极小,小到几乎听不到。2) 整段语音均为静音。3) 整段语音均为噪声、音乐声、导航音、广播等。4) 整段语音只有一个字,或是同一个字重复出现。如:“嗯”、“对”、“对对对对”、“啊”、“喂”、“拜拜”、“谢谢”、“好好好”、“OKOK”等。(注意:“哇噻”属于特例,单独出现时也是无效的。)5) 背景噪声大于说话人声音,或噪声与说话人声音几乎一样大。6) 整句都是方言、外语。方言是指发音与普通话区别较大的地方话,如:粤语、上海话等。7) 语音中出现地点、地名、街道名等方位词,但是地图中搜索不到。8) 语音中有大于等于两个人说话,除主说话人以外,其余人的声音清晰可辨。9) 语音中有大于等于3个字听不清楚。 2. 语音文本标注1) 语音文本内容将说话内容写成文字。要求转写的文本内容必须和听到的语音完全一致,不能多字、少字。a) 除空格、占位符号、以外,标注文本不允许使用标点符号,不允许换行。b) 说话人犹豫、口吃导致出现重复的字也要标注出来,重复了几次就标记几个。如发音为:我是北北京人;“北”字有重复现象。转写文本应为:我是北北京人c) 儿化音不需要标注出“儿”字。如发音为:我在/zher4/。转写文本应为:我在这d) 语音中提及地名、街道名、车牌号等内容,转写时需符合日常习惯。选用“路”、“街道”、“门”、“座”、“桥”等地名常用字以及“京”、“津”、“冀”等车牌号常用字。e) 语音中提及地名、街道名、店铺名、专有名词,需要准确转写。可根据读音在地图中查找,确实存在该地点则进行准确标注,搜不到则无效;f) 语音中确实听不清楚的个别单字,用占位符号【~】标记。一组【~】符号代表一个字。在整段语音中,最多只能有两组【~】符号。若有三个字或更多听不清楚,则标注为无效。(见“语音有效性标注”第8条)g) 语音中不涉及地名、专名的部分,若发音清晰但文字不确定,可以用同音字标注,要求标注用字的声韵调与实际发音完全一致。如发音为:我姓/zhang1/。标注成“我姓张”或“我姓章”都算正确。h) 数字要写成汉字形式,注意区分“一”和“幺”、“二”和“两”,按实际读音写。i) 英文字母要转写成大写字母。j) 音频中说话人清楚说出的语气词,如“呃、啊、嗯、哦、唉、呐、呢”等,要按照正确发音进行转写。语气词除了“了、不”没有口字旁,其他基本上都有口字旁。注意:语气词“唉”、“诶”不分的,统一用“唉”。 3.语言情况标注1)语音中全部内容均为中文,请选择“中文”。2)只要语音中含有英文,不论是单个字母还是单词、不论出现的数量有多少,都需要选择“英文”并且字母全部大写。1、遇到英文单词和英文字母都需要用英文大写形式表现。例如:SORRY SORRY我现在在阜成路麻烦你掉个头2、单词与单词之间加空格 。例如:我把我的APPLE SEVEN PLUS落在了车上麻烦师傅还给我一下3、字母与字母之间加空格。例如:我下了好几回这个A P P了但是怎么安装都是失败的请问客服我该怎么办4、英文单词或者英文字母与汉字之间不需要空格。例如:我的车牌号的京A三六七八5、特殊字:对于OK这一类常用词,默认为一个单词,尽管是拼读成字母发音的。对于无从适配上述规则的及时与我们沟通 4. 说话人性别标注按说话人的音色实际情况进行标注。若无法明确区分男女,不论是成人还是儿童,都标注为“女”。三、标注常见问题总结1. 短句如何判断有效性?答:短句只要有大于或等于两个不重复的音节,即为有效。例如“嗯好的”、“明白”、“可以”等。 2. 有明显口音,但能听懂,需要标注吗?答:口音但不影响理解的,音频中个别几个字的方言可以使用同音字标注。听不清音节的方言也无法使用同音字标注的,可以使用【~】,大于或等于三个字需使用【~】符号的情况下。参照“语音有效性标注”第8条规则,标记为无效。 3. 标注时有的口音能听懂,是按听的音来标注还是按普通话来标注,标注需要符合现实逻辑吗?答:一般情况下口音按实际发音来标注。以下情况请特别处理:常用词语和专有名词需按现实逻辑标注(如:发音是“现/xian4/生”标为“先生”,“滴滴专/ce1/”标为“滴滴专车”等等) 5. 音频中一串数字如【12531】转写为一二五三一还是吆二五三吆?答:转写的文本要和语音实际读法完全一致。若读为yi1,则写一;读为yao1,则写幺。同理,“二”、“两”、“俩”;“三”、“仨”也需要区别使用。 6. 一段很短的音频中语速过快,有时候听起来像三个字又像两个,是不是都能判断合格?答:短音频且内容无法听清的情况下,标记为无效。长音频中很小的一部分,无法确定内容时,参照“语音文本内容”下f项、【~】符号使用规则进行。 7. 一段音频中语速过快,能听清某些音节但大多部分不能做出准确判断写不出是否可以判断无效?答:判断为无效 8. 一段音频中出现导航仪发出的声音或者只有导航仪的声音算噪音吗?答:整段只有导航音,标记为无效。只有一部分出现导航音的时候,看声音大小,如果与说话人音量接近或者大于说话人声音,标记为无效。 注意:如果一句话里面只说了几个字方言,其他都是带口音的普通话,不要直接标无效,那全方言的字按听到的音来标,比如:说的是上海话gege,就标成“葛个”,而不是标成“那个”。语气词无法转写的可以找同音字或相近音字转写;全方言无效 关于地点、地名、街道名等方位词,这些词我们需要使用地图搜索引擎搜索如果地点、地名、街道名等词语很长且词发音很清晰,但使用地图搜索引擎搜索不到这个地点。即使这句话其他部分可以完整的转写出来,但依旧视为无效。二、关于英文转写原规范为:英文字母要转写成大写字母。 细化:1、遇到英文单词和英文字母都需要用英文大写形式表现。例如:SORRY SORRY我现在在阜成路麻烦你掉个头2、单词与单词之间加空格 。例如:我把我的APPLE SEVEN PLUS落在了车上麻烦师傅还给我一下3、字母与字母之间加空格。例如:我下了好几回这个A P P了但是怎么安装都是失败的请问客服我该怎么办4、英文单词或者英文字母与汉字之间不需要空格。例如:我的车牌号的京A三六七八5、特殊字:对于 OK 这一类常用词,默认为一个单词,尽管是拼读成字母发音的。对于无从适配上述规则的,我们及时向海瑞提出。三、噪音符号这部分,这部分依旧不用添加。 四、关于标普、方普、方言如何转写 1、标普:就是普通话,我们是一定要转写的。 2、方普:就是方言普通话,例如广州人说普通话,上海人说普通话,天津人说普通话等等,这些是需要转写的。只是他们在说普通话的时候会有一些口音。例如发音说:我现在湖南(fu2声 lan2声)长沙市中心你来接我一下 他说的是“fu lan”我们正常书写成“湖南”即可。 3、方言:直接视为无效即可,例如:粤语、上海话、江苏话等等。 |