中英文语音采集视频教程


2000人中英混读语音采集标注项目_采集实施规范.docx


10000小时中英混读语音采集标注项目

前言

本文档为中英混读项目”实施规范,对语料制作、录音规范、标注规范做了详细说明,请根据具体要求内容进行实施。本项目共需要2000名录音人,每人录制450句。

数据量

1000小时;2000

句数

每人450句,每句4s左右

性别

男女比例1:1

年龄

18~2570%26~4020%>4010%;可上下浮动5%

语言

普通话为主,每句夹杂(大部分在3个或以下英文单词

地域分布

覆盖大方言区,详见下方3.1.4地域分布具体要求

录音环境

相对安静的环境,无回声

录音工具

APP采集

语料

大约需要30万句每句语料可重复3,详见下方具体要求

正确率

句正确率97%

交付内容

采集并标注

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

录音要求

3.1 录音人要求

要求普通话,英文发音准确符合条件的录音人录制语音数据录音人需通过大学英语四级考试

3.1.1发音标准:

发音清楚,避免说话不清、语速过快和有方言等现象。

例如:“我是北京人”发音为“e4(四声)shi4 bei3 jing1 ren2

这里“我”的发音是属于方言式发音。

3.1.2性别比例:

男女比例为1:1。男女比例可以在1:1的基础上浮动5%(控制在45%55%范围内)。

3.1.3年龄比例:

年龄

比例范围

18~25

65%~75%

26~40

15%~25%

>40

5%~15%

3.1.4地域分布

在录音人寻找的时候应控制在比例

方言区

范围

参考城市举例

比例

北方官话

东北、西北、华北、山东、安徽人等省份北方标准普通话,没有口音

哈尔滨、绥化、齐齐哈尔、长春、沈阳、吉林通辽、北京、呼和浩特、赤峰、保定、石家庄、潍坊、天津、青岛、大连、兰州、银川、乌鲁木齐、南阳、郑州、洛阳、临沂、阜阳、亳州、徐州、运城、西安、西宁等

30%

西南官话

中国西南的四川、重庆、贵州、云南等几乎全部的汉语地区以及陕西南部、甘肃南部、广西北部和湖南西北部、南部

重庆、成都、南充、绵阳、武汉、荆州、襄阳、孝感、遵义、贵阳、昆明、桂林、凉山、常德等

20%

吴语

江浙沪等省份

上海、温州、杭州、台州、宁波、金华、苏州等

10%

粤语

广东广西香港澳门等省份

广州、深圳、东莞、佛山、南宁、玉林、香港、澳门等

10%

闽语

福建、海南、台湾、广东等省份

泉州、福州、厦门、海口、三亚、万宁、台北、高雄、台中等

10%

湘语

湖南省

长沙、衡阳、邵阳、岳阳等

10%

赣语

江西、安徽、湖北等省份

上饶西部、宜春、南昌、吉安等

10%

 

 

 

控制在比例范围内浮动

注意事项

1)口齿清楚,态度认真,避免说话结巴、大舌头、嗓音嘶哑等病理性发音的人。

2)参加录音的人必须事先了解录音要求(录音方法录音环境、朗读要求合格指标)。

3)每人只能录制一份该项目录音。如出现一人录制多份数据现象取消相应报酬。

4)录制人员对录音人的录音号段做好分配,避免号段重复使用。

3.3录音环境

相对安静的录音环境,不能有其他人说话的声音其他噪音无回音。

避免在空旷的场地采集例如:教室、礼堂、厕所、酒店大厅等)

周边噪音关联事项

1)录音人外其他人的声音不采用。如有第二说话人的声音算无效。

2)其他噪音不采用例如:摔东西的声音、喝水声、笑声、翻书的声音、音乐、咳嗽声、车声等。

3.5录音人录音

1普通话为主,每句夹杂数个(大部分在1-2个)英文单词录制完450

2)自然的复述方式,自然流利清晰,禁止压低嗓子录音禁止用耳语方式录音;禁止夸张语气,笑着说话。

3)录音人严禁刻意变声、模仿说话方式

4)说话人语速适中,吐字清楚不能每个字一停顿的说,尽量避免结巴。

5)手机离说话人嘴边距离在20-25厘米为宜。避免喷麦、和耳机采集的情况

6)禁止在没有朗读完毕前抢停,读错字、咳嗽、偶然噪音现象应暂停录制,做准备后重新录制。

7)录音时,尽量以提供的原始句子为准。如果遇到不通顺或错字等影响正常朗读的句子,朗读时可稍作修改。

8)禁止一人多号,录制多个任务。450必须由一录音人完成。

9)朗读应为普通话方式,口音应为当地人自然发音习惯,不要讲方言。

3.6录音合格指标

数据采集完毕,项目负责人员要认真判断数据质量是否达到合格要求,并提醒录音人及时修改,如不满足下指标均按照不合格处理。

相关指标

具体说明

中文普通话夹杂英文

如方言口音较重或发音不清晰数据算无效

450

不够450句算无效

每一句朗读完整

抢停、或开始录制后不发音句子录制不完整的情况算无效

环境安静

过大噪音、有第二说话人、回音等算无效

不同设备硬件问题,降噪处理的方式统一。如果噪音过大也算无效,但是电流声等出现,如果不影响正常声音可算合格,相反有明显算为无效处理。

录音人信息真实有效

录制填写的录音人信息完整、真实相反无效。例如信息填写男、25,实际35女、25

一人录制450

<p style=";text-align:c

推荐文章

华语广源语音数据标注规范有视频教程
中文校对语音标注规范优化版 1、 登录平台使用说明操作系统: 操作系统是 XP以上系统都可以。浏览器:   请使用360浏览器IE浏览器、搜狗浏览器 步骤:(1)打开 文本,进行浏览器相关设置(2) 登录网址:   http://182.48.116.149:8891(3) 输入用户名及密码登陆后,先安装控件,请点击vs2008运行库。(注意安全卫士先退出)    (4) 点击“标注中”查看任务     含新任务和被打回任务(5) 在任务列表中,点击tagging,进入标注页面,下载安装控件进行标注 使用说明:1) 做完一句,直接点击 “下一句”, 系统自动保存,做完最后一句,点击“保存”按钮。2) 临时有事,或系统突然中断,重新登录后,系统将自动跳转到上次标注的位置;3) 当前账号标注完成后,可以点击“上一句”和“下一句”,对标注结果进行检查,确认没有问题后,点击提交验收;注意:提交验收后将不能再更改。4) 每人有一次修改机会,共可提交2次。 (5) 在任务统计中,查看验收结果 快捷键:键盘上的   ,可播放选中部分的声音。键盘上的      和       可实现上一句和下一句的切换。 2、标注规范 ——共3项(文本、无效、性别)  注: 文本正确率:95%     其它(无效+性别)正确率:95% 注:一定不要多字、漏字!!2.1性别类别分类定义男性别女童声童声指小孩非常稚嫩的声音,大概是在5岁以下的范围。大孩子的声音归到男女。其他没有人声,或者男女混声的统一规为其他 注:女生之间的对话性别是女,男生同理;只有男女相混的对话是其他2.2判断是否为无效语音无效:1、主体人声音的前面、或后面、或中间:有一段安静或噪声等非人声 ,长度在2秒以上(宽条是0.3秒)。【注意整句无人声的不是无效】2、声音是转格式转错的。无效语音,直接打勾,文本不用修改。3.全英文的句子听不懂标无效有效:其它都是有效 2.3修改文本标注文本,目的是把耳朵听到的“普通话或带口音的普通话”标成普通话文本,严重听不懂的“方言”,可标注#2.3.1标注#的情况(1)听不懂、听不清的词或方言标注#(2)英语语句中,听懂的单词标注出来,听不懂的标注#(3)除英语外其他国语言标#,发音如“萨瓦迪卡”,“阿尼哈塞呦”等必须标#(4)粤语标注#(5)噪音标注#(6)遇到拼音标注#,如“阿啵呲嘚”等拼音(7)整句无人声,只有噪音,不超过2S的标#,如一个人整句咳嗽声 注:#可以代表一个字不清楚或者几个字不清楚;一句话中可以出现最多两个#,但不能 同时  ##  这种形式出现;最多可以 #文本# 这种形式出现;2.3.2姓名问题(1)姓:必须标注正确,确定是有这个姓(2)名字:名字可以打同音字 2.3.3地名问题(1)省市等较大地名必须查清楚,不能出现错字:如浙江省无锡宜兴市 (2)较小的地名,如村镇以及道路、小区等可标注同音字。 2.3.4数字问题(1)听到的阿拉伯数字写成汉字,如“一二三四五”或“幺二三四五” 2.3.5儿化音问题(1)带儿话音的,可以写出“(儿)”字,并且加括号;或者直接不打儿化音,皆可。例如:我得了5分儿,文本要写成:我得了五分(儿)/我得了五分注意:不是儿化的不用加,如女儿,婴儿等不是儿话,就不能加在“儿”字上加括号。 2.3.6语气词问题(1)注意口语的字:口语中,结结巴巴说出的,要写出对应接接巴巴声音的字。 (2)口语中,“嗯”、“哦”、“啊””等,要准确对应文本。例:声音“呀”,不能写成:“啊” 2.3.7英语相关问题(1)单词:英语单词,整个单词要小写。如“happy” (2)字母:说字母的写成字母,要写成大写。如“A  B  C  ”。注意:QQ、MSN,是字母发音,要写成大写。 注:英文单词发的不标准,如能听出是哪个单词,就写单词。整句都是英文句子的情况:l 一句话中发音不清楚的单词,标#,发音清楚的单词必须写出单词l 整句英文都听不清楚时,标为无效,不要整句标为#。l 英文用中文谐音写出来的,算错。如:black 写成 布莱克 算错l 一些地名,人名按英文读的,需要写英文,如:I am gonging to shanghai  不能写成“上海”l 其他国语言,发音如“萨瓦迪卡”,“阿尼哈塞呦”等必须标#   2.3.8混音问题混音包括3类:1、当前电话通话的两个人同时说话,相混2、当前人声与较亮或尖锐的音乐声(如铃声、汽车喇叭)相混 混音部分的标注方法:(1)如果非主体人插话不影响对主体人说话的理解,标注员可以听出主体人说话的字,则要求写字。(不要出现一个音对应两个字)例如:非主体人插入的话,音量小、字数少,可忽略当成没听见。 (2)如果非主体人插话,造成标注员已听不出主体人混音部分的字,则要求混音部分标#。 例如:非主体人插入的话,由于音量过大相混在一起,听不清主体的话,混的部分写#。 (3)如果音乐声相混,不影响对主体人说话的理解,标注员可以听出主体人说话的字,则要求写字。如果音乐声相混,造成标注员已听不出主体人混音部分的字,则要求混音部分标#。3:增加#的情况l 人声中出现突然间的大噪音且与人声不相混,包括铃声、叮声、咳嗽、扑话筒、有大的音乐背景等,写1个#。l 人声前边或后面出现一片乱乱的小声说话、持续的背景噪音,写#和不写#都可以。注意:安静的静音处,不能写#。  2.3.9 标注页面蓝条与黄条使用 蓝条和黄条的功能有3个:(1)尺子,表示0.3秒,可以用于量取2秒判断无效。(2)选中功能。选中的是播放蓝条最左端到黄条最右端的声音。当语速特别快时,建议分段选中去听,写下文本,正确率会提高。(3)确定#在哪儿出现。   标准普通话与带口音的普通话对照表:类别定义特例举例说明无口音拼音、声调都正确轻口音拼音对,声调不对n和l不分;n和ng不分;z/c/s和zh/ch/sh不分属于轻口音那个,发音:la4 ge5(标准na4 ge5 )电信,发音:dian4 xing4(标准dian4 xin4)平时,发音:pin2 shi2(标准ping2 shi2)政治,发音:zeng4 zi4(标准zheng4 zhi4)刚才,发音:gang1 chai2(标准gang1 cai2)重口音拼音不对(n和l不分;n和ng不分;z/c/s和zh/ch/sh不分)除外湖南,发音是 fu2 nan2(标准hu2 nan2)歌曲,发音是guo1 qu3(标准ge1 qu3) 

热门文章

滴滴语音标注规则要求及视频教程
一、标注环境1. 请使用谷歌浏览器进行标注。2.标注平台地址:http://label.xiaojukeji.com/labelerTaskList二、标注内容1. 语音有效性标注无效语音请在有效性一项选择“无效”,并在标注文本一项标注大写字母“NULL”。有效语音请在有效性一项选择“有效”。当语音出现下列任意一种情况,即可标注为无效语音:1) 说话人声音极小,小到几乎听不到。2) 整段语音均为静音。3) 整段语音均为噪声、音乐声、导航音、广播等。4) 整段语音只有一个字,或是同一个字重复出现。如:“嗯”、“对”、“对对对对”、“啊”、“喂”、“拜拜”、“谢谢”、“好好好”、“OKOK”等。(注意:“哇噻”属于特例,单独出现时也是无效的。)5) 背景噪声大于说话人声音,或噪声与说话人声音几乎一样大。6) 整句都是方言、外语。方言是指发音与普通话区别较大的地方话,如:粤语、上海话等。7) 语音中出现地点、地名、街道名等方位词,但是地图中搜索不到。8) 语音中有大于等于两个人说话,除主说话人以外,其余人的声音清晰可辨。9) 语音中有大于等于3个字听不清楚。 2. 语音文本标注1) 语音文本内容将说话内容写成文字。要求转写的文本内容必须和听到的语音完全一致,不能多字、少字。a) 除空格、占位符号、以外,标注文本不允许使用标点符号,不允许换行。b) 说话人犹豫、口吃导致出现重复的字也要标注出来,重复了几次就标记几个。如发音为:我是北北京人;“北”字有重复现象。转写文本应为:我是北北京人c) 儿化音不需要标注出“儿”字。如发音为:我在/zher4/。转写文本应为:我在这d) 语音中提及地名、街道名、车牌号等内容,转写时需符合日常习惯。选用“路”、“街道”、“门”、“座”、“桥”等地名常用字以及“京”、“津”、“冀”等车牌号常用字。e) 语音中提及地名、街道名、店铺名、专有名词,需要准确转写。可根据读音在地图中查找,确实存在该地点则进行准确标注,搜不到则无效;f) 语音中确实听不清楚的个别单字,用占位符号【~】标记。一组【~】符号代表一个字。在整段语音中,最多只能有两组【~】符号。若有三个字或更多听不清楚,则标注为无效。(见“语音有效性标注”第8条)g) 语音中不涉及地名、专名的部分,若发音清晰但文字不确定,可以用同音字标注,要求标注用字的声韵调与实际发音完全一致。如发音为:我姓/zhang1/。标注成“我姓张”或“我姓章”都算正确。h) 数字要写成汉字形式,注意区分“一”和“幺”、“二”和“两”,按实际读音写。i) 英文字母要转写成大写字母。j) 音频中说话人清楚说出的语气词,如“呃、啊、嗯、哦、唉、呐、呢”等,要按照正确发音进行转写。语气词除了“了、不”没有口字旁,其他基本上都有口字旁。注意:语气词“唉”、“诶”不分的,统一用“唉”。 3.语言情况标注1)语音中全部内容均为中文,请选择“中文”。2)只要语音中含有英文,不论是单个字母还是单词、不论出现的数量有多少,都需要选择“英文”并且字母全部大写。1、遇到英文单词和英文字母都需要用英文大写形式表现。例如:SORRY SORRY我现在在阜成路麻烦你掉个头2、单词与单词之间加空格 。例如:我把我的APPLE SEVEN PLUS落在了车上麻烦师傅还给我一下3、字母与字母之间加空格。例如:我下了好几回这个A P P了但是怎么安装都是失败的请问客服我该怎么办4、英文单词或者英文字母与汉字之间不需要空格。例如:我的车牌号的京A三六七八5、特殊字:对于OK这一类常用词,默认为一个单词,尽管是拼读成字母发音的。对于无从适配上述规则的及时与我们沟通 4. 说话人性别标注按说话人的音色实际情况进行标注。若无法明确区分男女,不论是成人还是儿童,都标注为“女”。三、标注常见问题总结1. 短句如何判断有效性?答:短句只要有大于或等于两个不重复的音节,即为有效。例如“嗯好的”、“明白”、“可以”等。 2. 有明显口音,但能听懂,需要标注吗?答:口音但不影响理解的,音频中个别几个字的方言可以使用同音字标注。听不清音节的方言也无法使用同音字标注的,可以使用【~】,大于或等于三个字需使用【~】符号的情况下。参照“语音有效性标注”第8条规则,标记为无效。 3. 标注时有的口音能听懂,是按听的音来标注还是按普通话来标注,标注需要符合现实逻辑吗?答:一般情况下口音按实际发音来标注。以下情况请特别处理:常用词语和专有名词需按现实逻辑标注(如:发音是“现/xian4/生”标为“先生”,“滴滴专/ce1/”标为“滴滴专车”等等) 5. 音频中一串数字如【12531】转写为一二五三一还是吆二五三吆?答:转写的文本要和语音实际读法完全一致。若读为yi1,则写一;读为yao1,则写幺。同理,“二”、“两”、“俩”;“三”、“仨”也需要区别使用。 6. 一段很短的音频中语速过快,有时候听起来像三个字又像两个,是不是都能判断合格?答:短音频且内容无法听清的情况下,标记为无效。长音频中很小的一部分,无法确定内容时,参照“语音文本内容”下f项、【~】符号使用规则进行。 7. 一段音频中语速过快,能听清某些音节但大多部分不能做出准确判断写不出是否可以判断无效?答:判断为无效 8. 一段音频中出现导航仪发出的声音或者只有导航仪的声音算噪音吗?答:整段只有导航音,标记为无效。只有一部分出现导航音的时候,看声音大小,如果与说话人音量接近或者大于说话人声音,标记为无效。 注意:如果一句话里面只说了几个字方言,其他都是带口音的普通话,不要直接标无效,那全方言的字按听到的音来标,比如:说的是上海话gege,就标成“葛个”,而不是标成“那个”。语气词无法转写的可以找同音字或相近音字转写;全方言无效 关于地点、地名、街道名等方位词,这些词我们需要使用地图搜索引擎搜索如果地点、地名、街道名等词语很长且词发音很清晰,但使用地图搜索引擎搜索不到这个地点。即使这句话其他部分可以完整的转写出来,但依旧视为无效。二、关于英文转写原规范为:英文字母要转写成大写字母。        细化:1、遇到英文单词和英文字母都需要用英文大写形式表现。例如:SORRY SORRY我现在在阜成路麻烦你掉个头2、单词与单词之间加空格 。例如:我把我的APPLE SEVEN PLUS落在了车上麻烦师傅还给我一下3、字母与字母之间加空格。例如:我下了好几回这个A P P了但是怎么安装都是失败的请问客服我该怎么办4、英文单词或者英文字母与汉字之间不需要空格。例如:我的车牌号的京A三六七八5、特殊字:对于 OK 这一类常用词,默认为一个单词,尽管是拼读成字母发音的。对于无从适配上述规则的,我们及时向海瑞提出。三、噪音符号这部分,这部分依旧不用添加。 四、关于标普、方普、方言如何转写    1、标普:就是普通话,我们是一定要转写的。    2、方普:就是方言普通话,例如广州人说普通话,上海人说普通话,天津人说普通话等等,这些是需要转写的。只是他们在说普通话的时候会有一些口音。例如发音说:我现在湖南(fu2声 lan2声)长沙市中心你来接我一下     他说的是“fu lan”我们正常书写成“湖南”即可。    3、方言:直接视为无效即可,例如:粤语、上海话、江苏话等等。