项目类型:唤醒词数据采集
1. 正样本
7 个唤醒词:嗨小优、嗨苏苏、嗨一驰、嗨凌夜、你好凌夜、你好小优、小优小优。
每个唤醒词录制 9 遍:慢速 3 遍、正常语速 3 遍、快速 3 遍,每次发音间隔约 2 s。
基础数据量:
600 人 × 7 词 × 9 遍 = 37,800 条。
2. 近似词 / 拒识负样本
每人录制 7 个唤醒词对应的近似词,每路 5 条,共 35 条;另外每人补充 4 条污秽/辱骂拒识词。均采用自然正常语速录制,每条间隔约 2 s。
每人共 39 条。
600 人基础数据量:
600 × 39 = 23,400 条。
3. 录音要求
环境尽量安静,建议背景噪声 < 40 dBA;使用手机本机麦克风录制,手机距嘴约 20~30 cm。原始音频要求 48 kHz、PCM WAV,禁止使用 MP3/AAC 等有损压缩格式。正常自然音量录制,不使用 TTS、变声或变速方式伪造真人数据。
4. 人员要求
共 600 名不同真人,说话人不可重复(与上次人员不可重复);尽量覆盖不同性别、年龄段、地区和口音。每人提供唯一 speaker_id,记录性别、年龄段、地区、口音、手机型号等基础信息,不记录姓名。
有无特殊能力要求:无
需求量级:600人
正式项目,招标预热,有语音采集资源的服务商可以直接报名,报名链接:https://test.baidu.com/collection/channelRecruit/detail/rId/2875,报名的服务商进群沟通:13370189



