2004 Spring NIST Rich Transcription (RT-04S) Development Data(LDC2007S11)是 LDC 为 NIST RT-04S 会议语音识别评测发布的开发数据集,核心用于多通道会议语音的端点检测、说话人分离与识别、丰富转录模型训练 / 调参,含约 28.7 小时会议语音、多通道录音与完整标注转录,2007 年发布

核心基础信息

项目 详情
发布机构 美国语言数据联盟(LDC),数据来源为 NIST RT-04S 评测项目
数据规模 约 28.7 小时会议语音,含 3-7 人多方会议,覆盖 ICSI、NIST、CMU、LDC 等多站点采集场景
语料类型 真实会议语音(含讨论、演示、问答等),适配远场 / 多麦克风声学环境
发布时间 2007 年
配套资源 对应评测集为 LDC2007S12,完整 RT-04S 含开发 + 评测两部分

数据采集与处理

  1. 采集设计:受试者为会议参与者(研究人员 / 学生),真实会议场景自然交流,内容涵盖技术讨论、项目汇报等,保证语料真实性与任务多样性,适配会议语音识别核心需求。
  2. 录音规格:多通道同步采集(含单远场麦克风 SDM、阵列麦克风等),音频为 16kHz 采样、16 位 PCM 格式,适配语音技术标准输入;多站点不同麦克风布局,覆盖远场 / 混响等复杂声学场景,提升模型鲁棒性训练效果

数据格式与内容

  1. 语音数据:WAV 格式多通道音频,16kHz 采样、16 位编码,按站点 / 会议 / 麦克风通道划分文件,适配多通道模型训练与单通道场景适配。
  2. 文本数据:含词级转录文本、说话人 ID、时间戳、静音段标注等,以标注文件存储,支持批量训练与说话人分离任务。
  3. 元数据:含会议站点、麦克风类型 / 位置、说话人信息、采集日志等技术参数,助力数据筛选与声学场景适配,支撑多条件模型优化。
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐