评测集开放丨中文读唇总动员:CNVSRC 2023 中文连续视觉语音识别挑战赛

news/2024/7/10 22:16:35 标签: 语音识别, 人工智能, 开源, SINGFAKE, CNVSRC

CNVSRC 2023 (Chinese Continuous Visual Speech Recognition Challenge 2023) 是由 NCMMSC 2023 组委会发起,由清华大学、北京邮电大学、海天瑞声、语音之家联合承办的视觉语音识别竞赛。本次竞赛的核心目的是验证当前视觉语音识别 (或称唇语识别) 技术在大词表连续识别场景下的性能。即日起,CNVSRC 2023 组织者发布全部评测集。参赛队伍可从竞赛官网下载。

视觉语音识别

视觉语音识别,也称唇语识别,是一项通过口唇动作来推断发音内容的技术。该技术在公共安全、助老助残、视频验真等领域具有重要应用。当前,唇语识别的研究方兴未艾,虽然在独立词、短语等识别上取得了长足进展,但在大词表连续识别方面仍面临巨大挑战。特别是对于中文而言,由于缺乏相应的数据资源,该领域的研究进展受到了限制。为此,清华大学在2023年发布了CN-CVS数据集[1],成为首个大规模的中文视觉语音识别数据库,为进一步推动大词表连续视觉语音识别 (LVCVSR) 提供了可能。

关于CN-CVS数据集的更多信息,可访问数据库官网:

http://cnceleb.org

为推动这一研究方向的发展,清华大学联合北京邮电大学、海天瑞声和语音之家在  NCMMSC 2023 举办中文连续视觉语音识别挑战赛 (CNVSRC, Chinese Continuous Visual Speech Recognition Challenge)。本次赛事以 CN-CVS 中文视觉语音识别数据库为基础数据,评估在录音室朗读 (Reading) 和网络演讲 (Speech) 两类场景下的 LVCVSR 系统的性能。比赛结果将在 NCMMSC 2023 会议上宣布并颁奖。

赛事简介

 CNVSRC 2023 共设有两个任务:

  • T1:特定说话人视觉语音识别 (Single-speaker VSR) 

  • T2:多个说话人视觉语音识别 (Multi-speaker VSR)

前者侧重于针对某一特定说话人进行大量数据调优后的性能,后者侧重于系统对非特定说话人的基础性能。每个任务根据训练数据不同,又分为固定赛道 (Fixed Track) 和开放赛道 (Open Track)。

固定赛道仅允许使用 CN-CVS 数据集及各任务发布的开发集作为训练集,旨在验证算法的先进性。开放赛道则可以使用任何数据进行训练,旨在验证当前技术能够达到的性能上限。

CNVSRC 2023 时间安排如下:

09月20日   报名系统开放

09月20日   训练集、开发集数据发布

09月20日   基线系统发布

10月10日   测试集数据开放

11月01日   结果提交系统开放

12月01日   结果和系统技术描述提交截止

12月09日   举办 CNVSRC 2023 Workshop,竞赛结果发布

参赛方式

CNVSRC 2023 对所有个人和单位免费开放,并允许参赛者在结果展示中选择匿名。在提交结果的同时,参赛队伍需以论文形式提交系统技术报告。赛事自报名系统开放后,现已有近40余支海内外队伍注册参赛。竞赛报名将持续到11月下旬,欢迎对视觉语音识别技术感兴趣的单位和个人参与。报名可扫如下二维码,或访问竞赛官网 :

http://cnceleb.org/competition

 [1] C. Chen, D. Wang, T.F. Zheng, CN-CVS: A Mandarin Audio-Visual Dataset for Large Vocabulary Continuous Visual to Speech Synthesis, ICASSP, 2023.


http://www.niftyadmin.cn/n/5316094.html

相关文章

【设计模式-02】Strategy策略模式及应用场景

一、参考资料 Java 官方文档 Overview (Java SE 18 & JDK 18)module indexhttps://docs.oracle.com/en/java/javase/18/docs/api/index.html Java中使用到的策略模式 Comparator、comparable Comparator (Java SE 18 & JDK 18)declaration: module: java.base, pa…

ffmpeg解码音频planar模式和packed模式

转载:原文地址: FFmpeg连载4-音频解码-阿里云开发者社区ffmpeg连载系列https://developer.aliyun.com/article/1197520 导读 前面我们介绍了使用FFmpeg解码视频,今天我们使用FFmpeg解码音频。我们的目标将mp4中的音频文件解码成PCM数据&…

vim升级和配置

vim升级和配置 1、背景2、环境说明3、操作3.1 升级VIM3.2 配置VIM3.2.1、编辑vimrc文件3.2.2、安装插件 1、背景 日常工作跟linux系统打交道比较多,目前主要用到的是Cenots7和Ubuntu18这两个版本的linux系统,其中Centos7主要是服务器端,Ubun…

Eureka切换Nacos时发现两个注册中心的解决方法

报错信息如下,意思是发现了两个注册中心 Field autoServiceRegistration in org.springframework.cloud.client.serviceregistry.AutoServiceRegistrationAutoConfiguration required a single bean, but 2 were found: - nacosAutoServiceRegistration: defined…

跟随鼠标3D倾斜

创建一个vanilla-tilt.js文件将一下代码黏贴进去 export var VanillaTilt (function () {use strict;/*** Created by Sergiu Șandor (micku7zu) on 1/27/2017.* Original idea: https://github.com/gijsroge/tilt.js* MIT License.* Version 1.7.2*/class VanillaTilt {cons…

11853 - Paintball (UVA)

题目链接如下: Online Judge 这道题挺可惜,我思路其实就差了一点点没想出来,还是看了uva 11853 paintball(好题)——yhx_yhx. live-CSDN博客 这里的文字部分才最终写出来。 dfs版本代码如下: #include …

hive sql 和 spark sql的区别

Hive SQL 和 Spark SQL 都是用于在大数据环境中处理结构化数据的工具,但它们有一些关键的区别: 底层计算引擎: Hive SQL:Hive 是建立在 Hadoop 生态系统之上的,使用 MapReduce 作为底层计算引擎。因此,它的…

数据结构之单调栈、单调队列

今天学习了单调栈还有单调队列的概念和使用,接下来我将对其定义并配合几道习题进行讲解: 首先先来复习一下栈与队列: 然后我们来看一下单调栈的定义: 单调栈中的元素从栈底到栈顶的元素的大小是按照单调递增或者单调递减的关系进…