阿里云文档 2025-01-24

如何下载安装、使用说话人识别JavaSDK及代码示例

本文介绍如何使用阿里云智能语音服务提供的Java SDK,包括SDK的安装方法及SDK代码示例。

阿里云文档 2025-01-24

说话人识别SDK接口说明

说话人识别功能可以将说话人所读出的连续数字串语音,与语音库中该用户ID所对应的声音特征进行1:1比对验证,当声音特征比对满足阈值条件时则身份验证成功。

文章 2023-05-13 来自:开发者社区

IEEE SLT 2022论文解读|基于多帧跨通道注意力机制的多说话人语音识别

此外,该论文还提出了一种多层卷积模块以融合多通道输出和一种通道掩码策略以解决训练和推理之间的音频通道数量不匹配的问题。在ICASSP2022 M2MeT竞赛上发布的真实会议场景语料库AliMeeting上进行了相关实验,该多通道模型在Eval和Test集上比单通道模型CER分别相对降低了31.7%和37.0%。此外,在同等的模型参数和训练数据下,本文提出的模型获得的识别性能超越竞赛期间最佳结果,....

IEEE SLT 2022论文解读|基于多帧跨通道注意力机制的多说话人语音识别
文章 2023-05-13 来自:开发者社区

INTERSPEECH 2022论文解读|针对多方会议场景下说话人相关语音识别的对比研究

说话人相关语音识别 (Speaker-Attributed Automatic Speech Recognition,SA-ASR) 是多方会议转录的主要目的,旨在解决“谁说了什么”这个问题。与多说话人语音识别相比,SA-ASR 不仅需要转录重叠语音段内不同说话人的抄本,同时还需要对识别的抄本分配说话人的标签。多方会议场景包含了丰富的讲话风格和复杂的声学条件,需要考虑到重叠语音、数量未知的说话人....

INTERSPEECH 2022论文解读|针对多方会议场景下说话人相关语音识别的对比研究

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

产品推荐