Coqui - 聚合AI导航网聚合AI导航网

语音识别

Coqui

Coqui是一个先进的深度学习工具包，非常适合培训和部署stt模型。根据Mozilla公共许可证2.0授权，您可以使用它生成多个转录本，每个转录本都有一个置信度分数。它提供了预先训练的模型以及示例音频文件，您可以使用这些文件来测试引擎并帮助进行进一步的微调。此外，它有非常详细的文档和资源，可以帮助您使用和解决任何出现的问题。

链接直达手机查看

优点：

它提供的STT模型经过高质量数据的高度训练。
模型支持多种语言。
有一个友好的支持社区，您可以在那里提出问题并获得与STT相关的任何细节。
它支持实时转录，延迟极低，以秒计。
开发人员可以根据各种用例自定义模型，从转录到充当语音助手。

缺点：

Coqui已经停止维护STT项目，专注于他们的文本到语音工具包。这意味着您可能需要自己解决任何问题。

相关导航

PaddleSpeech

PaddleSpeech是个开源的语音转文本工具包，可以在Paddlepaddle平台上使用，该工具在Apache 2.0许可下开源。PaddleSpeech是功能最多的工具包之一，能够执行语音识别、语音到文本转换、关键字定位、翻译和音频分类。它的转录质量非常好，赢得了NAACL2022最佳演示奖。

Kaldi

Kaldi是专门为语音识别的研究人员创建的语音识别工具。它是用C++编写的，并在Apache 2.0许可证下发布，这是限制最少的开源许可。与Whisper和DeepSpeech等专注于深度学习的工具不同，Kaldi主要专注于使用老式可靠工具的语音识别模型。这些模型包括隐马尔可夫模型（Hidden Markov Models）、高斯混合模型（Gaussian Mixture Models）和有限状态传感器（Finite State Transducers）。

Athena

Athena是一个基于序列到序列的语音转文本开源引擎，在Apache 2.0开源许可下发布。该工具包适合研究人员和开发人员的端到端语音处理需求。模型可以处理的任务包括：自动语音识别（ASR）、语音合成、语音检测和关键字定位等。所有语言模型都基于TensorFlow实现，使更多开发人员可以访问该工具包。

Whisper

Whisper是Open AI的创意工具，提供了转录和翻译服务。该AI工具于2022年9月发布，是最准确的自动语音识别模型之一。它从市场上的其他工具中脱颖而出，因为它训练了大量的训练数据集：来自互联网的68万小时的音频文件。这种多样化的数据范围提高了该工具的鲁棒性。用Whisper进行转录必须先安装Python或命令行界面。他提供了五种型号的模型，所有型号都具有不同的大小和功能。这些包括微小、基本、小型、中型和大型。模型越大，转录速度越快。尽管如此，你必须要有一个好的CPU和GPU设备，才能最大限度发挥它们的性能

DeepSpeech

Project DeepSearch是Mozilla的一个开源语音转文本引擎。此语音转文本命令和库在Mozilla公共许可证（MPL）下发布。它的模型参考的是百度深度语音研究论文，具有端到端的可训练性，并支持多种语言音频转录。它使用Google的TensorFlow进行训练和实现。

Flashlight ASR

Flashlight ASR是由Facebook AI研究团队设计的开源语音识别工具包。它拥有处理大型数据集的能力，速度和效率非常突出。可以将速度归功于其在语言建模、机器翻译和语音合成中仅使用卷积神经网络。在理想情况下，大多数语音识别引擎使用卷积和递归神经网络来理解和建模语言。然而，递归网络可能需要高计算能力，从而影响引擎的速度。 Flashlight ASR使用C++编译，支持在CPU和GPU上运行。