语音识别（ASR）基础介绍第三篇——经典做法及术语概念-低调大师

语音识别（ASR）基础介绍第三篇——经典做法及术语概念

2019-05-29 1280

上一章介绍了万金油特征MFCC，相当于数据的输入已经确定了。本章尽可能的介绍经典asr做法。其中涉及到的各种概念和思考，了解了之后，和相关专业的人交流，大概就不再迷茫了:D

传统方法也可以按声学模型和语言学模型的方式来划分。

声学模型主要的职责是，把一段音频处理成类似拼音的形式，然后交给语言模型来猜: 能够发这些音的单词，怎么组合起来更常见一些。然后找到最可能的组合，便是asr的结果了。

本章介绍的，其实是下图左侧的部分。

一、术语定义

介绍一个概念前，首先要把它依赖的术语说明白，其实asr领域的术语定义并不复杂，反而非常符合直观感觉。换句话说，定义基本是一眼就明白意思并且觉得没有毛病的样子。

上图右侧是传统模型的大致处理流程。里面用到的术语基本都在左侧介绍了。架构解释了整体的处理逻辑：已知一句话中的一系列单词W ，在MFCC发

微信关注我们

原文链接：https://yq.aliyun.com/articles/704174

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

语音识别（ASR）基础介绍第四篇——当今流行做法与CTC

本篇开始，就进入到了asr当前的流行做法。这里单独提到了CTC算法。这个算法对当前asr使用deep learning的方法有重大影响。总体感觉，写到本篇，工作量反而变得很小。因为进入deep learning时代后，神经网络模型基本都是那么几种，已经不再需要挨个详细介绍。而且看图就能理解的很明白。所以本篇后半部分基本就是贴图了。。:D 一、CTC 在CTC之前，训练语料要配合上一篇中提到的方法，需要人工把音频中每个时间段对应的是哪个音素的信息标注清楚。这个工作量和对人及金钱的需求是巨大的。基本都是百万级别手笔。有个CTC之后，给定一个音频，就只要告诉这个音频说的是什么文本就好了。省掉了对齐的那一步。由此，其重要性可自行判断。关于CTC，感觉与其这里坑坑洼洼的介绍，不如直接参考这篇知乎的文章——https://z

2019-05-30

841

一、中文分词工具（1）Jieba （2）snowNLP分词工具（3）thulac分词工具（4）pynlpir 分词工具（5）StanfordCoreNLP分词工具1.from stanfordcorenlp import StanfordCoreNLP2.with StanfordCoreNLP(r'E:UsersEternal SunPycharmProjects1venvLibstanford-corenlp-full-2018-10-05', lang='zh') as nlp: print("stanfordcorenlp分词：n",nlp.word_tokenize(Chinese))（6）Hanlp分词工具分词结果如下：二、英文分词工具 NLTK：二者之间的区别在于，如果先分句再分词，那么将保留句子的独立性，即生成结果是一个二维列表，而对于直接分词来说，生成的是一个直接的一维列表，结果如下： SpaCy： StanfordCoreNLP：分词结果

2019-05-31

824

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。