HanLP用户自定义词典源码分析详解-低调大师

HanLP用户自定义词典源码分析详解

2018-11-01 606

1. 官方文档及参考链接

lÂ 关于词典问题Issue，首先参考：FAQ

lÂ 自定义词典其实是基于规则的分词，它的用法参考这个issue

lÂ 如果有些数量词、字母词需要分词，可参考:P2P和C2C这种词没有分出来，希望加到主词库

lÂ 关于词性标注：可参考词性标注

2. 源码解析

分析 com.hankcs.demo包下的DemoCustomDictionary.java 基于自定义词典使用标准分词HanLP.segment(text)的大致流程（HanLP版本1.5.3）。首先把自定义词添加到词库中：

CustomDictionary.add("攻城狮");

CustomDictionary.insert("白富美", "nz 1024");//指定了自定义词的词性和词频

CustomDictionary.add("单身狗", "nz 1024 n 1")//一个词可以有多个词性

添加词库的过程包括：

lÂ 若启用了归一化HanLP.Config.Normalization = true;，则会将自定义词进行归一化操作。归一化操作是基于词典文件 CharTable.txt 进行的。

lÂ 判断自定义词是否存在于自定义核心词典中

public static boolean add(String word)

{

if (HanLP.Config.Normalization) word = CharTable.convert(word);

if (contains(word)) return false;//判断DoubleArrayTrie和BinTrie是否已经存在word

return insert(word, null);

}

lÂ 当自定义词不在词典中时，构造一个CoreDictionary.Attribute对象，若添加的自定义词未指定词性和词频，则词性默认为 nz，频次为1。然后试图使用DAT树将该 Attribute对象添加到核心词典中，由于我们自定义的词未存在于核心词典中，因为会添加失败，从而将自定义词放入到BinTrie中。因此，不在核心自定义词典中的词(动态增删的那些词语)是使用BinTrie树保存的。

public static boolean insert(String word, String natureWithFrequency)

{

if (word == null) return false;

if (HanLP.Config.Normalization) word = CharTable.convert(word);

CoreDictionary.Attribute att = natureWithFrequency == null ? new CoreDictionary.Attribute(Nature.nz, 1) : CoreDictionary.Attribute.create(natureWithFrequency);

if (att == null) return false;

if (dat.set(word, att)) return true;

//"攻城狮"是动态加入的词语. 在核心词典中未匹配到,在自定义词典中也未匹配到, 动态增删的词语使用BinTrie保存

if (trie == null) trie = new BinTrie<CoreDictionary.Attribute>();

trie.put(word, att);

return true;

}

将自定义添加到BinTrie树后，接下来是使用分词算法分词了。假设使用的标准分词(viterbi算法来分词)：

List<Vertex> vertexList = viterbi(wordNetAll);

分词具体过程可参考：

分词完成之后，返回的是一个 Vertex 列表。如下图所示：

然后根据是否开启用户自定义词典配置来决定将分词结果与用户添加的自定义词进行合并。默认情况下，config.useCustomDictionary是true，即开启用户自定义词典。

if (config.useCustomDictionary)

{

if (config.indexMode > 0)

combineByCustomDictionary(vertexList, wordNetAll);

else combineByCustomDictionary(vertexList);

}

combineByCustomDictionary(vertexList)由两个过程组成：

lÂ 合并DAT 树中的用户自定义词。这些词是从词典配置文件 CustomDictionary.txt 中加载得到的。

lÂ 合并BinTrie 树中的用户自定义词。这些词是代码中动态添加的：CustomDictionary.add("攻城狮")

//DAT合并

DoubleArrayTrie<CoreDictionary.Attribute> dat = CustomDictionary.dat;

....

// BinTrie合并

if (CustomDictionary.trie != null)//用户通过CustomDictionary.add("攻城狮"); 动态增加了词典

{

....

合并之后的结果如下：

3. 关于用户自定义词典

总结一下，开启自定义分词的流程基本如下：

lÂ HanLP启动时加载词典文件中的CustomDictionary.txt 到DoubleArrayTrie中；用户通过 CustomDictionary.add("攻城狮");将自定义词添加到BinTrie中。

lÂ 使用某一种分词算法分词

lÂ 将分词结果与DoubleArrayTrie或BinTrie中的自定义词进行合并，最终返回输出结果

HanLP作者在HanLP issue783:上面说：词典不等于分词、分词不等于自然语言处理；推荐使用语料而不是词典去修正统计模型。由于分词算法不能将一些“特定领域”的句子分词正确，于是为了纠正分词结果，把想要的分词结果添加到自定义词库中，但最好使用语料来纠正分词的结果。另外，作者还说了在以后版本中不保证继续支持动态添加自定义词典。以上是阅读源码过程中的一些粗浅理解，仅供参考。

文章转载自hapjin 的博客

微信关注我们

原文链接：https://yq.aliyun.com/articles/663232

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

业界分享 | 数据科学家工作融入及面试技巧

本次活动邀请到的嘉宾是王大禹老师，王老师在AI领域有近20年的研究、开发、应用经验，研究方向包括自然语言处理、机器学习、信息检索、知识图谱、用户画像等。曾任美非能源有限公司董事副总裁、微软亚太研发集团产品经理等。现任新浪微博产品专家。王老师从分享分为两个部分，分别是数据科学家工作的落地与融入，结合国际知识和中国实践进行分享；二是数据科学家工作面试技巧。关于数据科学家工作的落地和融入，王老师从四个方面讲解，分别是如何判断一个公司的管理水平，二是在宏观上数据团队提供什么，第三是如何判断公司内部数据团队的地位和发展趋势，第四是在微观上，数据科学家的工作集成。在讲到关于项目管理时，以项目管理为例，计划、执行、评估分为三步，计划有没有列出来，需要向直属领导或者上级领导申报同意后方可执行，执行就是指过程，过程一般就是考验自己的基础知识和技术功底，最后就是评估，一个项目的评估比执行还重要，评估是来反馈自己的工作是否有意义，在具备国际知识的前提下了解中国实践，才能做好本职的工作。另外还谈到数据分析与部门之间的联系，其中最核心的是数据科学，其次是IT架构，最后是领域知识，领域知识是指行业的其他知识...

2018-11-01

598

阅读目录手记实用系列文章：代码封装类：运行效果：手记实用系列文章：1 结巴分词和自然语言处理HanLP处理手记 2 Python中文语料批量预处理手记 3 自然语言处理手记 4 Python中调用自然语言处理工具HanLP手记 5 Python中结巴分词使用手记代码封装类：123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148 !/usr/bin/env python -- ...

2018-11-01

594

资源下载

更多资源

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。