您现在的位置是:首页 > 文章详情

ideaseg 1.1 发布,基于 NLP 的中文分词器

日期:2023-10-10点击:69

ideaseg 1.1 刚刚发布,该版本主要增加了支持多语种混合内容的分词功能,ideaseg 分词器能识别文本内容中存在的不同语言的内容,分别使用不同的分词器进行处理,提升分词的准确度。

使用方法:

 POST _analyze { "analyzer": "ideaseg_multilang", "text": "你好我是中国人,,,,,,,дравствуйте я китаец,Hello word girls,早上好" } 

你可以通过 https://gitee.com/indexea/ideaseg/tree/v1.1/ 获取该版本源码进行构建。

ideaseg 是 Indexea 推出的一个基于最新的 HanLP 自然语言处理工具包实现的中文分词器, 包含了最新的模型数据,同时移除了 HanLP 所包含的非商业友好许可的 NeuralNetworkParser 相关代码和数据。

HanLP 相比其他诸如 IK、jcseg 等分词器而言,在分词的准确率上有巨大的提升,但速度上有所牺牲。 通过对 HanLP 进行优化配置,ideaseg 在准确度和分词速度上取得了最佳的平衡。

详细的介绍和使用方法请看 https://gitee.com/indexea/ideaseg 

原文链接:https://www.oschina.net/news/261160/ideaseg-1-1-released
关注公众号

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。

持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

转载内容版权归作者及来源网站所有,本站原创内容转载请注明来源。

文章评论

共有0条评论来说两句吧...

文章二维码

扫描即可查看该文章

点击排行

推荐阅读

最新文章