ubuntu下使用pycharm调用Hanlp自然语言处理包

2018-11-04 806

首先点击File,选择Settings，在Project 下点击Project Interpreter，并通过点击右边的加号：

搜索JPype,根据python版本选择你需要的JPype版本安装。

之后,在https://github.com/hankcs/HanLP/releases

网站下载hanlp.jar包、模型data包、配置文件hanlp.properties，新建一个文件夹Hanlp，

把hanlp.jar和hanlp.properties放进去：

之后需要再新建一个文件夹hanlp,并将data放进去：

修改Hanlp下的路径为当前data的路径，由于我将data放在/home/javawork/hanlp下，因此：root=/home/javawork/hanlp/

接下来新建一个文件demo_hanlp.py,代码如下：

! /usr/bin/env python2.7

coding=utf-8

from jpype import *

startJVM(getDefaultJVMPath(), "-Djava.class.path=home/javawork/Hanlp/hanlp-1.2.7.jar;home/javawork/Hanlp/", "-Xms1g", "-Xmx1g")

startJVM(getDefaultJVMPath(), "-Djava.class.path=/home/qinghua/javawork/Hanlp/hanlp-1.2.7.jar:/home/qinghua/javawork/Hanlp")
HanLP = JClass('com.hankcs.hanlp.HanLP')

中文分词

print(HanLP.segment('你好，欢迎在Python中调用HanLP的API'))
testCases = [

"商品和服务",
"结婚的和尚未结婚的确实在干扰分词啊",
"买水果然后来世博园最后去世博会"]

for sentence in testCases: print(HanLP.segment(sentence))

命名实体识别与词性标注

NLPTokenizer = JClass('com.hankcs.hanlp.tokenizer.NLPTokenizer')
print(NLPTokenizer.segment('中国科学院计算技术研究所的宗成庆教授正在教授自然语言处理课程'))

关键词提取

document = "水利部水资源司司长陈明忠9月29日在国务院新闻办举行的新闻发布会上透露，" \

       "根据刚刚完成了水资源管理制度的考核，有部分省接近了红线的指标，" \
       "有部分省超过红线的指标。对一些超过红线的地方，陈明忠表示，对一些取用水项目进行区域的限批，" \
       "严格地进行水资源论证和取水许可的批准。"

print(HanLP.extractKeyword(document, 2))

自动摘要

print(HanLP.extractSummary(document, 3))

依存句法分析

print(HanLP.parseDependency("徐先生还具体帮助他确定了把画雄鹰、松鼠和麻雀作为主攻目标。"))
shutdownJVM()

需要注意的是ubuntu的路径分割符为”：”，而window 为” ; ”

另附hanlp调用常见问题集：

https://github.com/hankcs/HanLP/issues?page=3&q=is%3Aissue+is%3Aopen

文章来源于erfect00的博客

微信关注我们

原文链接：https://yq.aliyun.com/articles/664791

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

中文分词利器 jieba 和 HanLP

从本文开始，我们进入实战部分。首先，我们按照中文自然语言处理流程的第一步获取语料，然后重点进行中文分词的学习。中文分词有很多种，常见的比如有中科院计算所 NLPIR、哈工大 LTP、清华大学 THULAC 、斯坦福分词器、Hanlp 分词器、jieba 分词、IKAnalyzer 等。这里针对 jieba 和 HanLP 分别介绍不同场景下的中文分词应用。 jieba 分词jieba 安装（1）Python 2.x 下 jieba 的三种安装方式，如下：全自动安装：执行命令 easy_install jieba 或者 pip install jieba / pip3 install jieba，可实现全自动安装。半自动安装：先下载 jieba，解压后运行 python setup.py install。手动安装：将 jieba 目录放置于当前目录或者 site-packages 目录。安装完通过 import jieba 验证安装成功与否。（2）Python 3.x 下的安装方式。 Github 上 jieba 的 Python3.x 版本的路径是：https://githu...

2018-11-02

676

HanLP 是由一系列模型与算法组成的 Java 工具包，目标是普及自然语言处理在生产环境中的应用。HanLP 具备功能完善、性能高效、架构清晰、语料时新、可自定义的特点。在提供丰富功能的同时，HanLP 内部模块坚持低耦合、模型坚持惰性加载、服务坚持静态提供、词典坚持明文发布，使用非常方便，同时自带一些语料处理工具，帮助用户训练自己的模型。 HanLP v1.6.0 更新内容：《基于感知机的中文分词、词性标注与命名实体识别框架》《动态双数组trie树》新数据包 data-for-1.6.0.zip md5=38d19afa881ddb00b213f4680259ce68获取最新版的数据包，请fork一份并git clone https://github.com/YourName/HanLP.git。 Portable 版同步升级到 v1.6.0 <dependency> <groupId>com.hankcs</groupId> <artifactId>hanlp</artifactId> <version&g...

2018-11-04

678

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。