中文处理工具包 FoolNLTK

码农软件 · 软件分类 · 中文分词库 · 2019-08-28 17:29:35

授权协议: Apache
开发语言: Python
操作系统: 跨平台
软件首页: https://gitee.com/rockyzheng/FoolNLTK
软件文档: https://gitee.com/rockyzheng/FoolNLTK

软件介绍

FoolNLTK

中文处理工具包

特点

可能不是最快的开源中文分词，但很可能是最准的开源中文分词
基于BiLSTM模型训练而成
包含分词，词性标注，实体识别,　都有比较高的准确率
用户自定义词典

Install

pip install foolnltk

使用说明

分词

import fool

text = "一个傻子在北京"
print(fool.cut(text))
# ['一个', '傻子', '在', '北京']

命令行分词

python -m fool [filename]

用户自定义词典

词典格式格式如下，词的权重越高，词的长度越长就越越可能出现,　权重值请大于1

难受香菇 10
什么鬼 10
分词工具 10
北京 10
北京天安门 10

加载词典

import fool
fool.load_userdict(path)
text = "我在北京天安门看你难受香菇"
print(fool.cut(text))
# ['我', '在', '北京天安门', '看', '你', '难受香菇']

删除词典

fool.delete_userdict();

词性标注

import fool

text = "一个傻子在北京"
print(fool.pos_cut(text))
#[('一个', 'm'), ('傻子', 'n'), ('在', 'p'), ('北京', 'ns')]

实体识别

import fool 

text = "一个傻子在北京"
words, ners = fool.analysis(text)
print(ners)
#[(5, 8, 'location', '北京')]

注意

暂时只在Python3 Linux 平台测试通过

本文地址：https://codercto.com/soft/d/13370.html

码农书籍

阿里巴巴正传：我们与马云的“一步之遥”

方兴东、刘伟 / 江苏凤凰文艺出版社 / 2015-1 / 45.00

十几年来，方兴东与马云每年一次，老友聚首，开怀畅谈，阿里上市前，作者再次与马云深度对话，阿里上市前的布局，深入探讨了一系列人们关心的话题。本书忠实记录了阿里壮大、马云封圣的历史。作者通过细致梳理和盘点，对阿里巴巴的15年成长史进行了忠实回顾。从海博翻译社到淘宝网，从淘宝商城到天猫，从支付宝到阿里云计算，从拉来软银的第一笔投资到纽交所上市，作者对其中涉及到的人物、细节都有生动展现；对于马云、......一起来看看《阿里巴巴正传：我们与马云的“一步之遥”》这本书的介绍吧!

码农工具