中文处理工具包 FoolNLTK 发布序列标注训练代码

栏目: 软件资讯 · 发布时间: 7年前

内容简介：FoolNLTK之前发布了分词等功能，但很多场景需要自定义模型，现发布训练代码，只需要准备好训练数据，其他交给工具完成。另外修改了之前用户词典合并局部出现的 Bug。提供训练和模型调用接口详情查看项目地址。 ...

FoolNLTK之前发布了分词等功能，但很多场景需要自定义模型，现发布训练代码，只需要准备好训练数据，其他交给工具完成。

另外修改了之前用户词典合并局部出现的 Bug。

提供训练和模型调用接口详情查看项目地址。

GitHub、Gitee

FoolNLTK是一款中文处理工具包

特点

可能不是最快的开源中文分词，但很可能是最准的开源中文分词
基于BiLSTM模型训练而成
包含分词，词性标注，实体识别,　都有比较高的准确率
用户自定义词典
可训练自己的模型

用户自定义词典

词典格式格式如下，词的权重越高，词的长度越长就越越可能出现,　权重值请大于1

难受香菇 10
什么鬼 10
分词工具 10
北京 10
北京天安门 10

加载词典

import fool
fool.load_userdict(path)
text = "我在北京天安门看你难受香菇"
print(fool.cut(text))
# ['我', '在', '北京天安门', '看', '你', '难受香菇']

删除词典

fool.delete_userdict();

词性标注

import fool

text = "一个傻子在北京"
print(fool.pos_cut(text))
#[('一个', 'm'), ('傻子', 'n'), ('在', 'p'), ('北京', 'ns')]

实体识别

import fool 

text = "一个傻子在北京"
words, ners = fool.analysis(text)
print(ners)
#[(5, 8, 'location', '北京')]

【声明】文章转载自：开源中国社区 [http://www.oschina.net]

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络，本站转载出于传递更多信息之目的，版权归原作者或者来源机构所有，如转载稿涉及版权问题，请联系我们。

码农书籍

领域特定语言

Martin Fowler / ThoughtWorks中国 / 机械工业出版社华章公司 / 2013-3 / 89.00元

本书是DSL领域的丰碑之作，由世界级软件开发大师和软件开发“教父”Martin Fowler历时多年写作而成，ThoughtWorks中国翻译。全面详尽地讲解了各种DSL及其构造方式，揭示了与编程语言无关的通用原则和模式，阐释了如何通过DSL有效提高开发人员的生产力以及增进与领域专家的有效沟通，能为开发人员选择和使用DSL提供有效的决策依据和指导方法。全书共57章，分为六个部分：第一部分介......一起来看看《领域特定语言》这本书的介绍吧!

码农工具

中文处理工具包 FoolNLTK 发布序列标注训练代码

领域特定语言

随机密码生成器

XML 在线格式化

html转js在线工具