Apache Tika 1.22 发布,内容抽取工具集合

栏目: 软件资讯 · 发布时间: 6年前

内容简介:Apache Tika 1.22 已发布,Tika 是一个内容抽取的工具集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其...

Apache Tika 1.22 已发布,Tika 是一个内容抽取的 工具 集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。

新版本包含许多改进和错误修复,主要更新内容如下:

  • 注意:已知回归:PDFBOX-4587  - 代码点在 0xF000 和 0XF0000 之间的 PDF 密码将导致异常
  • 为 HWP v5 文件添加解析器(TIKA-2909)
  • 修复关闭流的顺序,以避免在 TesseractOCRParser 中出现“无法关闭临时资源”异常(TIKA-2908)
  • 通过缓存编码检测器提升 AutoDetectReader 的性能(TIKA-1568)
  • 防止 RTFParser 输出不被允许的标签组合(TIKA-2889)
  • 修复 RereadableInputStream 以释放所有资源(TIKA-2903)
  • 在基于 OpenNLP 语言检测器的 tika-eval 模块中实现自定义语言标识符;添加 18 种语言,并为所有 121 种语言添加常用单词列表(TIKA-2790)
  • 修复 MimeTypesReader.releaseParser() 中的 NPE (TIKA-2896)
  • 修复 RTFParser 以提取更多内容(TIKA-2883)
  • 将 clientSubmitTime 添加到从 PST 文件中提取的元数据(TIKA-2898)
  • 改进了用于 xltx,xltm 和其他几种文件格式的 StreamingZipContainerDetector(TIKA-2886)

发布公告

下载地址:https://tika.apache.org/download.html


以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持 码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们

极致:互联网时代的产品设计

极致:互联网时代的产品设计

戴维•罗斯 / 中信出版集团 / 2016-6 / 49.00元

在不远的未来,日常物品将能够迅速理解我们的需求,改善我们的生活,并随处可见。为了实现这一预期,我们需要能够发现用户使用产品的场景,找到用户高频刚需痛点的产品设计者。 站在下一个转型发展的悬崖上,我们看到技术将更具人性。随着物联网的发展,我们习以为常的数百件日常物品:汽车、钱包、手表、雨伞甚至垃圾桶,都将回应我们的需求,了解我们,学习为我们思考。最先出现的智能硬件为什么是智能手环、无人驾驶汽车......一起来看看 《极致:互联网时代的产品设计》 这本书的介绍吧!

HTML 压缩/解压工具
HTML 压缩/解压工具

在线压缩/解压 HTML 代码

html转js在线工具
html转js在线工具

html转js在线工具

HEX HSV 转换工具
HEX HSV 转换工具

HEX HSV 互换工具