内容简介:Apache Tika 1.22 已发布,Tika 是一个内容抽取的工具集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其...
Apache Tika 1.22 已发布,Tika 是一个内容抽取的 工具 集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。
新版本包含许多改进和错误修复,主要更新内容如下:
- 注意:已知回归:PDFBOX-4587 - 代码点在 0xF000 和 0XF0000 之间的 PDF 密码将导致异常
- 为 HWP v5 文件添加解析器(TIKA-2909)
- 修复关闭流的顺序,以避免在 TesseractOCRParser 中出现“无法关闭临时资源”异常(TIKA-2908)
- 通过缓存编码检测器提升 AutoDetectReader 的性能(TIKA-1568)
- 防止 RTFParser 输出不被允许的标签组合(TIKA-2889)
- 修复 RereadableInputStream 以释放所有资源(TIKA-2903)
- 在基于 OpenNLP 语言检测器的 tika-eval 模块中实现自定义语言标识符;添加 18 种语言,并为所有 121 种语言添加常用单词列表(TIKA-2790)
- 修复 MimeTypesReader.releaseParser() 中的 NPE (TIKA-2896)
- 修复 RTFParser 以提取更多内容(TIKA-2883)
- 将 clientSubmitTime 添加到从 PST 文件中提取的元数据(TIKA-2898)
- 改进了用于 xltx,xltm 和其他几种文件格式的 StreamingZipContainerDetector(TIKA-2886)
下载地址:https://tika.apache.org/download.html
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持 码农网
猜你喜欢:- Apache Tika 1.24 发布,内容抽取工具集合
- Apache Tika 1.17 发布 ,内容抽取工具集合
- Apache Tika 1.18 发布,内容抽取工具集合
- Apache Tika 1.19 发布,内容抽取工具集合
- Apache Tika 1.19.1 发布,内容抽取工具集合
- Apache Tika 1.19.1 发布,内容抽取工具集合
本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们。
Mobilizing Web Sites
Layon, Kristofer / 2011-12 / 266.00元
Everyone has been talking about the mobile web in recent years, and more of us are browsing the web on smartphones and similar devices than ever before. But most of what we are viewing has not yet bee......一起来看看 《Mobilizing Web Sites》 这本书的介绍吧!