Apache Tika 1.24 发布,内容抽取工具集合

栏目: 软件资讯 · 发布时间: 4年前

内容简介:Apache Tika 1.24 发布了,Tika 是一个内容抽取的工具集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其...

Apache Tika 1.24 发布了,Tika 是一个内容抽取的 工具 集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。

主要更新内容如下:

  • 更新 Drew Noakes 的元数据提取器
  • 启用 PDF 中的结构标签的可选提取(alpha 级)
  • Tika 应用程序的 --extract 模式现在输出到 STDOUT
  • 为 PDF 添加可选的 Preflight 解析器
  • 改进对某些基于 zip 格式的检测
  • 将元数据提取器升级到 2.13.0 
  • 升级到 POI 4.1.2
  • 从 PSD 文件中提取 XMP
  • 在 PDF 中添加了 XMLProfiler 作为可选的解析器以配置 XFA 和 XMP
  • 从 PDF 提取依赖于 DCT 过滤器的内联图像
  • 升级到 PDFBox 2.0.19
  • 修复了 ASM 解析器配置中的错误
  • 升级到 Java-libpst 0.9.3
  • 修复了 ToXMLHandler 的 XLIFF12Parser 故障 

更新说明: https://downloads.apache.org/tika/CHANGES-1.24.txt


以上所述就是小编给大家介绍的《Apache Tika 1.24 发布,内容抽取工具集合》,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对 码农网 的支持!

查看所有标签

猜你喜欢:

本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们

XSS跨站脚本攻击剖析与防御

XSS跨站脚本攻击剖析与防御

邱永华 / 人民邮电出版社 / 2013-9-1 / 49.00元

《XSS跨站脚本攻击剖析与防御》是一本专门剖析XSS安全的专业书,总共8章,主要包括的内容如下。第1章 XSS初探,主要阐述了XSS的基础知识,包括XSS的攻击原理和危害。第2章 XSS利用方式,就当前比较流行的XSS利用方式做了深入的剖析,这些攻击往往基于客户端,从挂马、窃取Cookies、会话劫持到钓鱼欺骗,各种攻击都不容忽视。第3章 XSS测试和利用工具,介绍了一些常见的XSS测试工具。第4......一起来看看 《XSS跨站脚本攻击剖析与防御》 这本书的介绍吧!

URL 编码/解码
URL 编码/解码

URL 编码/解码

UNIX 时间戳转换
UNIX 时间戳转换

UNIX 时间戳转换

HSV CMYK 转换工具
HSV CMYK 转换工具

HSV CMYK互换工具