您现在的位置是:首页 > 文章详情

Apache Tika 1.24 发布,内容抽取工具集合

日期:2020-03-21点击:427

Apache Tika 1.24 发布了,Tika 是一个内容抽取的工具集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。

主要更新内容如下:

  • 更新 Drew Noakes 的元数据提取器
  • 启用 PDF 中的结构标签的可选提取(alpha 级)
  • Tika 应用程序的 --extract 模式现在输出到 STDOUT
  • 为 PDF 添加可选的 Preflight 解析器
  • 改进对某些基于 zip 格式的检测
  • 将元数据提取器升级到 2.13.0 
  • 升级到 POI 4.1.2
  • 从 PSD 文件中提取 XMP
  • 在 PDF 中添加了 XMLProfiler 作为可选的解析器以配置 XFA 和 XMP
  • 从 PDF 提取依赖于 DCT 过滤器的内联图像
  • 升级到 PDFBox 2.0.19
  • 修复了 ASM 解析器配置中的错误
  • 升级到 Java-libpst 0.9.3
  • 修复了 ToXMLHandler 的 XLIFF12Parser 故障 

更新说明: https://downloads.apache.org/tika/CHANGES-1.24.txt

原文链接:https://www.oschina.net/news/114241/apache-tika-1-24-released
关注公众号

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。

持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

转载内容版权归作者及来源网站所有,本站原创内容转载请注明来源。

文章评论

共有0条评论来说两句吧...

文章二维码

扫描即可查看该文章

点击排行

推荐阅读

最新文章