Apache Tika 1.22 发布，内容抽取工具集合-Linuxeden开源社区

Apache Tika 1.22 已发布，Tika 是一个内容抽取的工具集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox，并且为文本抽取工作提供了一个统一的界面。其次，Tika 也提供了便利的扩展 API，用来丰富其对第三方文件格式的支持。

新版本包含许多改进和错误修复，主要更新内容如下：

注意：已知回归：PDFBOX-4587 – 代码点在 0xF000 和 0XF0000 之间的 PDF 密码将导致异常
为 HWP v5 文件添加解析器（TIKA-2909）
修复关闭流的顺序，以避免在 TesseractOCRParser 中出现“无法关闭临时资源”异常（TIKA-2908）
通过缓存编码检测器提升 AutoDetectReader 的性能（TIKA-1568）
防止 RTFParser 输出不被允许的标签组合（TIKA-2889）
修复 RereadableInputStream 以释放所有资源（TIKA-2903）
在基于 OpenNLP 语言检测器的 tika-eval 模块中实现自定义语言标识符；添加 18 种语言，并为所有 121 种语言添加常用单词列表（TIKA-2790）
修复 MimeTypesReader.releaseParser() 中的 NPE （TIKA-2896）
修复 RTFParser 以提取更多内容（TIKA-2883）
将 clientSubmitTime 添加到从 PST 文件中提取的元数据（TIKA-2898）
改进了用于 xltx，xltm 和其他几种文件格式的 StreamingZipContainerDetector（TIKA-2886）

转自 https://www.oschina.net/news/108785/apache-tika-1-22-released