Apache Tika 1.19.1 发布,内容抽取工具集合

栏目: 软件资讯 · 发布时间: 5年前

内容简介:Apache Tika 1.19.1 已发布,Tika 是一个内容抽取的工具集合(a toolkit for text extracting)。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其...

Apache Tika 1.19.1 已发布,Tika 是一个内容抽取的 工具 集合(a toolkit for text extracting)。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。

Apache Tika 1.19.1 主要包括对 MP3Parser 和 SAX 解析处理的两个关键 bug 修复,具体如下:

  • Update PDFBox to 2.0.12, jempbox to 1.8.16 and jbig2 to 3.0.2

  • Fix regression in parser for MP3 files 

  • Updated Python Dependency Check for TesseractOCR

  • Improve SAXParser robustness

  • Remove dependency on slf4j-log4j12 by upgrading jmatio

  • Replace com.sun.xml.bind:jaxb-impl and jaxb-core with org.glassfish.jaxb:jaxb-runtime and jaxb-core



【声明】文章转载自:开源中国社区 [http://www.oschina.net]

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持 码农网




Automate This

Automate This

Christopher Steiner / Portfolio / 2013-8-9 / USD 25.95

"The rousing story of the last gasp of human agency and how today's best and brightest minds are endeavoring to put an end to it." It used to be that to diagnose an illness, interpret legal docume......一起来看看 《Automate This》 这本书的介绍吧!

JS 压缩/解压工具
JS 压缩/解压工具

在线压缩/解压 JS 代码

SHA 加密
SHA 加密

SHA 加密工具

HEX HSV 转换工具
HEX HSV 转换工具

HEX HSV 互换工具