网站建设资讯

NEWS

网站建设资讯

Python与Tika的对比案例-创新互联

这篇文章给大家分享的是有关Python与Tika的对比案例的内容。小编觉得挺实用的,因此分享给大家做个参考。一起跟随小编过来看看吧。

10年积累的网站设计、成都做网站经验,可以快速应对客户对网站的新想法和需求。提供各种问题对应的解决方案。让选择我们的客户得到更好、更有力的网络服务。我虽然不认识你,你也不认识我。但先做网站后付款的网站建设流程,更有平邑免费网站建设让你可以放心的选择与我们合作。

PDF文件表格样例

Python解析结果

其他样式解析,如Tika

1、TEXT格式

  Tika tika = new Tika();
        tika.setMaxStringLength(100 * 1024 * 1024);
        try (InputStream stream = new FileInputStream(new File("600060_2018_zB.pdf"))) {
            return tika.parseToString(stream);
        }

Text格式解析结果

Python与Tika的对比案例

2、XHTML格式

       ContentHandler handler = new ToXMLContentHandler();
        AutoDetectParser parser = new AutoDetectParser();
        Metadata metadata = new Metadata();
        try (InputStream stream = new FileInputStream(new File("600060_2018_zB.pdf"))) {
            parser.parse(stream, handler, metadata);
            return handler.toString();
        }

XHTML格式解析结果

Python与Tika的对比案例

解析PDF常用组件(PdfBox、iText、Tika等)都无法将表格数据解析成有规则的格式。解析后格式基本是TEXT、XHTML等导致处理表格数据变的非常复杂。

根据对比我们可以发现,用Python解析PDF的表格数据更为简单方便。

感谢各位的阅读!关于Python与Tika的对比案例就分享到这里了,希望以上内容可以对大家有一定的帮助,让大家可以学到更多知识。如果觉得文章不错,可以把它分享出去让更多的人看到吧!


文章名称:Python与Tika的对比案例-创新互联
地址分享:http://cdweb.net/article/eciii.html