Tika文本提取工具的使用(word、pdf、excel等)

arenzhj

浏览: 62793 次
性别:
来自: 上海

最近访客更多访客>>

redsnower

ahuiii

以太_cpp

bigdesert

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

博客分类：

Java

Tika文本提取工具的使用(word、pdf、excel等)

出处：http://blog.csdn.net/wxwzy738/article/details/8882391

Tika是Apache的Lucene项目下面的子项目，在lucene的应用中可以使用tika获取大批量文档中的内容来建立索引，非常方便，也很容易使用~

Tika的缺点就是都是依赖外部的jar包，导致jar包的重量太大，lucene的核心包只有1M，tika约20M，tika依赖的外部的 jar包有多样的功能，比如PDFBox和Apache POI能获取文档的字体，布置和内置图片信息，而Tika只是获取文本信息。但是这些外部的jar包又没有把获取文本信息的抽离出一个单独的jar包。

1、Tika的作用

工程结构：

2、Tika的工具类

[java] view plain copy

package org.lucene.util;
import java.io.File;
import java.io.FileInputStream;
import java.io.FileNotFoundException;
import java.io.IOException;
import java.io.InputStream;
import org.apache.lucene.document.Document;
import org.apache.lucene.document.Field;
import org.apache.lucene.index.CorruptIndexException;
import org.apache.lucene.index.IndexWriter;
import org.apache.lucene.index.IndexWriterConfig;
import org.apache.lucene.store.Directory;
import org.apache.lucene.store.FSDirectory;
import org.apache.lucene.store.LockObtainFailedException;
import org.apache.lucene.util.Version;
import org.apache.tika.Tika;
import org.apache.tika.exception.TikaException;
import org.apache.tika.metadata.Metadata;
import org.apache.tika.parser.AutoDetectParser;
import org.apache.tika.parser.ParseContext;
import org.apache.tika.parser.Parser;
import org.apache.tika.sax.BodyContentHandler;
import org.xml.sax.ContentHandler;
import org.xml.sax.SAXException;
import com.chenlb.mmseg4j.analysis.MMSegAnalyzer;
public class IndexUtil {
/**
* 直接读取pdf建立索引，结果是索引建立成功了，但是索引存储的数据却是乱的
*/
public void index() {
try {
File f = new File("F:\\文档资料\\lucene_in_action中文版.pdf");
Directory dir = FSDirectory.open(new File("f:/lucene"));
IndexWriter writer = new IndexWriter(dir,new IndexWriterConfig(Version.LUCENE_35, new MMSegAnalyzer()));
writer.deleteAll();
Document doc = new Document();
doc.add(new Field("content",new Tika().parse(f)));
writer.addDocument(doc);
writer.close();
} catch (CorruptIndexException e) {
e.printStackTrace();
} catch (LockObtainFailedException e) {
e.printStackTrace();
} catch (FileNotFoundException e) {
e.printStackTrace();
} catch (IOException e) {
e.printStackTrace();
}
}
/**
* 根据Tika得到文档的内容，这种比下面那种获取的要简单很多，
* 据tika的文档上说，效率没有下面的那种高，可能封装的比较多
* @param f
* @return
* @throws IOException
* @throws TikaException
*/
public String tikaTool(File f) throws IOException, TikaException {
Tika tika = new Tika();
Metadata metadata = new Metadata();
metadata.set(Metadata.AUTHOR, "空号");//重新设置文档的媒体内容
metadata.set(Metadata.RESOURCE_NAME_KEY, f.getName());
String str = tika.parseToString(new FileInputStream(f),metadata);
for(String name:metadata.names()) {
System.out.println(name+":"+metadata.get(name));
}
return str;
}
/**
* 根据Parser得到文档的内容
* @param f
* @return
*/
public String fileToTxt(File f) {
Parser parser = new AutoDetectParser();//自动检测文档类型，自动创建相应的解析器
InputStream is = null;
try {
Metadata metadata = new Metadata();
metadata.set(Metadata.AUTHOR, "空号");//重新设置文档的媒体内容
metadata.set(Metadata.RESOURCE_NAME_KEY, f.getName());
is = new FileInputStream(f);
ContentHandler handler = new BodyContentHandler();
ParseContext context = new ParseContext();
context.set(Parser.class,parser);
parser.parse(is,handler, metadata,context);
for(String name:metadata.names()) {
System.out.println(name+":"+metadata.get(name));
}
return handler.toString();
} catch (FileNotFoundException e) {
e.printStackTrace();
} catch (IOException e) {
e.printStackTrace();
} catch (SAXException e) {
e.printStackTrace();
} catch (TikaException e) {
e.printStackTrace();
} finally {
try {
if(is!=null) is.close();
} catch (IOException e) {
e.printStackTrace();
}
}
return null;
}
}

3、测试

    package org.lucene.test;  
      
    import java.io.File;  
    import java.io.IOException;  
    import org.apache.tika.exception.TikaException;  
    import org.junit.Test;  
    import org.lucene.util.IndexUtil;  
      
    public class TestIndex {  
        @Test  
        public void testIndex() {  
            IndexUtil iu = new IndexUtil();  
            iu.index();  
        }  
          
        @Test  
        public void testTika01() {  
            IndexUtil iu = new IndexUtil();  
            System.out.println(iu.fileToTxt(new File("F:\\文档资料\\lucene_in_action中文版.pdf")));  
        }  
          
        @Test  
        public void testToka02() throws IOException, TikaException {  
            IndexUtil iu = new IndexUtil();  
            System.out.println(iu.tikaTool(new File("F:\\文档资料\\初级SQL开发指南.doc")));  
        }  
    }

分享到：

amazon s3 简单使用 | Hadoop-RPC实现机制

2015-03-13 14:34
浏览 944
评论(0)
分类:编程语言
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

Tika文本提取工具的使用(word、pdf、excel等)

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

Tika文本提取工具的使用(word、pdf、excel等)

评论

发表评论

相关推荐

Cannot convert value of type [org.springframework.cache.ehcache.EhCacheCacheMana

java.lang.ClassNotFoundException: org.springframework.scheduling.quartz.CronTri

native2ascii failed: Error starting Sun's native2ascii: sun.tools.native2ascii.M

kaptcha 验证码组件使用简介

Ivy安装

JAVA集合类

java.lang.ClassNotFoundException: org.springframework.web.context.ContextLoaderL

ssh下载链接

Java多线程

ASM学习笔记

aspectJ切面编程

Java正则表达式应用

Ivy项目搭建

转义处理

Java命令行解析工具Apache CLI

静态代理和动态代理

javaweb之Filter详解

Java-synchronized

JVM 内存参数设置

JavaWeb--前端图片展示问题

最近访客更多访客>>