网络编程 | 站长之家 | 网页制作 | 图形图象 | 操作系统 | 冲浪宝典 | 软件教学 | 网络办公 | 邮件系统 | 网络安全 | 认证考试 | 系统进程
Firefox | IE | Maxthon | 迅雷 | 电驴 | BitComet | FlashGet | QQ | QQ空间 | Vista | 输入法 | Ghost | Word | Excel | wps | Powerpoint
asp | .net | php | jsp | Sql | c# | Ajax | xml | Dreamweaver | FrontPages | Javascript | css | photoshop | fireworks | Flash | Cad | Discuz!
当前位置 > 网站建设学院 > 网络编程 > Java
Tag:注入,存储过程,分页,安全,优化,xmlhttp,fso,jmail,application,session,防盗链,stream,无组件,组件,md5,乱码,缓存,加密,验证码,算法,cookies,ubb,正则表达式,水印,索引,日志,压缩,base64,url重写,上传,控件,Web.config,JDBC,函数,内存,PDF,迁移,结构,破解,编译,配置,进程,分词,IIS,Apache,Tomcat,phpmyadmin,Gzip,触发器,socket
网络编程:ASP教程,ASP.NET教程,PHP教程,JSP教程,C#教程,数据库,XML教程,Ajax,Java,Perl,Shell,VB教程,Delphi,C/C++教程,软件工程,J2EE/J2ME,移动开发
本月文章推荐
.J2ME移动 2D 图形开发.
.Java简单类型进行精确浮点数运算.
.java 写的文件浏览器.
.java设计模式之 Composite(组合).
.用Java SE 6.0实现高质量桌面集成.
.SCJP认证套题解析(1).
.通往Java认证的阶梯.
.修成JAVA高手的基本素养.
.关于可扩展的web架构设计的探索-.
.插件Java Plugin Fram.
.软件最大的追求是什么?.
.The Java Programming Tutorial:.
.java中的匿名类.
.Java集合框架.
.Leopard新问题 不能用最新版Java.
.JBuilder4入门.
.getUTCMinutes 方法.
.赋值运算符 (=).
.EJB 技术简介及其 Java 应用实例.
.JAVA程序员的新挑战:IBM推出新的.

采用POI和ANTLR提取WORD文档数据

发表日期:2008-1-5


1. POI提取Word文档内容

POI是Apache开源项目之一,用Java实现跨平台MS Word/Excel文档解析。 也就是说可以在非Windows平台提取MS Word/Excel文档内容。 本文采用POI的一个扩展Jar包tm-extractors_0.4.jar提取Word文档内容。 Word文档内容如下:(该文档有2页,每页记录一个组件内容),

采用POI和ANTLR提取WORD文档数据(图一)

采用POI和ANTLR提取WORD文档数据(图二)

Java类中Import import org.textmining.text.extraction.WordExtractor;然后在方法中:

  protected String getText() throws Exception {
                WordExtractor extractor=null;
                String text=null;
                extractor = new WordExtractor();
                text=extractor.extractText(in);   // in为 FileInputStream(new File("Word文档地址"));
                return text;
 }

 运行结果如下:

Colimas Component Specification

1. Component: Apache Jakarta POI Java API To Access Microsoft Format Files
 
1.1 Basic Information
?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦

Alias                               : POI
Author                            : http://jakarta.apache.org/poi/index.Html
Version                           : 0.0.1
Language                        : Java
Platform                          : Windows, Linux, Unix
Status                              : Confirmed
Is public?                         : Y
?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦
1.2 Developers
?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦
Apache developer1
Apache developer2
?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦?¦


上一篇:[Portal参考手册]生命周期 人气:652
下一篇:[Portal参考手册]Portlet持久化 人气:572
浏览全部Java的内容 Dreamweaver插件下载 网页广告代码 祝你圣诞节快乐 2009年新年快乐