频道直达 - 专题 - 新闻 - 技巧 - 组网 - 开发 - 安全 - web编程 - 图像 - 操作系统 - 数据库 - 教育 - 旅游 - 健康 - 时尚 - 驱动 - 软件 - 游戏 - 多媒体 - ERP - 讨论组

把Word转为简洁的html的若干种方法

来源: 作者: 出处:巧巧读书 2007-10-09 进入讨论组

  word可以直接另存为 htm,但即使是 另存为 html 也会有大量的废代码。以前我一般用 dreamweaver 的 clean up html 来处理,先处理 word 特有标签,然后删除一些 font,b,span 等。进一步,在 editplus 里面用正则进行处理,最后得到我想要的干净的html 代码。

当然最完美的办法就是拷贝文字出来,自己用文本编辑器书写htm标签,:)

  今天又看到lifehacker这几种word 2 clean htm方法:

  1.使用这个HTML Tidy Library Project开源软件来处理。

  2.微软官方站点也有个Office 2000 HTML Filter 2.0工具,可以用来处理掉word2000转html时出现的多余代码。

  3.使用这个Word HTML Cleaner 在线工具来处理。只能处理word2000以下版本。

  4.有人给出了正则表达式(其实,上面的各种软件也都是用正则来解决的)

  删除不需要的标签

  <[/]?(font|span|xml|[ovwxp]:w+)[^>]*?>
- replace any matches with the empty string

  删除class,style...等不需要的属性

  <([^>]*)(?:class|lang|style|size|face|[ovwxp]:w+)=(?:'[^']*'|""[^""]*""|[^>]+)([^>]*)>
- replace any matches with <$1$2>

  详细解释在Clean Word HTML using Regular Expressions

本文:http://www.qqread.com/word/u352446.html 更多文章 更多内容请看Word技巧专题,或进入讨论组讨论。
收藏此文】【 】【打印】【关闭
相关图文阅读
频道图文推荐
健 康 咨 询
时 尚 咨 询
巧巧读书宗旨
相关专题
讨论组问题推荐
站内各频道最新更新文档
站内最新制作专题
热门关键字导读
Photoshop教 程照片处理 照片制作 PS快捷键 抠图
计 算 机 故 障XP系统修复
艺 术 与 设 计设计 流媒体 设计欣赏 边框
计 算 机 安 全ARP
站内频道文章精选
巧巧电脑频道编辑信箱  告诉我们您想看的专题或文章