HTML文檔解析器 NekoHTML

jopen 14年前發布 | 22K 次閱讀 Java HTML操作類庫

NekoHTML是一個Java語言的 HTML掃描器和標簽補全器(tag balancer) ,使得程序能解析HTML文檔并用標準的XML接口來訪問其中的信息。這個解析器能夠掃描HTML文件并“修正”許多作者（人或機器）在編寫HTML文檔過程中常犯的錯誤。

NekoHTML能增補缺失的父元素、自動用結束標簽關閉相應的元素，以及不匹配的內嵌元素標簽。NekoHTML的開發使用了 Xerces Native Interface (XNI)，后者是Xerces2的實現基礎。

示例代碼：

package sample;

import org.cyberneko.html.parsers.DOMParser;
import org.w3c.dom.Document;
import org.w3c.dom.Node;

public class TestHTMLDOM {
    public static void main(String[] argv) throws Exception {
        DOMParser parser = new DOMParser();
        for (int i = 0; i < argv.length; i++) {
            parser.parse(argv[i]);
            print(parser.getDocument(), "");
        }
    }
    public static void print(Node node, String indent) {
        System.out.println(indent+node.getClass().getName());
        Node child = node.getFirstChild();
        while (child != null) {
            print(child, indent+" ");
            child = child.getNextSibling();
        }
    }
}

項目主頁：http://www.baiduhome.net/lib/view/home/1324372332155

本文由用戶 jopen 自行上傳分享，僅供網友學習交流。所有權歸原作者，若您的權利被侵害，請聯系管理員。

轉載本站原創文章，請注明出處，并保留原始鏈接、圖片水印。

本站是一個以用戶分享為主的開源技術平臺，歡迎各類分享！

本文地址：http://www.baiduhome.net/lib/view/open1324372332155.html

Java HTML操作類庫

HTML文檔解析器 NekoHTML

相關經驗

相關資訊

相關文檔

目錄