<dependency>
<groupId>net.htmlparser.jer</groupId>
<artifactId>htmlparser</artifactId>
<version>2.1</version>
</dependency>
Parser parser = new Parser();
NodeIterator iterator = parser.elements();
while (iterator.hasMoreNodes()) {
Node node = iterator.nextNode();
if (node instanceof TextNode) {
TextNode textNode = (TextNode) node;
System.out.println(textNode.getText());
}
}
Node[] nodes = parser.extractAllNodesThatMatch(new TagNameFilter("a")).toNodeArray();
Node divNode = parser.parse(new CssSelectorNodeFilter("div.my-class")).elementAt(0);
System.out.println(divNode.getText());
URL url = new URL("http://example.com");
InputStreamReader isr = new InputStreamReader(url.openStream(), "UTF-8");
parser.setInputHTML(isr);
NodeList nodeList = parser.parse(null);