<dependency>
<groupId>org.ops4j.pax.carrot</groupId>
<artifactId>pax-carrot-htmlparser</artifactId>
<version>1.0.0</version>
</dependency>
HTMLParser parser = new HTMLParser();
File file = new File("path/to/html/file.html");
HTMLDocument document = parser.parse(file);
HTMLDocument document = parser.parse(htmlSource);
HTMLElement element = document.getElementById("elementId");
String tagName = element.getTagName();
String attributeValue = element.getAttribute("attributeName");
String textContent = element.getTextContent();
ElementSelector selector = new XPathElementSelector("//div[@class='content']");
List<HTMLElement> elements = selector.selectElements(document);
for (HTMLElement element : elements) {
}