红联Linux门户
Linux帮助

HtmlSucker 0.0.1发布,惊恐 ---- 红薯又写代码了

发布时间:2018-01-30 09:31:00来源:红联作者:baihuo
全体 OSChina 官方程序员都吓屎了,因为红薯又写代码了。这次他撸了个 HtmlSucker ,这个名字一听就很猥琐有没有。而且其实也没什么卵用,无非就是在不知道 HTML 页面规则的情况下,从一个 HTML 网页中提取文章的正文信息。用来干嘛呢? 反正肯定跟爬虫有关。

听说第一个版本还很弱智,原理是计算最大文本节点的方式来获取正文信息。(就这也好意思发布一个项目,难道欺负我朝无人吗?)

请大家前往 https://gitee.com/ld/HtmlSucker 吐槽!

Maven:[code]
net.oschina.htmlsucker
HtmlSucker
0.0.1
[/code]示例代码:[code]public static void main(String[] args) throws IOException {
String url = "https://www.oschina.net/news/92798/micro-match-1-0-1-released";
System.out.println(HtmlSucker.parse(url, 20000));
}[/code]来自:开源中国社区
文章评论

共有 0 条评论