国产片侵犯亲女视频播放_亚洲精品二区_在线免费国产视频_欧美精品一区二区三区在线_少妇久久久_在线观看av不卡

服務器之家:專注于服務器技術及軟件下載分享
分類導航

PHP教程|ASP.NET教程|JAVA教程|ASP教程|

服務器之家 - 編程語言 - JAVA教程 - 使用webmagic實現爬蟲程序示例分享

使用webmagic實現爬蟲程序示例分享

2019-11-19 14:41Java教程網 JAVA教程

這篇文章主要介紹了使用webmagic實現爬蟲程序示例,需要的朋友可以參考下

代碼如下:


package com.letv.cloud.spider;

 

import java.util.HashSet;
import java.util.List;

import us.codecraft.webmagic.Page;
import us.codecraft.webmagic.Site;
import us.codecraft.webmagic.Spider;
import us.codecraft.webmagic.processor.PageProcessor;

public class MoviePaperPageProcessor implements PageProcessor {
 private Site page = Site.me().setRetryTimes(3).setSleepTime(1000);

 public Site getSite() {
  return page;
 }

 public void process(Page page) {
  List<String> links = page.getHtml().links().regex(
    "http://posters.aa.com/poster/\\d+").all();
  links = removeDuplicate(links);
  page.addTargetRequests(links);
  page.putField("title", page.getHtml().xpath(
    "//div[@id='imdbleftsecc']/center/h1/text()").toString());
  page.putField("imgurl", page.getHtml().xpath(
    "//div[@id='imdbleftsecc']/center/img/@src").toString());
 }

 public static void main(String[] args) {
  for (int i = 1; i <= 3; i++) {
   Spider.create(new MoviePaperPageProcessor()).addUrl(
     "http://posters.aa.co/poster_page/" + i).thread(5).run();
  }
 }

 public static List removeDuplicate(List list) {
  HashSet hs = new HashSet(list);
  list.clear();
  list.addAll(hs);
  return list;
 }
}

 

延伸 · 閱讀

精彩推薦
主站蜘蛛池模板: 日韩三区 | 日韩黄网| 精品久久中文字幕 | 国产精品亚洲成在人线 | 欧洲精品在线视频 | 国产黄色在线 | 性色av一区二区三区红粉影视 | 成人久久久精品国产乱码一区二区 | 精品亚洲永久免费精品 | 午夜免费av | 999一个人免费看ww | 免费一级毛片 | 婷婷亚洲五月 | 精品无码久久久久久国产 | 久热精品免费视频 | 久热久 | 日日操夜| 91精品国产综合久久久久久丝袜 | 欧美一级片在线播放 | 日韩一区电影 | 成人片在线播放 | 午夜av影视| 一区视频在线 | 日本一区二区三区免费观看 | 欧美簧片在线 | 男人影音 | 色猫猫国产区一区二在线视频 | 久久精品二 | 亚洲视频一区 | 国产精品美女久久久久aⅴ国产馆 | 日韩在线一区二区 | 精品1区2区| 国产99久久| 精品香蕉一区二区三区 | 中文字幕在线免费视频 | av成人毛片 | 男人天堂网址 | 欧美激情精品久久久久久变态 | 日本jizz在线观看 | 亚洲天堂中文字幕 | 操操你 |