没有合适的资源?快使用搜索试试~ 我知道了~
基于Vert.x和RxJava 2构建通用的爬虫框架的示例
试读
5页
需积分: 0 1 下载量 23 浏览量
更新于2021-01-05
收藏 345KB PDF 举报
最近由于业务需要监控一些数据,虽然市面上有很多优秀的爬虫框架,但是我仍然打算从头开始实现一套完整的爬虫框架。
在技术选型上,我没有选择Spring来搭建项目,而是选择了更轻量级的Vert.x。一方面感觉Spring太重了,而Vert.x是一个基于JVM、轻量级、高性能的框架。它基于事件和异步,依托于全异步Java服务器Netty,并扩展了很多其他特性。
github地址:https://github.com/fengzhizi715/NetDiscovery
一. 爬虫框架的功能
爬虫框架包含爬虫引擎(SpiderEngine)和爬虫(Spider)。SpiderEngine可以管理多个Spi
基于基于Vert.x和和RxJava 2构建通用的爬虫框架的示例构建通用的爬虫框架的示例
最近由于业务需要监控一些数据,虽然市面上有很多优秀的爬虫框架,但是我仍然打算从头开始实现一套完整的爬虫框架。
在技术选型上,我没有选择Spring来搭建项目,而是选择了更轻量级的Vert.x。一方面感觉Spring太重了,而Vert.x是一个基于
JVM、轻量级、高性能的框架。它基于事件和异步,依托于全异步Java服务器Netty,并扩展了很多其他特性。
github地址:https://github.com/fengzhizi715/NetDiscovery
一一. 爬虫框架的功能爬虫框架的功能
爬虫框架包含爬虫引擎(SpiderEngine)和爬虫(Spider)。SpiderEngine可以管理多个Spider。
1.1 Spider
在Spider中,主要包含几个组件:downloader、queue、parser、pipeline以及代理池IP(proxypool),代理池是一个单独的项
目,我前段时间写的,在使用爬虫框架时经常需要切换代理IP,所以把它引入进来。
proxypool地址:https://github.com/fengzhizi715/ProxyPool
其余四个组件都是接口,在爬虫框架中内置了一些实现,例如内置了多个下载器(downloader)包括vertx的webclient、http
client、okhttp3、selenium实现的下载器。开发者可以根据自身情况来选择使用或者自己开发全新的downloader。
Downloader的download方法会返回一个Maybe<Response>。
package com.cv4j.netdiscovery.core.downloader;
import com.cv4j.netdiscovery.core.domain.Request;
import com.cv4j.netdiscovery.core.domain.Response;
import io.reactivex.Maybe;
/**
* Created by tony on 2017/12/23.
*/
public interface Downloader {
Maybe<Response> download(Request request);
下载后可阅读完整内容,剩余4页未读,立即下载
资源推荐
资源评论
127 浏览量
2019-01-17 上传
2024-04-08 上传
188 浏览量
128 浏览量
2024-09-28 上传
145 浏览量
2021-02-05 上传
5星 · 资源好评率100%
199 浏览量
103 浏览量
2024-03-23 上传
5星 · 资源好评率100%
193 浏览量
2019-04-23 上传
165 浏览量
117 浏览量
148 浏览量
106 浏览量
2017-01-07 上传
5星 · 资源好评率100%
163 浏览量
165 浏览量
2018-06-01 上传
2018-06-01 上传
5星 · 资源好评率100%
111 浏览量
5星 · 资源好评率100%
资源评论
weixin_38556541
- 粉丝: 6
- 资源: 970
上传资源 快速赚钱
- 我的内容管理 展开
- 我的资源 快来上传第一个资源
- 我的收益 登录查看自己的收益
- 我的积分 登录查看自己的积分
- 我的C币 登录后查看C币余额
- 我的收藏
- 我的下载
- 下载帮助
安全验证
文档复制为VIP权益,开通VIP直接复制
信息提交成功