Chinaunix首页 | 论坛 | 博客
  • 博客访问: 11317
  • 博文数量: 35
  • 博客积分: 0
  • 博客等级: 民兵
  • 技术积分: 360
  • 用 户 组: 普通用户
  • 注册时间: 2022-12-14 16:49
文章分类

全部博文(35)

文章存档

2024年(1)

2023年(28)

2022年(6)

我的朋友

分类: 数据库开发技术

2023-01-07 16:17:29

众所周知,隧道代理比动态短效代理贵,但是因为其产品特性,确实也更好用更方便,那我们要如何自己搭建起来隧道代理呢?

说来也不复杂,按照我说的方法,即可搭建起来隧道代理。

1.构建HTTP代理池

首先,你手上得有一批HTTP 代理,要么自己去爬免费的资源(不是那么建议,免费的可用率真的非常低),要么就自己去和HTTP厂商购买动态短效代理,要么就从0开始,自己买服务器……总之,你手上得有一批可以使用起来的HTTP代理,搭建起来你的HTTP代理池子。

接下来就是使用 Redis 的 Hash 这个数据结构周期性访问url,拉取当前{BANNED}最佳新可用的HTTP代理。

代码如下:

点击(此处)折叠或打开

  1. """
  2. ProxyManager.py
  3. ~~~~~~~~~~~~~~~~~~~~~
  4. 简易代理池管理工具,直接从URL中读取所有
  5. {BANNED}最佳新的代理,并写入Redis。
  6. """
  7. import yaml
  8. import time
  9. import json
  10. import redis
  11. import datetime
  12. import requests
  13. class ProxyManager:
  14.     def __init__(self):
  15.         self.config = self.read_config()
  16.         self.redis_config = self.config['redis']
  17.         self.client = redis.Redis(host=self.redis_config['host'],
  18.                                   password=self.redis_config['password'],
  19.                                   port=self.redis_config['port'])
  20.         self.instance_dict = {}
  21.     def read_config(self):
  22.         with open('config.yaml') as f:
  23.             config = yaml.safe_load(f.read())
  24.             return config
  25.     def read_ip(self):
  26.         resp = requests.get(self.config['proxy']).text
  27.         if '{' in resp:
  28.             return []
  29.         proxy_list = resp.split()
  30.         return proxy_list
  31.     def delete_ip(self, live_ips, pool_ips):
  32.         ip_to_removed = set(pool_ips) - set(live_ips)
  33.         if ip_to_removed:
  34.             print('ip to be removed:', ip_to_removed)
  35.             self.client.hdel(self.redis_config['key'], *list(ip_to_removed))
  36.     def add_new_ips(self, live_ips, pool_ips):
  37.         ip_to_add = set(live_ips) - set(pool_ips)
  38.         if ip_to_add:
  39.             print('ip to add:', ip_to_add)
  40.             ips = {}
  41.             for ip in ip_to_add:
  42.                 ips[ip] = json.dumps({'private_ip': ip,
  43.                                       'ts': datetime.datetime.now().strftime('%Y-%m-%d %H:%M:%S')})
  44.             self.client.hset(self.redis_config['key'], mapping=ips)
  45.     def run(self):
  46.         while True:
  47.             live_ips = self.read_ip()
  48.             pool_ips = [x.decode() for x in self.client.hgetall(self.redis_config['key'])]
  49.             self.delete_ip(live_ips, pool_ips)
  50.             self.add_new_ips(live_ips, pool_ips)
  51.             time.sleep(40)
  52. if __name__ == '__main__':
  53.     manager = ProxyManager()
  54.     manager.run()

通常,HTTP代理从厂商那购买,是有个存活周期的,我们要在HTTP代理的存货周期内使用,所以更换的周期也要在这时间段内。更换的时候,采用了增量更换的方式。把当前拉取的 IP 和 Redis 里面的已有 IP 进行对比。不在这次拉取的 IP 全部从 Redis 移除,然后把新增的 IP 加到 Redis 中。

当然,我们需要确保从 URL 拉下来的代理也进行有效性检查,发现无效的立刻移除,可以进行少量测试:



点击(此处)折叠或打开

  1. # python 3.6+

  2. import requests


  3. url = ""

  4. ip, port = "39.137.95.73", "8080"

  5. proxies = {"http": f"http://{ip}:{port}"}

  6. #空白位置为测试HTTP代理和HTTP代理使用端口


  7. headers = {"User-Agent": "Mozilla/5.0"}

  8. #响应头

  9. res = requests.get(url, proxies=proxies, headers=headers)

  10. #发起请求

  11. print(res.status_code) #返回响应码

只需要更改这里的ip就可以自动判断是否可用。

如果这里的状态码为200就表示这个ip可用,如果是502等其他的状态码就表示这个ip不可用。


2.实现自动转发

我们可以使用 OpenResty实现自动转发。

对应的配置文件如下图所示:

点击(此处)折叠或打开

  1. worker_processes 16; #nginx worker 数量
  2. error_log /usr/local/openresty/nginx/logs/error.log; #指定错误日志文件路径
  3. events {
  4. worker_connections 1024;
  5. }
  6. stream {
  7. ## TCP 代理日志格式定义
  8. log_format tcp_proxy '$remote_addr [$time_local] '
  9. '$protocol $status $bytes_sent $bytes_received '
  10. '$session_time "$upstream_addr" '
  11. '"$upstream_bytes_sent" "$upstream_bytes_received" "$upstream_connect_time"';
  12. ## TCP 代理日志配置
  13. access_log /usr/local/openresty/nginx/logs/access.log tcp_proxy;
  14. open_log_file_cache off;
  15. ## TCP 代理配置
  16. upstream backend{
  17. server 127.0.0.2:1101;# 爱写啥写啥 反正下面的代码也给你改了
  18. balancer_by_lua_block {
  19. -- 初始化balancer
  20. local balancer = require "ngx.balancer"
  21. local host = ""
  22. local port = 0
  23. host = ngx.ctx.proxy_host
  24. port = ngx.ctx.proxy_port
  25. -- 设置 balancer
  26. local ok, err = balancer.set_current_peer(host, port)
  27. if not ok then
  28. ngx.log(ngx.ERR, "failed to set the peer: ", err)
  29. end
  30. }
  31. }
  32. server {
  33. preread_by_lua_block{
  34. local redis = require("resty.redis")
  35. --创建实例
  36. local redis_instance = redis:new()
  37. --设置超时(毫秒)
  38. redis_instance:set_timeout(3000)
  39. --建立连接,请在这里配置Redis 的 IP 地址、端口号、密码和用到的 Key
  40. local rhost = "123.45.67.89"
  41. local rport = 6739
  42. local rpass = "abcdefg"
  43. local rkey = "proxy:pool"
  44. local ok, err = redis_instance:connect(rhost, rport)
  45. ngx.log(ngx.ERR, "1111111 ", ok, " ", err)
  46. -- 如果没有密码,移除下面这一行
  47. local res, err = redis_instance:auth(rpass)
  48. local res, err = redis_instance:hkeys(rkey)
  49. if not res then
  50. ngx.log(ngx.ERR,"res num error : ", err)
  51. return redis_instance:close()
  52. end
  53. math.randomseed(tostring(ngx.now()):reverse():sub(1, 6))
  54. local proxy = res[math.random(#res)]
  55. local colon_index = string.find(proxy, ":")
  56. local proxy_ip = string.sub(proxy, 1, colon_index - 1)
  57. local proxy_port = string.sub(proxy, colon_index + 1)
  58. ngx.log(ngx.ERR,"redis data = ", proxy_ip, ":", proxy_port);
  59. ngx.ctx.proxy_host = proxy_ip
  60. ngx.ctx.proxy_port = proxy_port
  61. redis_instance:close()
  62. }
  63. # 下面是本机的端口,也就是爬虫固定写死的端口
  64. listen 0.0.0.0:9976; #监听本机地址和端口,当使用keeplived的情况下使用keeplived VIP
  65. proxy_connect_timeout 3s;
  66. proxy_timeout 10s;
  67. proxy_pass backend; #这里填写对端的地址
  68. }
  69. }
有需要的友友们可以根据配置文件稍作修改。


3.启动

设置好了这些配置以后,使用 Docker 来启动它:


点击(此处)折叠或打开

  1. from openresty/openresty:centos
  2. copy nginx_redis.conf /usr/local/openresty/nginx/conf/nginx.conf

然后,执行命令构建和运行:


点击(此处)折叠或打开

  1. docker build --network host -t tunnel_proxy:0.01 .
  2. docker run --name tunnel_proxy --network host -it tunnel_proxy:0.01
运行以后,你会看到 Docker 的命令行似乎卡住了。这是正常请求。因为需要你有了请求,它才会输出内容。


现在,你可以用 Requests 赶快写一段代码来进行验证:


点击(此处)折叠或打开

  1. import requests
  2. import time
  3. proxies = {'http': ''}
  4. for _ in range(10):
  5. resp = requests.get('', proxies=proxies).text
  6. print(resp)
  7. time.sleep(1)

运行效果如下图所示。


配置nginx.config如果出现问题,要根据具体报错信息来解决。


自己搭建隧道代理,实际工作生活中只能拿来练手,毕竟如果是在公司上班,这个要花费很多时间成本去做开发和维护,过程中如果有遇到问题,也需要及时维护,同时也无法保证自己搭建的隧道代理的稳定性,毕竟要考虑的因素实在太多了,是用什么基础搭建的?免费的HTTP代理的可用率、代理服务器的稳定性……


4.隧道代理厂商

当然,市面上的隧道代理厂商也没有多到让人无法挑的地步,主要还是这么几家:

  • 快代理
  • 青果网络
  • 阿布云
  • 熊猫代理
  • 小象代理
  • 亿牛云

这几家产品比较快代理上个月在做周年庆,有打折,不过活动好像马上要结束了。不过不在我的选择范围内,所以也不急就是了。类似阿布云这种比较老派的隧道代理厂商,用着也还行,但是对于整个经济下行的环境,我们现在没有在考虑范围内了,毕竟这一行业的产品只要测试下来效果不错,厂商有正规的那些证,价格又合适那真是神仙厂商了。

PS:像青果网络这种,定时更换周期的,通道数居然是10,和其他家有明显的区别,蛮神奇的。

HTTP代理类型

分类

代表厂商

通道数

并发请求

月费

隧道代理

定时换IP周期

(1分钟)

/

快代理

1

5

272

青果网络

10

5

390

小象代理

1

5

399

熊猫代理

1

5

420

阿布云

1

5

429

亿牛云

1

5

399

动态转发

/

快代理

1

5

388

青果网络

1

5

360

小象代理

1

5

399

熊猫代理

1

5

420

阿布云

1

5

429

亿牛云

1

5

399


我之前有使用过,总体来说效果还可以:


阅读(189) | 评论(0) | 转发(0) |
给主人留下些什么吧!~~