python访问需要登录的网页 -G8bao7-ChinaUnix博客

G8bao7的ChinaUnix博客

首页　| 　博文目录　| 　关于我

G8bao7

博客访问： 43365
博文数量： 7
博客积分： 10
博客等级：民兵
技术积分： 15
用户组：普通用户
注册时间： 2012-07-09 15:12

文章分类

全部博文（7）

未分配的博文（7）

文章存档

2015年（2）

2014年（4）

2012年（1）

我的朋友

相关博文

python访问需要登录的网页

分类： Python/Ruby

2014-08-13 15:09:50

原文地址：python访问需要登录的网页作者：lrfgjj2

有些网页需要你登录之后才可以访问,你需要提供账户和密码。

只要在发送http请求时，带上含有正常登陆的cookie就可以了。

1.首先我们要先了解cookie的工作原理。

Cookie是由服务器端生成，发送给User-Agent（一般是浏览器），浏览器会将Cookie的key/value保存到某个目录下的文本文件内，下次请求同一网站时就发送该Cookie给服务器（前提是浏览器设置为启用cookie）。Cookie名称和值可以由服务器端开发自己定义，对于JSP而言也可以直接写入jsessionid，这样服务器可以知道该用户是否合法用户以及是否需要重新登录等。

2.之后我们要获取到用户正常登录的cookie.

python提供了cookieJar的库，只要把cookieJar的实例作为参数传到urllib2的一个opener里面。

然后访问一次登录的页面，cookie就已经保存下来了。之后通过这个实例访问所有的页面都带有正常登陆的cookie了。

以人人网为例子。

#encoding=utf-8
import urllib2
import urllib
import cookielib
def renrenBrower(url,user,password):
    #登陆页面，可以通过抓包工具分析获得，如fiddler，wireshark
    login_page = ""
    try:
        #获得一个cookieJar实例
        cj = cookielib.CookieJar()
        #cookieJar作为参数，获得一个opener的实例
        opener=urllib2.build_opener(urllib2.HTTPCookieProcessor(cj))
        #伪装成一个正常的浏览器，避免有些web服务器拒绝访问。
        opener.addheaders = [('User-agent','Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1)')]
        #生成Post数据，含有登陆用户名密码。
        data = urllib.urlencode({"email":user,"password":password})
        #以post的方法访问登陆页面，访问之后cookieJar会自定保存cookie
        opener.open(login_page,data)
        #以带cookie的方式访问页面
        op=opener.open(url)
        #读取页面源码
        data= op.read()
        return data
    except Exception,e:
        print str(e)
#访问某用户的个人主页，其实这已经实现了人人网的签到功能。
print renrenBrower("","用户名","密码")

阅读(1921) | 评论(0) | 转发(0) |

上一篇：播布客里小布老师的全部视频收集，

下一篇：webpy框架

给主人留下些什么吧！~~

感谢所有关心和支持过ChinaUnix的朋友们

16024965号-6