Chinaunix首页 | 论坛 | 博客
  • 博客访问: 460242
  • 博文数量: 141
  • 博客积分: 211
  • 博客等级: 入伍新兵
  • 技术积分: 1049
  • 用 户 组: 普通用户
  • 注册时间: 2010-09-17 16:25
个人简介

如此经年,望尽千帆。

文章分类

全部博文(141)

文章存档

2014年(73)

2013年(65)

2012年(3)

我的朋友

分类: PHP

2014-04-13 15:36:43

使用的cURL库可以简单和有效地去抓网页。
只需要运行一个脚本,然后分析一下你所抓取的网页,然后就可以以程序的方式得到你想要的数据了

无论是你想从从一个链接上取部分数据,或是取一个XML文件并把其导入数据库,那怕就是简单的获取网页内容,cURL 是一个功能强大的PHP库。
PHP中的CURL函数库(Client URL Library Function)
curl_close — 关闭一个curl会话
curl_copy_handle — 拷贝一个curl连接资源的所有内容和参数
curl_errno — 返回一个包含当前会话错误信息的数字编号
curl_error — 返回一个包含当前会话错误信息的字符串
curl_exec — 执行一个curl会话
curl_getinfo — 获取一个curl连接资源句柄的信息
curl_init — 初始化一个curl会话
curl_multi_add_handle — 向curl批处理会话中添加单独的curl句柄资源
curl_multi_close — 关闭一个批处理句柄资源
curl_multi_exec — 解析一个curl批处理句柄
curl_multi_getcontent — 返回获取的输出的文本流
curl_multi_info_read — 获取当前解析的curl的相关传输信息
curl_multi_init — 初始化一个curl批处理句柄资源
curl_multi_remove_handle — 移除curl批处理句柄资源中的某个句柄资源
curl_multi_select — Get all the sockets associated with the cURL extension, which can then be "selected"
curl_setopt_array — 以数组的形式为一个curl设置会话参数
curl_setopt — 为一个curl设置会话参数
curl_version — 获取curl相关的版本信息
curl_init()函数的作用初始化一个curl会话,curl_init()函数唯一的一个参数是可选的,表示一个url地址。
curl_exec()函数的作用是执行一个curl会话,唯一的参数是curl_init()函数返回的句柄。
curl_close()函数的作用是关闭一个curl会话,唯一的参数是curl_init()函数返回的句柄。
例子一: 基本例子
基本例子
  1. <?php
  2. // 初始化一个 cURL 对象
  3. $curl = curl_init();
  4. // 设置你需要抓取的URL
  5. curl_setopt($curl, CURLOPT_URL, '');
  6. // 设置header
  7. curl_setopt($curl, CURLOPT_HEADER, 1);
  8. // 设置cURL 参数,要求结果保存到字符串中还是输出到屏幕上。
  9. curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);
  10. // 运行cURL,请求网页
  11. $data = curl_exec($curl);
  12. // 关闭URL请求
  13. curl_close($curl);
  14. // 显示获得的数据
  15. var_dump($data);
  16. ?>
例子二: POST数据
sendSMS.php,其可以接受两个表单域,一个是电话号码,一个是短信内容。
POST数据
  1. <?php
  2. $phoneNumber = '13812345678';
  3. $message = 'This message was generated by curl and php';
  4. $curlPost = 'pNUMBER=' . urlencode($phoneNumber) . '&MESSAGE=' . urlencode($message) . '&SUBMIT=Send';
  5. $ch = curl_init();
  6. curl_setopt($ch, CURLOPT_URL, ' /sendSMS.php');
  7. curl_setopt($ch, CURLOPT_HEADER, 1);
  8. curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
  9. curl_setopt($ch, CURLOPT_POST, 1);
  10. curl_setopt($ch, CURLOPT_POSTFIELDS, $curlPost);
  11. $data = curl_exec();
  12. curl_close($ch);
  13. ?>
例子三:使用代理服务器
使用代理服务器
  1. <?php 
  2. $ch = curl_init();
  3. curl_setopt($ch, CURLOPT_URL, '');
  4. curl_setopt($ch, CURLOPT_HEADER, 1);
  5. curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
  6. curl_setopt($ch, CURLOPT_HTTPPROXYTUNNEL, 1);
  7. curl_setopt($ch, CURLOPT_PROXY, 'proxy.lxvoip.com:1080');
  8. curl_setopt($ch, CURLOPT_PROXYUSERPWD, 'user:password');
  9. $data = curl_exec();
  10. curl_close($ch);
  11. ?>
例子四: 模拟登录
Curl 模拟登录 discuz 程序,适合DZ7.0,将username改成你的用户名,userpass改成你的密码就可以了.
Curl 模拟登录 discuz 程序

  1. <?php
  2. !extension_loaded('curl') && die('The curl extension is not loaded.');

  3. $discuz_url = '';//论坛地址 
  4. $login_url = $discuz_url .'/logging.php?action=login';//登录页地址
  5. $get_url = $discuz_url .'/my.php?item=threads'; //我的帖子

  6. $post_fields = array();
  7. //以下两项不需要修改
  8. $post_fields['loginfield'] = 'username';
  9. $post_fields['loginsubmit'] = 'true';
  10. //用户名和密码,必须填写
  11. $post_fields['username'] = 'lxvoip';
  12. $post_fields['password'] = '88888888';
  13. //安全提问
  14. $post_fields['questionid'] = 0;
  15. $post_fields['answer'] = '';
  16. //@todo验证码
  17. $post_fields['seccodeverify'] = '';

  18. //获取表单FORMHASH 
  19. $ch = curl_init($login_url);
  20. curl_setopt($ch, CURLOPT_HEADER, 0);
  21. curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
  22. $contents = curl_exec($ch);
  23. curl_close($ch);
  24. preg_match('//i', $contents, $matches);
  25. if(!empty($matches)) {
  26.     $formhash = $matches[1];
  27. } else {
  28.     die('Not found the forumhash.');
  29. }

  30. //POST数据,获取COOKIE 
  31. $cookie_file = dirname(__FILE__) . '/cookie.txt';
  32. //$cookie_file = tempnam('/tmp');
  33. $ch = curl_init($login_url);
  34. curl_setopt($ch, CURLOPT_HEADER, 0);
  35. curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
  36. curl_setopt($ch, CURLOPT_POST, 1);
  37. curl_setopt($ch, CURLOPT_POSTFIELDS, $post_fields);
  38. curl_setopt($ch, CURLOPT_COOKIEJAR, $cookie_file);
  39. curl_exec($ch);
  40. curl_close($ch);

  41. //带着上面得到的COOKIE获取需要登录后才能查看的页面内容
  42. $ch = curl_init($get_url);
  43. curl_setopt($ch, CURLOPT_HEADER, 0);
  44. curl_setopt($ch, CURLOPT_RETURNTRANSFER, 0);
  45. curl_setopt($ch, CURLOPT_COOKIEFILE, $cookie_file);
  46. $contents = curl_exec($ch);
  47. curl_close($ch);
  48. var_dump($contents);
阅读(827) | 评论(0) | 转发(1) |
给主人留下些什么吧!~~