Chinaunix首页 | 论坛 | 博客
  • 博客访问: 36737
  • 博文数量: 5
  • 博客积分: 275
  • 博客等级: 二等列兵
  • 技术积分: 90
  • 用 户 组: 普通用户
  • 注册时间: 2009-09-01 14:31
文章分类
文章存档

2014年(1)

2010年(2)

2009年(2)

我的朋友

分类:

2010-08-19 14:38:04

      如有转载请注明出处:孔祥文博客http://kswapd.cublog.cn

    利用php强大的网络内容处理函数将指定的网站上的所有图片抓取下来,保存在当前目录下,此程序实现了网页源代码捕获,图片链接获取、分析、并将同样的图片链接合并功能,实现了简单的图片抓取功能。以下为代码



#! /usr/local/bin/php
<?php
/*完成网页内容捕获功能*/
function get_img_url($site_name)
{
    $site_fd = fopen($site_name, "r");
    $site_content = "";
    while (!feof($site_fd)) {
        $site_content .= fread($site_fd, 1024);
    }
   /*利用正则表达式得到图片链接*/
    $reg_tag = '//';
    $ret = preg_match_all($reg_tag, $site_content, $match_result);
    fclose($site_fd);
    return $match_result[1];
}

/* 对图片链接进行修正 */
function revise_site($site_list, $base_site)
{
    foreach($site_list as $site_item) {
        if (preg_match('/^http/', $site_item)) {
            $return_list[] = $site_item;
        }else{
            $return_list[] = $base_site."/".$site_item;
    }
    }
    return $return_list;
}

/*得到图片名字,并将其保存在指定位置*/
function get_pic_file($pic_url_array, $pos)
{
    $reg_tag = '/.*\/(.*?)$/';
    $count = 0;
    foreach($pic_url_array as $pic_item){
        $ret = preg_match_all($reg_tag,$pic_item,$t_pic_name);
        $pic_name = $pos.$t_pic_name[1][0];
        $pic_url = $pic_item;
    print("Downloading ".$pic_url."\n");
        $img_read_fd = fopen($pic_url,"r");
        $img_write_fd = fopen($pic_name,"w");
        $img_content = "";
        while(!feof($img_read_fd)){
            $img_content .= fread($img_read_fd,1024);
          
        }
        fwrite($img_write_fd,$img_content);
        fclose($img_read_fd);
        fclose($img_write_fd);
        print("[OK]\n");
    }
    return 0;
}

function main()
{
/* 待抓取图片的网页地址 */
    $site_name = "http://image.cn.yahoo.com";
    $img_url = get_img_url($site_name);
    $img_url_revised = revise_site($img_url, $site_name);
    $img_url_unique = array_unique($img_url_revised); //unique array
    get_pic_file($img_url_unique,"./");
}

main();
?>

    此程序略有不足,如果图片在网站服务器上不同目录下但文件名是相同的,此时图片有可能是不一样的,但在最后保存时,后面得到的图片会将前面已经保存的图片覆盖掉,如在网站上有图片链接pic/test1.jpg和pic/new/test1.jpg那么在下载时这两张图片只有一张保存,另一张就被覆盖掉,修正的方法是在每次保存前先检索当前目录下是否已有此文件名,有的话对将要保存的图片重新命名即可。
阅读(1026) | 评论(0) | 转发(0) |
给主人留下些什么吧!~~