Chinaunix首页 | 论坛 | 博客
  • 博客访问: 641665
  • 博文数量: 227
  • 博客积分: 8017
  • 博客等级: 中将
  • 技术积分: 2069
  • 用 户 组: 普通用户
  • 注册时间: 2007-12-08 22:50
文章分类

全部博文(227)

文章存档

2011年(10)

2010年(55)

2009年(28)

2008年(134)

我的朋友

分类: LINUX

2008-05-27 00:00:02

linux环境下的"蚂蚁"-wget使用简介 
wget的使用形式是:
wget [参数列表] URL
1. 首先来介绍一下wget的主要参数:
  • -b:让wget在后台运行,记录文件写在当前目录下"wget-log"文件中;
  • -t [nuber of times]:尝试次数,当wget无法与服务器建立连接时,尝试连接多少次。比如"-t 120"表示尝试120次。当这一项为"0"的时候,指定尝试无穷多次直到连接成功为止,这个设置非常有用,当对方服务器突然关机或者网络突然中断的时候,可以在恢复正常后继续下载没有传完的文件; 
  • -c:断点续传,这也是个非常有用的设置,特别当下载比较大的文件的时候,如果中 途意外中断,那么连接恢复的时候会从上次没传完的地方接着传,而不是又从头开始,使 用这一项需要远程服务器也支持断点续传,一般来讲,基于UNIX/Linux的Web/FTP服务器都支持断点续传; 
  • -T [number of seconds]:超时时间,指定多长时间远程服务器没有响应就中断连接,开始下一次尝试。比如"-T 120"表示如果120秒以后远程服务器没有发过来数据,就重新尝试连接。如果网络速度比较快,这个时间可以设置的短些,相反,可以设置的长一些,一般最多不超过900,通常也不少于60,一般设置在120左右比较合适; 
  • -w [number of seconds]:在两次尝试之间等待多少秒,比如"-w 100"表示两次尝试之间等待100秒; 
  • -Y on/off:通过/不通过代理服务器进行连接; 
  • -Q [byetes]:限制下载文件的总大小最多不能超过多少,比如"-Q2k"表示不能超过2K字节,"-Q3m"表示最多不能超过3M字节,如果数字后面什么都不加,就表示是以字节为单位,比如"-Q200"表示最多不能超过200字节; 
  • -nd:不下载目录结构,把从服务器所有指定目录下载的文件都堆到当前目录里;  
  • -x:与"-nd"设置刚好相反,创建完整的目录结构,例如"wget -nd " 将创建在当前目录下创建""子目录,然后按照服务器 实际的目录结构一级一级建下去,直到所有的文件都传完为止; 
  • -nH:不创建以目标主机域名为目录名的目录,将目标主机的目录结构直接下到当前目录下
  • --http-user=username 
  • --http-passwd=password:如果Web服务器需要指定用户名和口令,用这两项来设定; 
  • --proxy-user=username 
  • --proxy-passwd=password:如果代理服务器需要输入用户名和口令,使用这两个选项; 
  • -r:在本机建立服务器端目录结构; 
  • -l [depth]:下载远程服务器目录结构的深度,例如"-l 5"下载目录深度小于或者等于5以内的目录结构或者文件;  
  • -m:做站点镜像时的选项,如果你想做一个站点的镜像,使用这个选项,它将自动设定其他合适的选项以便于站点镜像; 
  • -np:只下载目标站点指定目录及其子目录的内容。这也是一个非常有用的选项,我们假设某个人的个人主页里面有一个指向这个站点其他人个人主页的连接,而我们只想下载这个人的个人主页,如果不设置这个选项,甚至--有可能把整个站点给抓下来,这显然是我们通常不希望的;
2. 如何设定wget所使用的代理服务器
wget可以使用用户设置文件".wgetrc"来读取很多设置,我们这里主要利用这个文件来是设置代理服务器。使用者用什么用户登录,那么什么用户主目录下的".wgetrc"文件就起作用。例如,"root"用户如果想使用".wgetrc"来设置代理服务器,"/root/.wgert"就起作用,下面给出一个".wgetrc"文件的内容,读者可以参照这个例子来编写自己的"wgetrc"文件:
    http-proxy = 111.111.111.111:8080
    ftp-proxy = 111.111.111.111:8080
这两行的含义是,代理服务器IP地址为:111.111.111.111,端口号为:80。第一行指定HTTP协议所使用的代理服务器,第二行指定FTP协议所使用的代理服务器。

3. 具体用法
    a) 用wget做站点镜像:
   
wget -r -p -np -k ~usr_name/
#或者
wget -m
    b) 在不稳定的网络上下载一个部分下载的文件,以及在空闲时段下载
   
wget -t 0 -w 31 -c BBC.avi -o down.log &
#或者从filelist读入要下载的文件列表
wget -t 0 -w 31 -c -B ftp://dsec.pku.edu.cn/linuxsoft -i filelist.txt -o down.log &
    上面的代码还可以用来在网络比较空闲的时段进行下载。我的用法是:在mozilla中将不方便当时下载的URL链接拷贝到内存中然后粘贴到文件filelist.txt中,在晚上要出去系统前执行上面代码的第二条。   
   
    c) 使用代理下载
   
wget -Y on -p -k
   
    d) 代理可以在环境变量或wgetrc文件中设定
   
#在环境变量中设定代理
export PROXY=
#在~/.wgetrc中设定代理
http_proxy =
ftp_proxy =
   
    f)wget各种选项分类列表
    • 启动
      -V,  --version           显示wget的版本后退出
        -h,  --help              打印语法帮助
        -b,  --background        启动后转入后台执行
        -e,  --execute=COMMAND   执行`.wgetrc'格式的命令,wgetrc格式参见/etc/wgetrc或~/.wgetrc
    • 记录和输入文件
      -o,  --output-file=FILE           把记录写到FILE文件中
        -a,  --append-output=FILE             把记录追加到FILE文件中
        -d,  --debug                                    打印调试输出
        -q,  --quiet                                     安静模式(没有输出)
        -v,  --verbose                                 冗长模式(这是缺省设置)
        -nv, --non-verbose                         关掉冗长模式,但不是安静模式
        -i,  --input-file=FILE                      下载在FILE文件中出现的URLs
        -F,  --force-html                             把输入文件当作HTML格式文件对待
        -B,  --base=URL                            将URL作为在-F -i参数指定的文件中出现的相对链接的前缀
             --sslcertfile=FILE                   可选客户端证书
             --sslcertkey=KEYFILE            可选客户端证书的KEYFILE
             --egd-file=FILE                         指定EGD socket的文件名
    • 下载
      --bind-address=ADDRESS             指定本地使用地址(主机名或IP,当本地有多个IP或名字时使用)
      -t,  --tries=NUMBER                      设定最大尝试链接次数(0 表示无限制).
      -O   --output-document=FILE       把文档写到FILE文件中
      -nc, --no-clobber                          不要覆盖存在的文件或使用.#前缀
      -c,  --continue                              接着下载没下载完的文件
          --progress=TYPE                   设定进程条标记
      -N,  --timestamping                     不要重新下载文件除非比本地文件新
      -S,  --server-response                 打印服务器的回应
          --spider                                 不下载任何东西
      -T,  --timeout=SECONDS              设定响应超时的秒数
      -w,  --wait=SECONDS                  两次尝试之间间隔SECONDS秒
           --waitretry=SECONDS          在重新链接之间等待1...SECONDS秒
           --random-wait                      在下载之间等待0...2*WAIT秒
      -Y,  --proxy=on/off                      打开或关闭代理
      -Q,  --quota=NUMBER                 设置下载的容量限制
      --limit-rate=RATE                        限定下载输率
    • 目录
        -nd  --no-directories                   不创建目录
        -x,  --force-directories                强制创建目录
        -nH, --no-host-directories          不创建主机目录
        -P,  --directory-prefix=PREFIX    将文件保存到目录 PREFIX/...
               --cut-dirs=NUMBER              忽略 NUMBER层远程目录
    • HTTP 选项
             --http-user=USER               设定HTTP用户名为 USER.
             --http-passwd=PASS          设定http密码为 PASS.
             -C,  --cache=on/off             允许/不允许服务器端的数据缓存 (一般情况下允许).
             -E,  --html-extension          将所有text/html文档以.html扩展名保存
               --ignore-length            忽略 `Content-Length'头域
               --header=STRING        在headers中插入字符串 STRING
                   --proxy-user=USER      设定代理的用户名为 USER
                   --proxy-passwd=PASS   设定代理的密码为 PASS
                   --referer=URL              在HTTP请求中包含 `Referer: URL'头
          -s,  --save-headers            保存HTTP头到文件
          -U,  --user-agent=AGENT   设定代理的名称为 AGENT而不是 Wget/VERSION.
                  --no-http-keep-alive     关闭 HTTP活动链接 (永远链接).
                  --cookies=off               不使用 cookies.
                  --load-cookies=FILE    在开始会话前从文件 FILE中加载cookie
                  --save-cookies=FILE   在会话结束后将 cookies保存到 FILE文件中
    • FTP 选项
        -nr, --dont-remove-listing          不移走 `.listing'文件
        -g,  --glob=on/off                      打开或关闭文件名的 globbing机制
            --passive-ftp                      使用被动传输模式 (缺省值).
               --active-ftp                       使用主动传输模式
            --retr-symlinks                  在递归的时候,将链接指向文件(而不是目录)
    • 递归下载
       -r,  --recursive               递归下载--慎用!
       -l,  --level=NUMBER       最大递归深度 (inf 或 0 代表无穷).
             --delete-after           在现在完毕后局部删除文件
      -k,  --convert-links         转换非相对链接为相对链接
      -K,  --backup-converted   在转换文件X之前,将之备份为 X.orig
      -m,  --mirror                   等价于 -r -N -l inf -nr.
      -p,  --page-requisites    下载显示HTML文件的所有图片
    • 递归下载中的包含和不包含(accept/reject)
      -A,  --accept=LIST                         分号分隔的被接受扩展名的列表
        -R,  --reject=LIST                          分号分隔的不被接受的扩展名的列表
        -D,  --domains=LIST                     分号分隔的被接受域的列表
            --exclude-domains=LIST        分号分隔的不被接受的域的列表
            --follow-ftp                            跟踪HTML文档中的FTP链接
            --follow-tags=LIST                分号分隔的被跟踪的HTML标签的列表
        -G,  --ignore-tags=LIST               分号分隔的被忽略的HTML标签的列表
        -H,  --span-hosts                        当递归时转到外部主机
        -L,  --relative                              仅仅跟踪相对链接
        -I,  --include-directories=LIST     允许目录的列表
        -X,  --exclude-directories=LIST   不被包含目录的列表
        -np, --no-parent                         不要追溯到父目录
 

阅读(1629) | 评论(0) | 转发(0) |
0

上一篇:面试题收集

下一篇:Linux内核启动参数

给主人留下些什么吧!~~