CUBlog的备份脚本-centrify-ChinaUnix博客

万事开头难！加油！centrify.blog.chinaunix.net

首页　| 　博文目录　| 　关于我

centrify

博客访问： 1495797
博文数量： 246
博客积分： 3353
博客等级：中校
技术积分： 3295
用户组：普通用户
注册时间： 2011-11-09 17:56

个人简介

精通测试技术，linux，shell，性能测试

文章分类

全部博文（246）

性能测试（1）
可靠性测试（0）
安全测试（0）
接口测试（3）

jmeter（1）

postman学习（2）
Financial（1）
Testing（4）
Article（5）

Excel VBA（0）
Office（1）

Word（0）

Excel（1）
Tools（1）
SilkTest（0）
DB2（2）
AutoHotkey（3）
JavaScripts（0）
VBscripts（0）
Lua（0）
Sqlite（1）
PostgreSQL（5）
PAM/NSS（1）
WinDbg（1）
PowerShell（1）
Performance （1）
C/C++（6）
QTP（0）
LoadRunner9.（0）
TestComplete（1）
Selenium（1）
ruby（1）
Unix/Linux（38）

docker（1）

信创系统（1）

Ubuntu（1）

FreeBSD（0）

linux（8）

solaris（2）

hpux（2）

aix（6）
Shell（45）
Tcl（14）

Expect（0）

系统学习TCL脚本（12）
Perl（6）

系统学习perl脚本（4）
Python（7）

tkinter（2）
Apple script（0）
Windows（31）

DosScripts（1）

windows7/8（3）

windows xp（2）

Hyper-V（1）

Mircosoft office（2）

Active directory（8）

Service 2k8 R2（9）
Network Ope（38）

NIS/NIS++（2）

VM（0）

VNC（0）

network（4）

stress test（2）

sco unixware（1）

ssh/telnet（17）

openldap（3）
stock（1）
QEMU（2）
Virtualbox（1）
Web（1）
Mysql（2）
lifeAndWork（4）
未分配的博文（16）

文章存档

2024年（3）

2023年（7）

2022年（7）

2021年（4）

2020年（1）

2019年（2）

2017年（2）

2016年（3）

2015年（11）

2014年（20）

2013年（10）

2012年（176）

我的朋友

最近访客

推荐博文

CUBlog的备份脚本

分类：

2012-06-13 22:27:56

原文地址：CUBlog的备份脚本作者：xiaosuo

虽然建议CUBlog增加Blog打包备份的呼声一直没有停歇过，但是由于种种原因这个愿望一直都未能达成。他们的忙我们还是可以理解的，因为他们也都是义工。俗话说：“求人不如求己”。故出现了这个简单的备份脚本cubk：

#!/bin/env python
# Copyright (c) xiaosuo
# License GPL v2 or above.

import sys
import getopt
import urllib2
import re
import urlparse
import string
import distutils.dir_util
import htmllib
import formatter

class UrlQueue:
        def __init__(self, baseUrl):
                self.base = baseUrl[0:baseUrl.rfind("/") + 1]
                self.finished = []
                self.pending = []

        def hasPending(self):
                if len(self.pending) > 0:
                        return True
                else:
                        return False

        def baseUrl(self):
                return self.base

        def pop(self):
                url = self.pending.pop()
                self.finished.append(url)
                return url

        def append(self, url):
                absUrl = urlparse.urljoin(self.base, url)
                baseUrlLen = len(self.base)
                if len(absUrl) <= baseUrlLen or absUrl[0:baseUrlLen] != self.base:
                        return False
                url = absUrl[baseUrlLen:]
                for e in self.finished:
                        if (url == e):
                                return False
                for e in self.pending:
                        if (url == e):
                                return False
                self.pending.append(url)
                return True

class UrlFilter(htmllib.HTMLParser):
        def __init__(self):
                htmllib.HTMLParser.__init__(self, formatter.NullFormatter())
                self.hrefList = []

        def anchor_bgn(self, href, name, type):
                self.hrefList.append(href)

        def clear(self):
                self.hrefList = []

class Grabber:
        def __init__(self, initUrl):
                self.initUrl = initUrl
                self.urlQueue = UrlQueue(initUrl)
                self.urlFilter = UrlFilter()

        def run(self):
                self.urlQueue.append(self.initUrl)
                i = 0
                while True:
                        listUrl = "article_0_%d.html" % i
                        absUrl = urlparse.urljoin(self.urlQueue.baseUrl(), listUrl)
                        print "Fetching %s" % absUrl
                        page = urllib2.urlopen(absUrl).read()
                        self.urlFilter.clear()
                        self.urlFilter.feed(page)
                        self.urlFilter.close()
                        valid = False
                        for url in self.urlFilter.hrefList:
                                self.urlQueue.append(url)
                                if url[0:8] == "showart_":
                                        valid = True
                        if not valid:
                                break
                        file(listUrl, "w").write(page)
                        i = i + 1
                while self._grab():
                        pass

        def _grab(self):
                if not self.urlQueue.hasPending():
                        return False
                url = self.urlQueue.pop()
                absUrl = urlparse.urljoin(self.urlQueue.baseUrl(), url)
                print "Fetching %s" % absUrl
                page = urllib2.urlopen(absUrl).read()
                pos = url.rfind("/")
                if pos != -1:
                        distutils.dir_util.mkpath(url[0:pos])
                file(url, "w").write(page)
                pos = url.rfind(".")
                if pos == -1:
                        return True
                if string.lower(url[pos+1:pos+4]) != "htm":
                        return True
                self.urlFilter.clear()
                self.urlFilter.feed(page)
                self.urlFilter.close()
                for url in self.urlFilter.hrefList:
                        self.urlQueue.append(url)
                return True

def showHelp(prg):
        print "CUBlog backup script.\n"
        print "Usage: %s [option]... initUrl" % prg
        print "Options:"
        print " -h, --help            Show the help information"

if __name__ == "__main__":
        baseUrl = "";

        # parse the arguments
        try:
                (opts, args) = getopt.getopt(sys.argv[1:], "h", \
                                ["help"])
        except getopt.GetoptError:
                print "Wrong command line arguments."
                showHelp(sys.argv[0])
                sys.exit(1)
        for (o, a) in opts:
                if o in ("-h", "--help"):
                        showHelp(sys.argv[0])
                        sys.exit(0)
        if len(args) == 0:
                showHelp(sys.argv[0])
                sys.exit(1)
        url = args[0]
        if url.rfind("/") == len(url) - 1:
                url += "index.html"
        Grabber(url).run()

用法示例:

xiaosuo@gentux python $ ./cubk http://blog.chinaunix.net/u/5251/

注意:
这个脚本只对新版的CUBlog主题有效，如果是旧版请看这里。

阅读(1450) | 评论(0) | 转发(0) |

上一篇：python 不定个数的参数传递

下一篇：个人总结tcl addbug技巧

给主人留下些什么吧！~~

感谢所有关心和支持过ChinaUnix的朋友们

16024965号-6