Chinaunix首页 | 论坛 | 博客
  • 博客访问: 4558567
  • 博文数量: 1214
  • 博客积分: 13195
  • 博客等级: 上将
  • 技术积分: 9105
  • 用 户 组: 普通用户
  • 注册时间: 2007-01-19 14:41
个人简介

C++,python,热爱算法和机器学习

文章分类

全部博文(1214)

文章存档

2021年(13)

2020年(49)

2019年(14)

2018年(27)

2017年(69)

2016年(100)

2015年(106)

2014年(240)

2013年(5)

2012年(193)

2011年(155)

2010年(93)

2009年(62)

2008年(51)

2007年(37)

分类: 网络与安全

2012-08-24 19:52:45

    import lxml.etree
    def parse():
        parser = lxml.etree.XMLParser(recover=True)
        tree = lxml.etree.fromstring(content, parser)
        items = tree.xpath('//div[@id="leftNavContainer"]//ul[@data-typeid="n"]//span[@class="refinementLink"]')

        for item in items:
            url = item.xpath('parent::*/@href')[0]

最后一行表达式含义: item 的父节点所有元素中,取出href属性的内容。
parent::[@href] 则只能取出父节点中含有href属性的元素。
阅读(849) | 评论(0) | 转发(0) |
给主人留下些什么吧!~~