标签(空格分隔):python爬虫
一、爬取网页,获取需要内容
我们今天要爬取的是豆瓣电影top250
页面如下所示:
![1460000006877726](https://segmentfault.com/img/remote/1460000006877726)
我们需要的是里面的电影分类,通过查看源代码观察可以分析出我们需要的东西。直接进入主题吧!
![1460000006877727](https://segmentfault.com/img/remote/1460000006877727)
知道我们需要的内容在哪里了,接下来就使用我们python强大的request库先获取网页内容下来吧!获取内容后,再使用一个好用的lxml库来分析网页内容,然后获取我们的内容就可以做下一步操作了。
先贴出使用request库和lxml分析的代码
def get_page(i):
url = 'https://movie.douban.com/top250?start={}&filter='.format(i)
html = requests.get(url).content.decode('utf-8') # 使用request库获取网页内容
selector = etree.HTML(html) # 使用lxml库提取内容
'''
通过观察页面就能发现内容在
下的一部分
'''
content = selector.xpath('//div[@class="info"]/div[@class="bd"]/p/text()')
print(content)
for i in content[1::2]:
print(str(i).strip().replace('\n\r', ''))
# print(str(i).split('/'))
i = str(i).split('/')
i = i[len(i) - 1]
key = i.strip().replace('\n', '').split(' ') # 这里的strip和replace的使用目的是去除空格和空行之类
print(key)
通过获取下来的内容我们发现一部电影的各项内容都是用'/'分隔着,我们只需要提取电影分类中的东西,所以我们需要使用
i = str(i).split('/')
来把内容分隔成几项内容,因为电影分类排在最后,所以我们通过
i = i[len(i) - 1]
来获取分隔后的最后一项也就是我们需要的电影分类,还有最后一步我们需要完成的,因为一部电影里面一般都有多个电影分类的标签,所以我们还要继续分隔获取到的电影分类,并且观察可以知道电影分类之间只是用一个空格隔开,所以我们使用下面一行代码就可以分离出各个分类:
key = i.strip().replace('\n',