《Python开发简单爬虫》实践笔记-原创手记-慕课网

《Python开发简单爬虫》实践笔记

哈利波特 2017-11-09 22:43:19 浏览 3239

哈利波特

关注TA

手记 2

粉丝 12

获赞 17

非常疯狂的蚂蚁crazyant这位老师的讲解，根据老师的讲解，初步弄懂了爬虫的基本结构和各部分的具体功能，以及分析目标的思路和方法，这个太重要，再次感谢老师，跟老师的视频我敲代码实现了这个人生中第一个Python爬虫，确实非常有意思，再次感谢老师，
根据自己的测试，有3个地方需要调整整之后才可以顺利执行
1、词条页面URL: /item/%E8%AE
原先是/view/41122.htm这种格式，但是百度百度百科已经升级了，原先的无法使用，对应的代码修改为：
links = soup.find_all('a',href=re.compile(r'/item/.*'))

2、获取title的方式有调整
res_data['title'] = title_node.find('h1').get_text()
这样就得到的数据是干净的标题，否则抓取到的数据后面会有“编辑”“收藏”这俩词

3、输出时不需要转utf-8编码
HtmlOutputer类的output_html()方法里面，输出html文件时增加<meta charset="UTF-8">
fout.write("<html><head><meta charset=\"UTF-8\"></head>\n")

相关标签: Python

2人推荐

发表评论