Web前端的知识:HTML, CSS, JavaScript, DOM, DHTML, Ajax, jQuery,json等;
正则表达式,能提取正常一般网页中想要的信息,比如某些特殊的文字,链接信息,知道什么是懒惰,什么是贪婪型的正则;
会使用re, BeautifulSoup,XPath等获取一些DOM结构中的节点信息;
能分析简单网站的结构,会使用urllib或requests库进行简单的数据抓取;
了解什么是Hash,会使用简单的MD5,SHA1等算法对数据进行Hash以便存储;
熟悉HTTP,HTTPS协议的基础知识,了解GET,POST方法,了解HTTP头中的信息,包括返回状态码,编码,user-agent,cookie,session等;
能设置User-Agent进行数据爬取,设置代理等;
知道什么是Request,什么是Response,会使用Fiddler, Wireshark等工具抓取及分析简单的网络数据包;对于动态爬虫,要学会分析Ajax请求,模拟制造Post数据包请求,抓取客户端session等信息,对于一些简单的网站,能够通过模拟数据包进行自动登录;
对于比较难搞定的网站,学会使用浏览器+selenium抓取一些动态网页信息;
豆瓣读书爬虫。可以爬下豆瓣读书标签下的所有图书,按评分排名依次存储,存储到Excel中,可方便大家筛选搜罗,比如筛选评价人数>1000的高分书籍;可依据不同的主题存储到Excel不同的Sheet ,采用User Agent伪装为浏览器进行爬取,并加入随机延时来更好的模仿浏览器行为,避免爬虫被封。
爬取网易云音乐,酷狗音乐歌曲,所有歌曲的评论。