简易模板

单封家书【译文】内容获取

目标网站:http://ewenyan.com/articles/zgfjs/1.html

待爬取数据分析

确认编码:

因为此网站的文章数据全部放在<p>标签内,并且页面布局都是以<table>标签来布局的。

所以先把所有的<table>标签抓取下来,然后按对应顺序爬取文章。

可以确认爬取数据的位置为第四个<table>标签

完善代码:

提取文本

完善代码-爬取单封家书的译文

目录页

数据分析

http://ewenyan.com/contents/more/zgfjs.html

确定爬取的信息

爬取所有<a>标签

分析链接:

替换链接

排序问题

使用数组列表将数据进行存放

解决排序问题

家书内容存入文件

问题一:编码

解决

问题二:写入文件时的异常

从网页源码能看到,这一篇其实是有「【译文】」的,大概率是网页解析时获取的文本中,「【译文】」前后有多余字符(如空格、换行),或者解析到了广告内容,导致拆分异常

添加异常处理

完整代码