Python爬虫项目，获取所有网站上的新闻，并保存到数据库中，解析html网页等

2023-06-19 17:34•html•阅读 4351

需求：

爬取虎嗅网站的所有新闻，并保存到数据库中。

技术：

1、爬虫

获取服务器的资源（urllib）

解析html网页（BeautifulSoup）

2、数据库技术

数据库 MySQLdb

业务逻辑的分析：

（1）、虎嗅网站的新闻，包括首页和分页信息（下一页）

（2）、需要从首页的资源和分页的资源中获取每个新闻的url连接

如何获取url：

解析网站html文件，如果A标签的href属性包含 article字段，就表示这是一个新闻

（3）访问新闻的url，解析出想要的字段

http://www.woaipu.com/shops/zuzhuan/61406