重庆分公司,新征程启航
为企业提供网站建设、域名注册、服务器等服务
怎么在Python中使用beautifulSoup4爬取数据?很多新手对此不是很清楚,为了帮助大家解决这个难题,下面小编将为大家详细讲解,有这方面需求的人可以来学习下,希望你能有所收获。
创新互联服务项目包括蚌埠网站建设、蚌埠网站制作、蚌埠网页制作以及蚌埠网络营销策划等。多年来,我们专注于互联网行业,利用自身积累的技术优势、行业经验、深度合作伙伴关系等,向广大中小型企业、政府机构等提供互联网行业的解决方案,蚌埠网站推广取得了明显的社会效益与经济效益。目前,我们服务的客户以成都为中心已经辐射到蚌埠省份的部分城市,未来相信会继续扩大服务区域并继续获得客户的支持与信任!具体如下:
#! /usr/bin/python3 # -*- coding:utf-8 -*- from urllib.request import urlopen as open from bs4 import BeautifulSoup import re import pymysql def find_top_ten(url): response = open(url) bs = BeautifulSoup(response,'html.parser') tags = bs.select('span.tag-item a') top_ten_href = [tag.get('href') for tag in tags] top_ten_tag = [tag.text for tag in tags] # print(top_ten_href) # print(top_ten_tag) return top_ten_href def insert_into_mysql(records): con = pymysql.connect(host='localhost',user='root',password='root',database='quotes',charset='utf8',port=3306) cursor = con.cursor() sql = "insert into quotes(content,author,tags) values(%s,%s,%s)" for record in records: cursor.execute(sql, record) con.commit() cursor.close() con.close() # http://quotes.toscrape.com/tag/love/ #要获取对应标签中所有的名言 所以这里要考虑分页的情况 #经过在网页上查看知道分页查询的url #http://quotes.toscrape.com/tag/love/page/1/ #判断到那一页没有数据 div.container div.row [1] def find_link_content(link): page = 1 while True: new_link = "http://quotes.toscrape.com" + link + "page/" # print(new_link) new_link = new_link + str(page) print(new_link) sub_bs = open(new_link) sub_bs = BeautifulSoup(sub_bs,'html.parser') quotes = sub_bs.select('div.row div.col-md-8 span.text') # 如果没有数据就退出 if len(quotes) == 0: break #名言 quotes = [quote.text.strip('“”') for quote in quotes] #作者 authors = sub_bs.select('small.author') authors = [author.text for author in authors] # 标签 tags_list = sub_bs.select('meta.keywords') tags_list = [tags.get('content') for tags in tags_list] # print(authors) # print(quotes) #print(tags_list) record_list = [] for i in range(len(quotes)): tags = tags_list[i] tags = tags.replace(',',',') print(tags) record = [quotes[i],authors[i],tags] record_list.append(record) insert_into_mysql(record_list) page += 1 # def main(): url = "http://quotes.toscrape.com/" parent_link = find_top_ten(url) for link in parent_link: print(link) find_link_content(link) if __name__ == '__main__': main()
看完上述内容是否对您有帮助呢?如果还想对相关知识有进一步的了解或阅读更多相关文章,请关注创新互联成都网站设计公司行业资讯频道,感谢您对创新互联成都网站设计公司的支持。
另外有需要云服务器可以了解下创新互联scvps.cn,海内外云服务器15元起步,三天无理由+7*72小时售后在线,公司持有idc许可证,提供“云服务器、裸金属服务器、网站设计器、香港服务器、美国服务器、虚拟主机、免备案服务器”等云主机租用服务以及企业上云的综合解决方案,具有“安全稳定、简单易用、服务可用性高、性价比高”等特点与优势,专为企业上云打造定制,能够满足用户丰富、多元化的应用场景需求。