博客
关于我
python简易爬虫
阅读量:189 次
发布时间:2019-02-28

本文共 2474 字,大约阅读时间需要 8 分钟。

爬取喜马来雅男频小说这几本

在这里插入图片描述

import requestsimport reimport csvheaders = {       'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.104 Safari/537.36','Cookie':'testcookie=yes; Hm_lvt_bc3b748c21fe5cf393d26c12b2c38d99=1619717328; Hm_lpvt_bc3b748c21fe5cf393d26c12b2c38d99=1619717328; JJEVER=%7B%22fenzhan%22%3A%22noyq%22%7D; smidV2=20210430012854effd865c944ddc429b0c481dfef3f31d0035c72a77d581610'}class ximalaiyaSpider:    def getSource(self):        # 获取url数据        # 目标url        url = 'https://www.ximalaya.com/channel/7/'        resp = requests.get(url, headers=headers)        resp.encoding='utf-8'        # print(resp.content.decode('utf-8'))        return resp.text    def parseSource(self):        content =self.getSource()        r =re.match(r'.*?(<ul class="_qt">.*?</ul>).*?',content,re.S)        # print(r.group(1))        # #<a class="album-title line-2 lg bold kF_" title="摸金天师(紫襟演播)" href="/youshengshu/4756811/"><span class="album-tag kF_"><i class="xuicon xuicon-wanben album-tag-icon kF_"></i></span><span class="v-m kF_">摸金天师(紫襟演播)</span></a>        a =r.group(1)        a_all=re.findall(r'<a class="album-title line-2 lg bold kF_" title=.*?</a>',a,re.S)        # print(a_all)  #<a class="album-title line-2 lg bold kF_" title="摸金天师(紫襟演播)" href="/youshengshu/4756811/"><span class="album-tag kF_"><i class="xuicon xuicon-wanben album-tag-icon kF_"></i></span><span class="v-m kF_">摸金天师(紫襟演播)</span></a>'        a_titleall=[]        pattern=re.compile(r'<a class="album-title line-2 lg bold kF_" title="(.*?)" href="/(.*?)"><span.*?>.*?</span></a>',re.S)        for i in a_all:            onetitle =pattern.match(i)            # print(type(onetitle.group(1)))#摸金天师(紫襟演播)            # print(onetitle.group(2))            # #[https://www.ximalaya.com/]这段没有要后期拼接url哦,这里group(2)结果是/youshengshu/4756811/            a_titleone=[onetitle.group(1),'https://www.ximalaya.com/'+onetitle.group(2)]            # print(a_titleone)#['"摸金天师(紫襟演播)" ', 'https://www.ximalaya.com/youshengshu/4756811/']            a_titleall.append(a_titleone)        return a_titleall    def saveData(self):        content=self.parseSource()        # 写入csv        with open('喜马来雅.csv','w',encoding='utf-8',newline='')as f:            writer=csv.writer(f)            header1=["作品",'链接']            writer.writerow(header1)            writer.writerows(content)def main():    ximalaiyaSpider().saveData()if __name__ == '__main__':    main()

csv结果:

在这里插入图片描述

转载地址:http://brun.baihongyu.com/

你可能感兴趣的文章
Mysql8在Centos上安装后忘记root密码如何重新设置
查看>>
Mysql8在Windows上离线安装时忘记root密码
查看>>
MySQL8找不到my.ini配置文件以及报sql_mode=only_full_group_by解决方案
查看>>
mysql8的安装与卸载
查看>>
MySQL8,体验不一样的安装方式!
查看>>
MySQL: Host '127.0.0.1' is not allowed to connect to this MySQL server
查看>>
Mysql: 对换(替换)两条记录的同一个字段值
查看>>
mysql:Can‘t connect to local MySQL server through socket ‘/var/run/mysqld/mysqld.sock‘解决方法
查看>>
MYSQL:基础——3N范式的表结构设计
查看>>
MYSQL:基础——触发器
查看>>
Mysql:连接报错“closing inbound before receiving peer‘s close_notify”
查看>>
mysqlbinlog报错unknown variable ‘default-character-set=utf8mb4‘
查看>>
mysqldump 参数--lock-tables浅析
查看>>
mysqldump 导出中文乱码
查看>>
mysqldump 导出数据库中每张表的前n条
查看>>
mysqldump: Got error: 1044: Access denied for user ‘xx’@’xx’ to database ‘xx’ when using LOCK TABLES
查看>>
Mysqldump参数大全(参数来源于mysql5.5.19源码)
查看>>
mysqldump备份时忽略某些表
查看>>
mysqldump实现数据备份及灾难恢复
查看>>
mysqldump数据库备份无法进行操作只能查询 --single-transaction
查看>>