python爬虫scrapy框架的梨视频案例解析

脚本专栏 2024/11/16 佚名

3 1 2

之前我们使用lxml对梨视频网站中的视频进行了下载，感兴趣的朋友点击查看吧。

下面我用scrapy框架对梨视频网站中的视频标题和视频页中对视频的描述进行爬取

分析：我们要爬取的内容并不在同一个页面，视频描述内容需要我们点开视频，跳转到新的url中才能获取，我们就不能在一个方法中去解析我们需要的不同内容

1.爬虫文件

这里我们可以仿照爬虫文件中的parse方法，写一个新的parse方法，可以将新的url的响应对象传给这个新的parse方法
如果需要在不同的parse方法中使用同一个item对象，可以使用meta参数字典，将item传给callback回调函数
爬虫文件中的parse需要yield的Request请求，而item则在新的parse方法中使用yield item传给下一个parse方法或管道文件

import scrapy

# 从items.py文件中导入BossprojectItem类
from bossProject.items import BossprojectItem

class BossSpider(scrapy.Spider):
 name = 'boss'
 # allowed_domains = ['www.xxx.com']
 start_urls = ['https://www.pearvideo.com/category_5']

 # 回调函数接受响应对象，并且接受传递过来的meata参数
 def content_parse(self,response):
 # meta参数包含在response响应对象中，调用meta，然后根据键值取出对应的值:item
 item = response.meta['item']

 # 解析视频链接中的对视频的描述
 des = response.xpath('//div[@class="summary"]/text()').extract()
 des = "".join(des)
 item['des'] = des

 yield item 

 # 解析首页视频的标题以及视频的链接
 def parse(self, response):
 li_list = response.xpath('//div[@id="listvideoList"]/ul/li')
 for li in li_list:
  href = li.xpath('./div/a/@href').extract()
  href = "https://www.pearvideo.com/" + "".join(href)

  title = li.xpath('./div[1]/a/div[2]/text()').extract()
  title = "".join(title)

  item = BossprojectItem()
  item["title"] = title

  #手动发送请求，并将响应对象传给回调函数
  #请求传参:meta={}，可以将meta字典传递给请求对应的回调函数
  yield scrapy.Request(href,callback=self.content_parse,meta={'item':item})

2.items.py

要将BossprojectItem类导入爬虫文件中才能够创建item对象

import scrapy
class BossprojectItem(scrapy.Item):
 # define the fields for your item here like:
 # name = scrapy.Field()
 # 定义了item属性
 title = scrapy.Field()
 des = scrapy.Field()

3.pipelines.py

open_spider(self,spider)和close_spider(self,spider)重写这两个父类方法，且这两个方法都只执行一次在process_item方法中最好保留return item，因为如果存在多个管道类，return item会自动将item对象传给优先级低于自己的管道类

from itemadapter import ItemAdapter
class BossprojectPipeline:

 def __init__(self):
 self.fp = None

 # 重写父类方法，只调用一次
 def open_spider(self,spider):
 print("爬虫开始")
 self.fp = open('./lishipin.txt','w')

 # 接受爬虫文件中yield传递来的item对象，将item中的内容持久化存储
 def process_item(self, item, spider):
 self.fp.write(item['title'] + '\n\t' + item['des'] + '\n')

 # 如果有多个管道类，会将item传递给下一个管道类
 # 管道类的优先级取决于settings.py中的ITEM_PIPELINES属性中对应的值
  ## ITEM_PIPELINES = {'bossProject.pipelines.BossprojectPipeline': 300,} 键值中的值越小优先级越高
 return item

 # 重写父类方法，只调用一次
 def close_spider(self,spider): 
 self.fp.close()
 print("爬虫结束")

4.进行持久化存储

python爬虫scrapy框架,python爬虫scrapy框架梨视频,python爬虫梨视频

华山资源网 Design By www.eoogi.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

华山资源网 Design By www.eoogi.com

评论“python爬虫scrapy框架的梨视频案例解析”

暂无评论...

www.eoogi.com 华山资源网

120,135影音资源

344,641技术资源

22,817软件资源

435,032站长资源

最新文章

庄心妍《我也许在等候》[低速原抓WAV+CUE]

2024/11/16

王雅洁《小调歌后2》[原抓WAV+CUE]

2024/11/16

中国武警男声合唱团《辉煌之声1天路》[DTS-

2024/11/16

紫薇《旧曲新韵》[320K/MP3][175.29MB]

2024/11/16

紫薇《旧曲新韵》[FLAC/分轨][550.18MB]

2024/11/16

一句话新闻

苹果官宣WWDC 2024！预计会有大批AI功能 - 2024/11/16

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

python爬虫scrapy框架的梨视频案例解析

1.爬虫文件

2.items.py

3.pipelines.py

4.进行持久化存储

python爬虫线程池案例详解(梨视频短视频爬取)

Keras保存模型并载入模型继续训练的实现

评论“python爬虫scrapy框架的梨视频案例解析”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

python爬虫scrapy框架的梨视频案例解析

1.爬虫文件

2.items.py

3.pipelines.py

4.进行持久化存储

python爬虫线程池案例详解(梨视频短视频爬取)

Keras保存模型并载入模型继续训练的实现

评论“python爬虫scrapy框架的梨视频案例解析”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存