最新公告

欢迎您光临起源地模板网，本站秉承服务宗旨履行“站长”责任，销售只是起点服务永无止境！立即加入钻石VIP

当前位置：站长学院 > python教程 > 如何用python爬虫scrapy框架中获取内容？

如何用python爬虫scrapy框架中获取内容？

正文概述 2020-05-06 357

如何用python爬虫scrapy框架中获取内容？

之前文章有提到一个大哥旁边跟着一个小弟，没想到小弟也是很厉害，也有一个迷弟崇拜着，这大概就是优秀也是会影响的吧。同样的，虽然我们今天所要讲的scrapy框架只是python中的一个分支，但是其中的Items模块在抓取数据方面也出了不少的力，接下来我们看看它是怎样获取内容的吧。

Items介绍

爬取的主要目标就是从非结构性的数据源提取结构性数据，例如网页。 Scrapy spider可以以python的dict来返回提取的数据.虽然dict很方便，并且用起来也熟悉，但是其缺少结构性，容易打错字段的名字或者返回不一致的数据，尤其在具有多个spider的大项目中。

为了定义常用的输出数据，Scrapy提供了 Item 类。 Item 对象是种简单的容器，保存了爬取到得数据。其提供了类似于词典(dictionary-like) 的API以及用于声明可用字段的简单语法。

许多Scrapy组件使用了Item提供的额外信息: exporter根据Item声明的字段来导出数据、序列化可以通过Item字段的元数据(metadata)来定义、 trackref 追踪Item实例来帮助寻找内存泄露 (see 使用 trackref 调试内存泄露) 等等。

Item 对象是种简单的容器，保存了爬取到得数据。其提供了类似于词典(dictionary-like) 的API以及用于声明可用字段的简单语法。

在Scrapy中，items是用来加载抓取内容的容器，提供了一些额外的保护减少错误。

一般来说，item可以用scrapy.item.Item类来创建，并且用scrapy.item.Field对象来定义属性。

接下来，我们开始来构建item模型（model）。

首先，我们想要的内容有：

排名（ranking）
电影名称（movie_name）
电影评分（score)
评论人数（score_num）
格言（quote）

Item使用简单的class定义语法以及Field对象来声明。我们打开scrapyspider目录下的items.py文件写入下列代码声明Item：

如何用python爬虫scrapy框架中获取内容？

代码只有短短的几行，相信难不倒在座各位小伙伴，顺便也可以写写代码练练手。更多Python学习推荐:起源地模板网教学中心。

Python技术 Python基础

起源地下载网 » 如何用python爬虫scrapy框架中获取内容？

常见问题FAQ

免费下载或者VIP会员专享资源能否直接商用？: 本站所有资源版权均属于原作者所有，这里所提供资源均只能用于参考学习用，请勿直接商用。若由于商用引起版权纠纷，一切责任均由使用者承担。更多说明请参考 VIP介绍。

提示下载完但解压或打开不了？: 最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量，若小于网盘提示的容量则是这个原因。这是浏览器下载的bug，建议用百度网盘软件或迅雷下载。若排除这种情况，可在对应资源底部留言，或联络我们.。

找不到素材资源介绍文章里的示例图片？: 对于PPT，KEY，Mockups，APP，网页模版等类型的素材，文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买，且本站不负责(也没有办法)找到出处。同样地一些字体文件也是这种情况，但部分素材会在素材包内有一份字体下载链接清单。

模板不会安装或需要功能定制以及二次开发？: 请QQ联系我们

SVIP

分享到：

发表评论

还没有评论，快来抢沙发吧！

如需帝国cms功能定制以及二次开发请联系我们

SVIP

升级SVIP会员

限时钜惠
终身SVIP仅需299元

立即开通