在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）

栏目: 编程工具 · 发布时间: 6年前

前一阵子我们介绍了如何启动Scrapy项目以及关于Scrapy爬虫的一些小技巧介绍，没来得及上车的小伙伴可以戳这些文章：

手把手教你如何新建scrapy爬虫框架的第一个项目（上）

手把手教你如何新建scrapy爬虫框架的第一个项目（下）

关于Scrapy爬虫项目运行和调试的小技巧（上篇）

关于Scrapy爬虫项目运行和调试的小技巧（下篇）

今天我们将介绍在Scrapy中如何利用Xpath选择器从HTML中提取目标信息。在Scrapy中，其提供了两种数据提取的方式，一种是Xpath选择器，一种是CSS选择器，这一讲我们先聚焦Xpath选择器，仍然是以伯乐在线网为示例网站。

在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）

1、打开网站，然后随机选择任意一篇文章进行查看，如下图所示。

在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）

我们需要提取的信息主要有标题、日期、主题、评论数、正文等等。

2、接下来我们就可以开始写代码了，基础代码如下图所示，需要注意的是start_urls参数值改为了具体的URL，其他的代码未发生改变。

在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）

3、回到原始网页，按下键盘的快捷键F12或者在网页上点击鼠标右键，然后选择“检查(N)”弹出网页的调试界面，如下图所示。

在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）

4、点击下图中红色框框的小图标，可以实现网页数据和源码之间的交互，可以很方便的帮助我们定位标签。

在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）

5、如下图所示，当我们选择上图中的小图标之后，再选择网页上的标题，尔后网页源码会自动跳转到我们定位的部分，可以看到标题在

标签下。

6、尔后我们就可以根据上图中的网页层次结构写出标题的Xpath表达式，这里先提供一种比较笨的方法，从头到尾进行罗列的写，“/html/body/div[1]/div[3]/div[1]/div[1]/h1”，有没有发现灰常的辛苦，像这种大标题信息还比较好提取一些，若是碰到犄角旮旯的信息，就比较难写表达式了，而且这种方式容易出错，效率还低。不过小伙伴们不用灰心，浏览器给我们提供了一个便捷的方式，让我们可以直接复制Xpath表达式。在标题处或者目标信息处右键，然后选择“Copy”，再选择“Copy Xpath”即可进行复制该标签的Xpath表达式，具体过程如下图所示。

可以看到复制的Xpath表达式为“//*[@id="post-113659"]/div[1]/h1”，其中id="post-113659"是属于这篇文章的一个标识，如下图所示。

通过该标识我们就可以很快的定位到标签，其与我们用笨方法手动写出来的Xpath表达式有时候并不是一致的。下面将两个Xpath表达式所匹配的内容分别进行输出。

7、将Xpath表达式写入Scrapy爬虫主体文件中，尔后Debug我们之前定义的main.py文件，将会得到下图的输出。可以看到selector1和selector2中的数据即是网页上的内容，而且内容是一致的。

之后点击停止Debug模式，便可以退出Debug模式。

8、从上图中我们可以看到选择器将标签

也都取出来了，而我们想要取的内容仅仅是标签内部的数据，此时只需要使用在Xpath表达式后边加入text()函数，便可以将其中的数据进行取出。

在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）

通过这篇文章，我们可以了解到尽管我们自己写出的Xpath表达式和浏览器给我们返回的Xpath表达式在写法上并不一致，但是程序运行之后，其返回的数据内容是一致的。换句话说，关于某个目标数据的Xpath表达式并不是唯一的，只要符合Xpath表达式语法，即便是写的很短，也是没问题的，你开心就好。此外在Scrapy爬虫框架中，text()函数常常与Xpath表达式运用在一块，用于提取节点中的数据内容。

以上所述就是小编给大家介绍的《在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）》，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对码农网的支持！

查看所有标签

猜你喜欢:

本站部分资源来源于网络，本站转载出于传递更多信息之目的，版权归原作者或者来源机构所有，如转载稿涉及版权问题，请联系我们。

码农书籍

Haskell趣学指南

[斯洛文尼亚] Miran Lipovaca / 李亚舟、宋方睿 / 人民邮电出版社 / 2014-1

《haskell趣学指南》是一本讲解haskell这门函数式编程语言的入门指南，语言通俗易懂，插图生动幽默，示例短小清晰，结构安排合理。书中从haskell的基础知识讲起，涵盖了所有的基本概念和语法，内容涉及基本语法、递归、类型和类型类、函子、applicative 函子、monad、zipper及所有haskell重要特性和强大功能。《haskell趣学指南》适合对函数式编程及haske......一起来看看《Haskell趣学指南》这本书的介绍吧!

码农工具

在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）

Haskell趣学指南

HTML 压缩/解压工具

在线进制转换器

MD5 加密