Scrapy 1.6 文档

本文档包含您需要了解的有关Scrapy的所有信息。

获取帮助

有麻烦吗?我们想帮忙!

第一步

Scrapy 一目了然
了解Scrapy是什么以及它如何帮助您。
安装指南
在您的计算机上安装Scrapy。
Scrapy教程
写下你的第一个Scrapy项目。
示例
Learn more by playing with a pre-made Scrapy project.

基本概念

命令行工具
了解用于管理Scrapy项目的命令行工具。
爬虫(Spiders)
编写规则以对网站进行抓取。
选择器
使用xpath从网页中提取数据。
Scrapy shell
在交互式环境中测试提取代码。
Items
定义要擦除的数据。
Item 装载器
使用提取的数据填充项目。
Item Pipeline(项目管道)
处理并存储您的已删除数据。
Feed 导出
使用不同的格式和存储输出已删除的数据。
请求与响应
了解用于表示HTTP请求和响应的类。.
链接提取器
便捷的从页面中提取链接。
设置
了解如何配置Scrapy并查看所有 available settings.
例外
查看所有可用的异常及其含义。

内置服务

Logging
了解如何在Scrapy上使用Python的内置日志记录。
统计收集
收集有关抓取爬虫的统计信息。
发送电子邮件
发生特定事件时发送电子邮件通知。
Telnet 控制台
使用内置的Python控制台检查正在运行的爬虫程序。
Web 服务
使用Web服务监视和控制爬虫程序。

解决具体问题

Frequently Asked Questions
获取最常见问题的答案。
Debugging Spiders
了解如何调试scrapy爬虫的常见问题。
Spiders Contracts
了解如何使用合同来测试爬虫。
Common Practices
熟悉一些Scrapy的常见做法。
Broad Crawls
调整Scrapy以并行地爬取大量域名。
Using your browser's Developer Tools for scraping
了解如何使用浏览器的开发人员工具。
Debugging memory leaks
了解如何查找和清除爬虫程序中的内存泄漏。
下载和处理文件与图像
下载与已删除项目关联的文件和/或图像。
Deploying Spiders
部署Scrapy蜘蛛并在远程服务器中运行它们。
AutoThrottle 扩展
根据负载动态调整爬行速率。
Benchmarking
检查Scrapy在硬件上的性能。
Jobs: pausing and resuming crawls
学习如何暂停和恢复大型爬虫的爬行。

扩展 Scrapy

架构概述
了解Scrapy架构。
Downloader Middleware
自定义页面的请求和下载方式。
Spider Middleware
自定义爬虫的输入和输出。
扩展
使用您的自定义功能扩展Scrapy
Core API
在扩展和中间件上使用它来扩展Scrapy功能
信号(Signals)
查看所有可用信号以及如何使用它们。
Item Exporters
快速将已删除的项目导出到文件(XML,CSV等)。

其余的内容

Release notes
查看最近Scrapy版本中的变化。
Contributing to Scrapy
了解如何为Scrapy项目做出贡献。
Versioning and API Stability
了解Scrapy版本控制和API稳定性。