Scrapy 1.6 文档¶
本文档包含您需要了解的有关Scrapy的所有信息。
获取帮助¶
有麻烦吗?我们想帮忙!
- 试试 FAQ -- 它有一些常见问题的答案。
- 寻找具体信息?尝试 索引 或 模块索引。
- 在 StackOverflow using the scrapy tag 中询问或搜索问题。
- 在 Scrapy subreddit 中询问或搜索问题。
- 搜索有关 scrapy-users mailing list 。
- 在 #scrapy IRC channel,提问
- 在我们的 issue tracker 报告BUGS
第一步¶
- Scrapy 一目了然
- 了解Scrapy是什么以及它如何帮助您。
- 安装指南
- 在您的计算机上安装Scrapy。
- Scrapy教程
- 写下你的第一个Scrapy项目。
- 示例
- Learn more by playing with a pre-made Scrapy project.
基本概念¶
- 命令行工具
- 了解用于管理Scrapy项目的命令行工具。
- 爬虫(Spiders)
- 编写规则以对网站进行抓取。
- 选择器
- 使用xpath从网页中提取数据。
- Scrapy shell
- 在交互式环境中测试提取代码。
- Items
- 定义要擦除的数据。
- Item 装载器
- 使用提取的数据填充项目。
- Item Pipeline(项目管道)
- 处理并存储您的已删除数据。
- Feed 导出
- 使用不同的格式和存储输出已删除的数据。
- 请求与响应
- 了解用于表示HTTP请求和响应的类。.
- 链接提取器
- 便捷的从页面中提取链接。
- 设置
- 了解如何配置Scrapy并查看所有 available settings.
- 例外
- 查看所有可用的异常及其含义。
内置服务¶
- Logging
- 了解如何在Scrapy上使用Python的内置日志记录。
- 统计收集
- 收集有关抓取爬虫的统计信息。
- 发送电子邮件
- 发生特定事件时发送电子邮件通知。
- Telnet 控制台
- 使用内置的Python控制台检查正在运行的爬虫程序。
- Web 服务
- 使用Web服务监视和控制爬虫程序。
解决具体问题¶
- Frequently Asked Questions
- 获取最常见问题的答案。
- Debugging Spiders
- 了解如何调试scrapy爬虫的常见问题。
- Spiders Contracts
- 了解如何使用合同来测试爬虫。
- Common Practices
- 熟悉一些Scrapy的常见做法。
- Broad Crawls
- 调整Scrapy以并行地爬取大量域名。
- Using your browser's Developer Tools for scraping
- 了解如何使用浏览器的开发人员工具。
- Debugging memory leaks
- 了解如何查找和清除爬虫程序中的内存泄漏。
- 下载和处理文件与图像
- 下载与已删除项目关联的文件和/或图像。
- Deploying Spiders
- 部署Scrapy蜘蛛并在远程服务器中运行它们。
- AutoThrottle 扩展
- 根据负载动态调整爬行速率。
- Benchmarking
- 检查Scrapy在硬件上的性能。
- Jobs: pausing and resuming crawls
- 学习如何暂停和恢复大型爬虫的爬行。
扩展 Scrapy¶
- 架构概述
- 了解Scrapy架构。
- Downloader Middleware
- 自定义页面的请求和下载方式。
- Spider Middleware
- 自定义爬虫的输入和输出。
- 扩展
- 使用您的自定义功能扩展Scrapy
- Core API
- 在扩展和中间件上使用它来扩展Scrapy功能
- 信号(Signals)
- 查看所有可用信号以及如何使用它们。
- Item Exporters
- 快速将已删除的项目导出到文件(XML,CSV等)。
其余的内容¶
- Release notes
- 查看最近Scrapy版本中的变化。
- Contributing to Scrapy
- 了解如何为Scrapy项目做出贡献。
- Versioning and API Stability
- 了解Scrapy版本控制和API稳定性。