mirror of
https://github.com/wahyd4/knowledge.git
synced 2026-08-09 05:06:28 +10:00
775 B
775 B
A good scraper
- content downloading, download images, contents and so on.
- links retrieve, find new links
- URL management, avoid endless loop
- content analysis and management, export as csv or chart.
good frameworks
- colly
- pyspider
- scrapy
anti scraper blocking
- multiple ips
- different headers
- proper interval
- dynamic pages -> prentend to be a real man. /phantom.js/selenium/chrome headless
- set proper cookie
- verification code -> ocr
- fetch data from mobile webpage
anti scraper
- block ip
- http headers, such as user-agent
- cookie
- return fake data