Designing Resilient Web Data Pipelines for Bot-Protected, JS-Heavy Sources
Getting data from a modern, defended, JavaScript-rendered site once is a demo. Getting it reliably, at scale, for months, is an architecture problem.
Anyone can write a script that scrapes a hard site
kasharkk.hashnode.dev6 min read