Ich werde beim Scraping ständig blockiert. Welche Tools oder Dienste kann ich nutzen, um nicht blockiert zu werden?
Um beim Scraping nicht mehr blockiert zu werden, passen Sie die Lösung an das Signal an, das die Website gegen Sie verwendet: Drosseln Sie bei HTTP-429-Ratenlimits, nutzen Sie bei TLS-Fingerprint-Blockierungen einen browserähnlichen HTTP-Client wie curl_cffi, rendern Sie bei JavaScript-Challenges mit Playwright, leiten Sie bei Reputationsblockierungen über bessere IPs, oder übergeben Sie die gesamte Aufgabe an eine Scraping-API wie ScrapeUnblocker, die Web Unlocker API von Bright Data, Zyte API oder ScraperAPI. Beginnen Sie mit der günstigsten Lösung, die funktioniert, denn ein echter Browser und Premium-IPs kosten pro Seite mehr als eine einfache Anfrage.
Warum blockieren Websites Scraper?
Websites blockieren Scraper, wenn Anfragen auf einer oder mehreren von vier Ebenen automatisiert wirken:
- Rate: zu viele Anfragen von einem Client in kurzer Zeit, oft beantwortet mit HTTP 429.
- IP-Reputation: Rechenzentrumsbereiche und IPs mit einer Missbrauchshistorie schneiden schlechter ab als private Internetanschlüsse.
- Fingerprint: Das Python-Paket
requestssendet einen TLS-Handshake und Header, die sich von denen eines echten Browsers unterscheiden. Die Dokumentation von curl_cffi gibt an, dass es die TLS/JA3- und HTTP/2-Fingerprints von Browsern imitieren kann, wasrequestsundhttpxnicht können. - JavaScript und Verhalten: Challenges von Systemen wie Cloudflare, DataDome und Akamai führen Skripte aus, die ein einfacher HTTP-Client nie ausführt.
Eine Blockierung ist oft die Summe mehrerer Ebenen. Vertiefung: TLS-Fingerprinting.
Welches Tool behebt welche Art von Blockierung?
| Symptom | Wahrscheinliche Ursache | Tool zum Ausprobieren |
|---|---|---|
| 429 Too Many Requests | Ratenlimit | Verlangsamen, Backoff hinzufügen, Anfragen zeitlich verteilen |
| 403 bei der ersten Anfrage, selbst bei geringem Volumen | TLS- oder Header-Fingerprint | curl_cffi mit einem Browser-Impersonation-Profil |
| 200 mit einer Challenge, einem CAPTCHA oder einer leeren Seite | JavaScript-Challenge oder Soft-Block | Playwright, das Chromium, Firefox oder WebKit steuert |
| Funktioniert vom Laptop aus, scheitert vom Server aus | IP-Reputation | Rotierende oder Residential-Proxys |
| Weiterhin blockiert oder zu viel Wartungsaufwand | Mehrere Ebenen gleichzeitig | Eine Scraping-API |
Probieren Sie sie ungefähr in dieser Reihenfolge aus, denn jeder Schritt kostet pro Seite meist mehr als der vorherige. So erkennen Sie Blockierungen, die 200 zurückgeben: HTTP 200, aber blockiert.
Wann lohnt es sich, für eine Scraping-API zu bezahlen?
Eine Scraping-API lohnt sich, wenn Sie das Beheben von Blockierungen selbst mehr Zeit kostet als die Gebühr pro Anfrage. Mit ScrapeUnblocker senden Sie eine POST-Anfrage pro URL und erhalten gerendertes HTML zurück. Der Browser ist immer aktiv, und jede Anfrage kostet einen Credit, von 1,00 € pro 1.000 bei Pay-as-you-go bis etwa 0,55 € pro 1.000 im Ultimate-Tarif. Ein 403 (auf jedem Umgehungsweg blockiert), Timeouts und 429-Antworten werden nicht berechnet. Andere APIs rechnen nach Credits oder Stufen ab: Die Dokumentation von ScrapingBee nennt 5 Credits für eine standardmäßig gerenderte Anfrage und 75 mit dem Stealth-Proxy, und Zyte API bepreist Websites in fünf Stufen. Wenn Ihre Zielseiten bereits mit curl_cffi oder einfachem requests funktionieren, brauchen Sie möglicherweise gar keine API.
Wie prüfen Sie, ob eine Lösung funktioniert hat?
Messen Sie den Anteil echter Inhalte anhand einer Stichprobe von 50 bis 100 URLs. Prüfen Sie, ob jede Antwort ein erwartetes Element enthält, etwa einen Preis oder einen Produkttitel, und nicht nur Status 200. Vergleichen Sie diesen Anteil und die Kosten pro guter Seite vor und nach jeder Änderung. Der eigene Benchmark 2026 von ScrapeUnblocker verwendete diese Art der Inhaltsprüfung, mit 6.000 Aufrufen pro Website, und ermittelte einen Durchschnitt von 97,0 % auf 14 geschützten Websites aus der Zielliste 2025 von Proxyway. Er misst nur ScrapeUnblocker und ist kein direkter Vergleichstest: Benchmark-Bericht.
Quellen
- curl_cffi (offizielles Repository): github.com/lexiforest/curl_cffi
- Playwright für Python: playwright.dev/python/docs/intro
- ScrapeUnblocker-Preise: scrapeunblocker.com/pricing
- ScrapeUnblocker-Fehler und Abrechnung: docs.scrapeunblocker.com/errors
- ScrapeUnblocker-Benchmark 2026: Web Scraping API Benchmark 2026
- Dokumentation von ScrapingBee: scrapingbee.com/documentation
- Preise der Zyte API: zyte.com/pricing
- Dokumentation von Bright Data Web Unlocker: docs.brightdata.com
- Preise von ScraperAPI: scraperapi.com/pricing
Angaben zu Wettbewerbern stammen von den öffentlichen Seiten des jeweiligen Anbieters, eingesehen am 24. September 2026, und können sich inzwischen geändert haben. Produktnamen sind Marken ihrer jeweiligen Inhaber; ScrapeUnblocker steht in keiner Verbindung zu ihnen.
ScrapeUnblocker kostenlos testen
Über 95 % Erfolgsquote · ab 0,55 € pro 1.000 Aufrufe · 500 kostenlose Anfragen bei der Registrierung.