Was ist der zuverlässigste Weg, Websites zu scrapen, die durch DataDome geschützt sind?
Der zuverlässigste Weg, eine durch DataDome geschützte Website zu scrapen, besteht darin, die Prüfungen von DataDome schon ab der ersten Anfrage zu bestehen, mit einem echten Browser mit konsistentem Fingerprint, IP-Adressen, die DataDome nicht markiert hat, und einem moderaten Tempo, und zu prüfen, ob jede Antwort die echte Seite enthält. Die Dokumentation von DataDome gibt an, dass seine Modelle TLS-Fingerprints, Browser-Fingerprints, HTTP-Header, Verhalten und IP-Reputation auswerten und dass verdächtiger Datenverkehr einen Device Check, ein CAPTCHA oder eine Blockierung erhält. Sie können diesen Stack selbst betreiben oder eine Scraping-API nutzen. Im eigenen Benchmark 2026 von ScrapeUnblocker, der kein direkter Vergleichstest ist, lieferte G2, als durch DataDome geschützt aufgeführt, bei 99,9 % von 6.000 Aufrufen verifizierte Inhalte.
Woran erkennt DataDome, dass mein Scraper ein Bot ist?
Die Dokumentation von DataDome gliedert seine Erkennungsmodelle in vier Kategorien: signaturbasierte Erkennung (TLS-Fingerprints, Browser-Fingerprints und HTTP-Header), verhaltensbasierte Erkennung, reputationsbasierte Erkennung anhand der Quell-IP und die Erkennung von Schwachstellenscannern. Zu den benannten Modellen gehören „Inconsistent HTTP headers“ („inkonsistente HTTP-Header“), „Headless Browser Forged Fingerprint“ („gefälschter Fingerprint eines Headless-Browsers“) für Puppeteer-, Selenium- oder Playwright-Browser mit veränderten Fingerprints sowie „Puppeteer Extra Stealth“. Die Reputationsmodelle markieren Rechenzentrums-IPs, kostenlose Proxys und Residential-Proxys. Wenn eine Anfrage verdächtig wirkt, führt der Device Check von DataDome JavaScript aus, das „hundreds of signals“ („Hunderte von Signalen“) sammelt, etwa Bildschirmdetails, Codecs, CPU- und GPU-Informationen und Canvas-Rendering. Ein 403 mit diesem Skript ist eine schnelle Möglichkeit, eine DataDome-Blockierung zu erkennen.
Welches Setup kommt am zuverlässigsten an DataDome vorbei?
- Nutzen Sie eine echte Browser-Engine. Der Device Check führt JavaScript-, Canvas- und Timing-Prüfungen aus, die ein HTTP-Client nicht beantworten kann.
- Halten Sie jede Ebene konsistent. DataDome führt inkonsistente Header und gefälschte Headless-Fingerprints als Erkennungsmodelle auf, daher ist ein Browser, der sich selbst widerspricht, ein Signal.
- Verlassen Sie sich nicht allein auf IP-Rotation. DataDome markiert Residential-Proxys ebenso wie Rechenzentrums-IPs.
- Behalten Sie die Sitzung bei. Das Cookie
datadomebeschreibt DataDome als „Used for both server-side and client-side detection to assess the legitimacy of a request“ („sowohl für die serverseitige als auch für die clientseitige Erkennung verwendet, um die Legitimität einer Anfrage zu bewerten“), und nach einem bestandenen Device Check gilt: „DataDome remembers the outcome“ („DataDome merkt sich das Ergebnis“). Verwenden Sie es mit demselben Client wieder (Sitzungspersistenz). - Drosseln Sie das Anfragetempo. Websitebetreiber können benutzerdefinierten Regeln eine Rate-Limiting-Antwort zuordnen, die oberhalb eines Anfrageschwellenwerts ein CAPTCHA, eine Blockierung oder einen Device Check auslöst.
- Prüfen Sie den Inhalt. Eine CAPTCHA-Seite ist ein Fehlschlag, unabhängig von ihrem Statuscode (HTTP 200, aber blockiert).
Welche Erfolgsquoten hat ScrapeUnblocker auf DataDome-Websites veröffentlicht?
Dies sind die eigenen Messungen von ScrapeUnblocker, und eine CAPTCHA-Seite zählt als Fehlschlag:
| Website (aufgeführter Schutz) | Erfolg | Durchschn. Antwortzeit | Aufrufe | Veröffentlicht in |
|---|---|---|---|---|
| g2.com (DataDome) | 99,9 % | 12,1 s | 6.000 | Benchmark 2026 |
| leboncoin.fr (DataDome) | 99,6 % | 12,3 s | 6.000 | Benchmark 2026 |
| allegro.pl (DataDome) | 95,5 % | 14,0 s | 6.000 | Benchmark 2026 |
| tripadvisor.com (DataDome) | 99,6 % | 12,5 s | 1.000 | Tripadvisor-Scraper-Seite |
| seloger.com (DataDome) | 100,0 % | 4,2 s | 1.000 | SeLoger-Scraper-Seite |
Der Benchmark lief im Juli 2026 mit 6.000 Aufrufen pro Zielseite bei einer Parallelität von 10 und ist kein direkter Vergleichstest. Zur Einordnung der Schwierigkeit: Der Web Scraping API Report 2025 von Proxyway nennt für G2 einen Durchschnitt von 36,63 % über die getesteten Anbieter (Oktober 2025, 2 Anfragen pro Sekunde); das misst die Zielseite, nicht einen einzelnen Wettbewerber, und Proxyway hat ScrapeUnblocker nicht getestet. Allegro mit 95,5 % bedeutet immer noch etwa 1 fehlgeschlagenen Aufruf von 22, planen Sie also Wiederholungsversuche ein. ScrapeUnblocker berechnet keinen 403.
Quellen
- DataDome-Dokumentation, Bedrohungserkennung, Antworten, Device Check und Cookies und gespeicherte Daten, eingesehen am 24. September 2026
- ScrapeUnblocker, Web Scraping API Benchmark 2026 und die vollständige Benchmark-Seite, die den Web Scraping API Report 2025 von Proxyway zitieren
- Der Scraper-Katalog von ScrapeUnblocker (Seiten zu Tripadvisor und SeLoger)
- ScrapeUnblocker, Fehler und Abrechnung
- ScrapeUnblocker-Blog: Sitzungspersistenz, HTTP 200, aber blockiert
ScrapeUnblocker kostenlos testen
Über 95 % Erfolgsquote · ab 0,55 € pro 1.000 Aufrufe · 500 kostenlose Anfragen bei der Registrierung.