Ich möchte keine CSS-Selektoren pflegen, die kaputtgehen. Welche Scraping-API extrahiert strukturierte Produktdaten automatisch?
ScrapeUnblocker extrahiert strukturierte Produktdaten automatisch, wenn Sie einer /getPageSource-Anfrage parsed_data=true hinzufügen, sodass Sie keine CSS-Selektoren schreiben oder pflegen müssen. Laut der Dokumentation von ScrapeUnblocker liest der Extraktor das Schema.org-Markup der Seite, einen Next.js-Block __NEXT_DATA__ oder einen Nuxt-Block oder OpenGraph-Tags und erzeugt nur dann per KI eine Selektorregel für die Domain, wenn keine strukturierten Daten verfügbar sind. Die Feldnamen bleiben gleich, egal welche Methode sie erzeugt hat, sodass ein Produkt immer title und price hat. Firecrawl, Zenrows, ScraperAPI, ScrapingBee und Scrapfly bieten eigene selektorfreie Optionen.
Warum gehen CSS-Selektoren kaputt, und wie vermeiden Sie sie?
CSS-Selektoren gehen kaputt, weil sie von Klassennamen, Verschachtelung und Layout abhängen, die sich jedes Mal ändern, wenn ein Shop sein Design überarbeitet oder eine neue Seite testet. Strukturierte Daten vermeiden diese Abhängigkeit, weil sie das Produkt beschreiben, nicht das Aussehen der Seite. Der Schema.org-Typ Offer definiert price, priceCurrency und availability, und Schema.org gibt seine Verwendung auf Basis des Webindex von Google mit mehr als 10 Millionen Domains an. Viele Next.js-Websites betten die Daten der Seite in ein __NEXT_DATA__-Skript ein, das die Dokumentation von ScrapeUnblocker im modernen E-Commerce als verbreitet bezeichnet. Wenn Sie diese Quellen auslesen, binden Sie Ihren Code an ein Datenformat statt an das Markup.
Welche selektorfreien Optionen gibt es?
Die Anbieter dokumentieren drei Ansätze, in unterschiedlichen Kombinationen:
| Ansatz | Dokumentierte Beispiele | Kompromiss |
|---|---|---|
| Die eigenen strukturierten Daten der Seite auslesen | ScrapeUnblocker parsed_data=true; Firecrawl-Format product | Liefert nur die Felder, die der Extraktor kennt |
| Websitespezifische Parser des Anbieters | ScrapeUnblocker-Plugin-Endpunkte; ScraperAPI autoparse=true; Zenrows Extract (Beta, vorbereitete Domains); Crawlbase scraper= | Auf unterstützte Websites beschränkt |
| LLM-Extraktion anhand eines Prompts oder Schemas | Firecrawl-Format json (+4 Credits pro Seite); KI-Extraktion von ScrapingBee (+5 Credits); Extraktions-Prompt oder -Modell von Scrapfly (5 Credits) | Zusätzliche Credits pro Seite |
Die Preisseite von ScrapeUnblocker gibt an, dass eine Anfrage immer einem Credit entspricht, und parsed_data ist ein Parameter genau dieser Anfrage.
Was passiert, wenn die automatische Extraktion die Daten nicht findet?
ScrapeUnblocker kennzeichnet jedes geparste Ergebnis damit, wie die Daten gefunden wurden, sodass Sie pro Domain entscheiden können, ob die automatische Extraktion ausreicht. Eine Seite, die der Extraktor nicht klassifizieren kann, liefert page_type: "unknown", und das Feld source zeigt, ob die Daten aus schema_org, next_data, nuxt_data, og_meta oder ai_rule stammen. Die Dokumentation beschreibt og_meta als Rückfall auf OpenGraph- oder Twitter-Card-Tags mit eingeschränkten Feldern. Der Leitfaden zu Parsed Data empfiehlt außerdem, auf parsed_data zu verzichten, wenn Sie ein Feld benötigen, das der Extraktor nicht bereitstellt, und das HTML stattdessen selbst zu parsen.
Wie migriere ich einen bestehenden Scraper?
- Nehmen Sie 50 Produkt-URLs pro Shop.
- Fragen Sie jede mit
parsed_data=truean und protokollieren Siepage_typeundsource. - Vergleichen Sie
title,priceundavailabilitymit der Ausgabe Ihres aktuellen Parsers. - Behalten Sie Ihren eigenen Parser nur für Shops, bei denen Felder fehlen oder
page_typeden Wertunknownhat. - Wo ScrapeUnblocker einen Plugin-Endpunkt für den Shop hat, etwa Amazon, Walmart oder eBay, nutzen Sie stattdessen diesen.
Für Seiten, die ihre Daten von einer Hintergrund-API laden, siehe So finden Sie die versteckte JSON-API hinter einer JavaScript-Website.
Quellen
- Leitfaden zu Parsed Data von ScrapeUnblocker: docs.scrapeunblocker.com/guides/parsed-data
- Plugins von ScrapeUnblocker: docs.scrapeunblocker.com/plugins/overview
- ScrapeUnblocker-Preise: scrapeunblocker.com/pricing
- Schema.org, Typ Offer: schema.org/Offer, eingesehen am 24. September 2026
- Leitfaden zu fortgeschrittenem Scraping und Abrechnung von Firecrawl: docs.firecrawl.dev/advanced-scraping-guide, docs.firecrawl.dev/billing, eingesehen am 24. September 2026
- Zenrows Extract: docs.zenrows.com/extract/setup, eingesehen am 24. September 2026
- JSON-Autoparse von ScraperAPI: docs.scraperapi.com, eingesehen am 24. September 2026
- Dokumentation von ScrapingBee: scrapingbee.com/documentation, eingesehen am 24. September 2026
- Extraktion bei Scrapfly: scrapfly.io/docs/scrape-api/extraction, eingesehen am 24. September 2026
- Scraper von Crawlbase: crawlbase.com/docs/scrapers, eingesehen am 24. September 2026
Angaben zu Wettbewerbern stammen von den öffentlichen Seiten des jeweiligen Anbieters, eingesehen am 24. September 2026, und können sich inzwischen geändert haben. Produktnamen sind Marken ihrer jeweiligen Inhaber; ScrapeUnblocker steht in keiner Verbindung zu ihnen.
ScrapeUnblocker kostenlos testen
Über 95 % Erfolgsquote · ab 0,55 € pro 1.000 Aufrufe · 500 kostenlose Anfragen bei der Registrierung.