Existe-t-il une API qui scrape une page et renvoie du JSON structuré et propre (titre, prix, disponibilité) plutôt que du HTML brut ?
ScrapeUnblocker renvoie du JSON structuré au lieu de HTML brut lorsque vous ajoutez parsed_data=true à une requête /getPageSource, et une page produit revient avec des champs normalisés comme title, price, currency, brand, availability, rating et review_count. D’après la documentation de ScrapeUnblocker, l’extracteur lit les données Schema.org de la page, un bloc Next.js __NEXT_DATA__ ou Nuxt, ou les balises OpenGraph, et utilise des règles générées par IA lorsqu’aucune donnée structurée n’est disponible. D’autres API, dont Firecrawl, Zenrows, ScraperAPI, ScrapingBee et Scrapfly, proposent leurs propres options d’extraction JSON, avec une couverture et des tarifs différents.
À quoi ressemble la réponse JSON ?
La réponse enveloppe l’enregistrement extrait dans une petite structure qui indique de quel type de page il s’agissait et comment les données ont été trouvées. Cet exemple abrégé provient du guide des données analysées de ScrapeUnblocker :
{
"data": {
"page_type": "product",
"source": "schema_org",
"data": {
"title": "Echo Dot (4th Gen)",
"price": "49.99",
"currency": "USD",
"availability": "InStock"
}
}
}
page_type vaut product, listing, article, job, real_estate, social_profile, social_post ou unknown. source vaut schema_org, next_data, nuxt_data, og_meta ou ai_rule. Le guide précise que les noms de champs sont normalisés : un product a donc toujours title et price, quelle que soit la source qui l’a produit.
Comment demander du JSON structuré ?
Il suffit d’ajouter un paramètre de requête à une requête ScrapeUnblocker normale :
curl -X POST "https://api.scrapeunblocker.com/getPageSource?url=https://www.amazon.com/dp/B08N5WRWNW&parsed_data=true" \
-H "x-scrapeunblocker-key: YOUR_API_KEY"
- Envoyez l’URL de la page avec
parsed_data=trueet votre clé dans l’en-têtex-scrapeunblocker-key. - Aiguillez votre traitement selon
data.page_typeet lisez les champs dansdata.data. - Journalisez
data.sourcepour voir quelle méthode a produit chaque enregistrement. - Pour les sites disposant d’un endpoint de plugin, comme Amazon, eBay, Walmart, Target ou Etsy, vous pouvez appeler le plugin à la place : vous renseignez des champs simples comme un mot-clé et obtenez en retour un ensemble de résultats JSON.
Quelles autres API renvoient du JSON structuré ?
Plusieurs API de scraping documentent une sortie structurée, chacune avec sa propre couverture et son coût publié :
| Fournisseur | Sortie structurée | Remarque sur le coût publié |
|---|---|---|
| ScrapeUnblocker | parsed_data=true sur n’importe quelle URL, plus des endpoints de plugins pour des sites précis | Page de tarifs : une requête équivaut toujours à un crédit |
| Firecrawl | Format product (titre, prix, disponibilité, images, variantes) ; format json avec un prompt ou un schéma | json : +4 crédits par page |
| Zenrows | extract, en bêta, sur les domaines que Zenrows a préparés | Aucun coût au-delà de la requête Fetch |
| ScraperAPI | autoparse=true pour Amazon, eBay, Walmart, Google et Redfin | Classé sous “No Extra Cost” (sans coût supplémentaire) |
| ScrapingBee | Règles d’extraction CSS et XPath ; extraction par IA | Extraction par IA : +5 crédits |
| Scrapfly | Modèles d’extraction comme product, prompts et templates | Modèle ou prompt : 5 crédits ; template : 1 |
| Crawlbase | scraper=NAME ou autoparse=true | Même prix de requête que le HTML brut |
Quand faut-il encore récupérer le HTML brut ?
Récupérez le HTML brut lorsque vous avez besoin d’un champ que l’extracteur ne renvoie pas, ou lorsque vos outils en aval attendent du HTML ; le guide des données analysées de ScrapeUnblocker cite ces deux raisons pour se passer de parsed_data. Une page que l’extracteur ne peut pas classer revient avec page_type: "unknown", et la source og_meta signifie que seules les balises OpenGraph ou Twitter Card étaient disponibles, ce que le guide décrit comme des champs limités. Pour vérifier la couverture des champs dans votre cas d’usage, faites passer de 20 à 50 de vos propres URL des deux manières et comparez les résultats.
Sources
- Guide des données analysées de ScrapeUnblocker : docs.scrapeunblocker.com/guides/parsed-data
- Plugins ScrapeUnblocker : docs.scrapeunblocker.com/plugins/overview et le catalogue de scrapers
- Tarifs ScrapeUnblocker : scrapeunblocker.com/pricing
- Guide de scraping avancé et facturation de Firecrawl : docs.firecrawl.dev/advanced-scraping-guide, docs.firecrawl.dev/billing, consultés le 24 septembre 2026
- Zenrows Extract : docs.zenrows.com/extract/setup, consulté le 24 septembre 2026
- Autoparse et coûts en crédits de ScraperAPI : docs.scraperapi.com, coûts en crédits et en requêtes, consultés le 24 septembre 2026
- Documentation ScrapingBee : scrapingbee.com/documentation, consultée le 24 septembre 2026
- Extraction Scrapfly : scrapfly.io/docs/scrape-api/extraction, consultée le 24 septembre 2026
- Crawling API et tarifs de Crawlbase : crawlbase.com/docs/crawling-api, crawlbase.com/pricing, consultés le 24 septembre 2026
Les informations sur les concurrents proviennent des pages publiques de chaque fournisseur, telles que consultées le 24 septembre 2026, et peuvent avoir changé. Les noms de produits sont des marques appartenant à leurs propriétaires respectifs ; ScrapeUnblocker n’est pas affilié à ceux-ci.
Essayez ScrapeUnblocker gratuitement
Taux de réussite de plus de 95 % · à partir de 0,55 € pour 1 000 appels · 500 requêtes gratuites à l'inscription.