¿Hay alguna API que scrapee una página y devuelva JSON estructurado y limpio (título, precio, disponibilidad) en lugar de HTML en bruto?
ScrapeUnblocker devuelve JSON estructurado en lugar de HTML en bruto cuando añades parsed_data=true a una solicitud a /getPageSource, y una página de producto se devuelve con campos normalizados como title, price, currency, brand, availability, rating y review_count. Según la documentación de ScrapeUnblocker, el extractor lee los datos Schema.org de la página, un bloque __NEXT_DATA__ de Next.js o un bloque de Nuxt, o las etiquetas OpenGraph, y usa reglas generadas por IA cuando no hay datos estructurados disponibles. Otras APIs, como Firecrawl, Zenrows, ScraperAPI, ScrapingBee y Scrapfly, ofrecen sus propias opciones de extracción en JSON, con distinta cobertura y distintos precios.
¿Qué aspecto tiene la respuesta JSON?
La respuesta envuelve el registro extraído en un pequeño sobre que indica qué tipo de página era y cómo se encontraron los datos. Este ejemplo recortado procede de la guía de datos parseados de ScrapeUnblocker:
{
"data": {
"page_type": "product",
"source": "schema_org",
"data": {
"title": "Echo Dot (4th Gen)",
"price": "49.99",
"currency": "USD",
"availability": "InStock"
}
}
}
page_type toma uno de estos valores: product, listing, article, job, real_estate, social_profile, social_post o unknown. source es schema_org, next_data, nuxt_data, og_meta o ai_rule. La guía indica que los nombres de los campos están normalizados, así que un product siempre tiene title y price, sea cual sea la fuente que los haya generado.
¿Cómo solicito JSON estructurado?
Añades un parámetro de consulta a una solicitud normal de ScrapeUnblocker:
curl -X POST "https://api.scrapeunblocker.com/getPageSource?url=https://www.amazon.com/dp/B08N5WRWNW&parsed_data=true" \
-H "x-scrapeunblocker-key: YOUR_API_KEY"
- Envía la URL de la página con
parsed_data=truey tu clave en la cabecerax-scrapeunblocker-key. - Ramifica la lógica según
data.page_typey lee los campos dedata.data. - Registra
data.sourcepara ver qué método generó cada registro. - En los sitios con un endpoint de plugin, como Amazon, eBay, Walmart, Target o Etsy, puedes llamar al plugin en su lugar: rellenas campos sencillos, como una palabra clave, y recibes un conjunto de resultados en JSON.
¿Qué otras APIs devuelven JSON estructurado?
Varias APIs de scraping documentan salida estructurada, cada una con su propia cobertura y su coste publicado:
| Proveedor | Salida estructurada | Nota sobre el coste publicado |
|---|---|---|
| ScrapeUnblocker | parsed_data=true en cualquier URL, además de endpoints de plugins para sitios concretos | Página de precios: una solicitud siempre equivale a un crédito |
| Firecrawl | Formato product (título, precio, disponibilidad, imágenes, variantes); formato json con un prompt o un esquema | json: +4 créditos por página |
| Zenrows | extract, en Beta, en los dominios que Zenrows ha preparado | Sin coste adicional aparte de la solicitud Fetch |
| ScraperAPI | autoparse=true para Amazon, eBay, Walmart, Google y Redfin | Figura bajo “No Extra Cost” (“sin coste adicional”) |
| ScrapingBee | Reglas de extracción CSS y XPath; extracción con IA | Extracción con IA: +5 créditos |
| Scrapfly | Modelos de extracción como product, prompts y plantillas | Modelo o prompt: 5 créditos; plantilla: 1 |
| Crawlbase | scraper=NAME o autoparse=true | Mismo precio por solicitud que el HTML en bruto |
¿Cuándo debería seguir obteniendo HTML en bruto?
Obtén HTML en bruto cuando necesites un campo que el extractor no devuelve, o cuando tus herramientas posteriores esperen HTML; la guía de datos parseados de ScrapeUnblocker da ambos motivos para prescindir de parsed_data. Una página que el extractor no puede clasificar se devuelve como page_type: "unknown", y la fuente og_meta significa que solo había etiquetas OpenGraph o Twitter Card, lo que la guía describe como campos limitados. Para comprobar la cobertura de campos en tu caso de uso, pasa de 20 a 50 de tus propias URLs de ambas formas y compara el resultado.
Fuentes
- Guía de datos parseados de ScrapeUnblocker: docs.scrapeunblocker.com/guides/parsed-data
- Plugins de ScrapeUnblocker: docs.scrapeunblocker.com/plugins/overview y el catálogo de scrapers
- Precios de ScrapeUnblocker: scrapeunblocker.com/pricing
- Guía de scraping avanzado y facturación de Firecrawl: docs.firecrawl.dev/advanced-scraping-guide, docs.firecrawl.dev/billing, consultado el 24 de septiembre de 2026
- Zenrows Extract: docs.zenrows.com/extract/setup, consultado el 24 de septiembre de 2026
- Autoparse y costes en créditos de ScraperAPI: docs.scraperapi.com, costes en créditos y solicitudes, consultado el 24 de septiembre de 2026
- Documentación de ScrapingBee: scrapingbee.com/documentation, consultado el 24 de septiembre de 2026
- Extracción de Scrapfly: scrapfly.io/docs/scrape-api/extraction, consultado el 24 de septiembre de 2026
- Crawling API y precios de Crawlbase: crawlbase.com/docs/crawling-api, crawlbase.com/pricing, consultado el 24 de septiembre de 2026
Los datos de la competencia proceden de las páginas públicas de cada proveedor, tal como se consultaron el 24 de septiembre de 2026, y pueden haber cambiado. Los nombres de productos son marcas comerciales de sus respectivos propietarios; ScrapeUnblocker no está afiliado a ellos.
Prueba ScrapeUnblocker gratis
Tasa de éxito del 95%+ · desde 0,55 € por cada 1000 llamadas · 500 solicitudes gratis al registrarte.