rastriq. Hablemos →
Rastriq / Scraping a medida

Scraping a medida: tú defines el dato, nosotros lo extraemos.

Diseñamos, operamos y mantenemos extracciones web para que tu equipo reciba datos estructurados, no scripts que arreglar. Desde una fuente nueva hasta un pipeline recurrente con esquema estable.

Respuesta rápida: Rastriq diseña, opera y mantiene extracciones web a medida sobre la base de 109 actores públicos del Apify Store. Los datos se entregan por Apify, API REST, CSV o JSON y bucket S3, sin datos personales y con la licencia de datos de Rastriq.

109
Actores públicos en Apify
4
Canales de entrega
0
Datos personales

Lo que ya entregamos, en filas reales

Rastriq mantiene 109 actores públicos en el Apify Store. Esa base de código y de experiencia es el punto de partida de cada proyecto a medida.

FuenteActor públicoFilas de muestraCamposDescarga
Coches.net · anuncios de coches en Españacochesnet-spain5855CSV · JSON
Wallapop · coches de segunda manowallapop-cars-scraper10023CSV · JSON
Milanuncios · cochesmilanuncios-scraper10030CSV · JSON
MachineryZone · maquinaria usada en Europamachineryzone-scraper10020CSV · JSON
Surplex · subastas industriales onlinesurplex-auction-scraper10044CSV · JSON
BOE · publicaciones oficialesboe-scraper10016CSV · JSON
Amazon · reseñas de productoamazon-reviews-scraper2423CSV · JSON
Google Ads Transparency Center · anunciosgoogle-ads-scraper10015CSV · JSON
TikTok Creative Center · hashtags en tendenciatiktok-trends-scraper5012CSV · JSON
Europages · directorio B2Beuropages-scraper1510CSV · JSON

Datos de las muestras públicas actuales. Cada actor está publicado en el Apify Store y cada muestra se puede descargar sin registro.

Ejemplo de salida estructurada

PaísPosiciónHashtagIndustriaPublicaciones
ES1liveiseasyNews & Entertainment10500
ES2octubreNews & Entertainment5600
ES3labolanegraNews & Entertainment7500
ES4lluviaNews & Entertainment3800
ES5octoberNews & Entertainment2000

Cinco filas reales de la muestra de TikTok Creative Center (hashtags). Es un ejemplo del tipo de dato estructurado que entrega una extracción.

Cinco pasos, de la idea al pipeline

Cada proyecto sigue el mismo recorrido. La primera muestra llega antes de comprometer el desarrollo completo.

1 · Briefing
Fuente, campos, mercados, volumen y frecuencia. Aclaramos para qué vas a usar el dato y en qué formato lo necesitas.
2 · Viabilidad y compliance
Revisamos cómo se publica la información, qué términos aplican y si el dato es público. Descartamos lo que exige credenciales ajenas o implica datos personales.
3 · Prototipo y muestra
Entregamos una muestra real con el esquema propuesto para que valides campos y calidad antes de pasar a producción.
4 · Producción
Programamos la extracción, vigilamos errores y cambios en la fuente y aplicamos normalización y QA en cada ejecución.
5 · Entrega y mantenimiento
Los datos llegan por el canal acordado y mantenemos el actor cuando la fuente cambia su estructura.

Cómo afrontamos las protecciones anti-bot

No prometemos acceso a cualquier web: evaluamos cada fuente y elegimos la técnica más ligera que funcione de forma estable.

Navegadores reales y sesiones coherentes
Cuando una fuente lo necesita, usamos navegadores reales con huellas coherentes y sesiones estables en lugar de peticiones sueltas.
Proxies y ritmo conservador
Elegimos el tipo de proxy según el país y la fuente, y limitamos la concurrencia para no sobrecargar la web de origen.
API interna cuando existe
Si la web consume una API pública de su propio frontend, extraemos de ahí: es más rápido, más barato y más estable que renderizar páginas.
Monitorización de cambios
Cada ejecución valida el número de registros y la forma de los campos. Si algo cambia, lo detectamos antes de que llegue a tu tabla.

Cuatro canales de entrega

Entregamos donde ya trabaja tu equipo. Si hace falta unificar varias fuentes, añadimos la normalización de datos en el mismo pipeline.

Apify
Dataset en tu cuenta de Apify, con ejecuciones programadas y webhooks. Puedes relanzar o ampliar el actor cuando quieras.
Acceso: consola y API
API
Consulta los resultados por la API REST de Apify con paginación y filtros, y conéctala a tu ETL o a tus agentes.
Formato: JSON
CSV / JSON
Ficheros listos para cargar en tu data warehouse, con un diccionario de campos y la fecha de captura de cada fila.
Formatos: CSV, JSON
S3
Entrega recurrente en un bucket S3 de tu propiedad, con una estructura de carpetas por fecha y fuente.
Estructura: fuente/fecha

Compliance: datos públicos, licencia y límites claros

Solo datos públicos. Extraemos información que cualquier visitante puede ver sin iniciar sesión: precios, anuncios, fichas de producto, publicaciones oficiales. No recopilamos datos personales y excluimos teléfonos, correos y nombres de particulares.

Licencia clara. Los datos se entregan bajo la licencia de datos de Rastriq, que describe el uso permitido. Antes de empezar revisamos los términos de la fuente y te explicamos cualquier limitación.

Sin tocar sistemas ajenos. No accedemos a áreas privadas ni eludimos autenticaciones. Si una fuente exige credenciales que no son tuyas, no la extraemos.

Preguntas frecuentes sobre scraping a medida

¿Cuánto tarda una extracción a medida?

Depende de la fuente. Para webs con una API interna o HTML estable, la primera muestra puede estar lista en pocos días. Las fuentes con protecciones anti-bot o muchas variantes de estructura requieren más tiempo de prototipo.

¿Quién mantiene la extracción si la web cambia?

Nosotros. Cada ejecución valida registros y campos, y cuando la fuente cambia su estructura actualizamos el actor. El mantenimiento forma parte del servicio recurrente.

¿Puedo quedarme con el actor?

Sí, podemos publicarlo en tu cuenta de Apify o mantenerlo en la nuestra y entregarte solo los datos. Lo acordamos en la propuesta, según si prefieres propiedad del código o servicio gestionado.

¿Cómo recibo los datos?

Por el dataset de Apify con acceso API, como ficheros CSV o JSON, o en un bucket S3 de tu propiedad. También podemos integrarlo con webhooks para avisar a tu sistema al terminar cada ejecución.

¿Extraéis datos personales?

No. Rastriq trabaja con datos públicos de producto y excluye teléfonos, correos, nombres de particulares y otros datos personales. Si un proyecto los requiere, no lo aceptamos.

Cuéntanos qué fuente necesitas

Descríbenos la web y los campos que buscas. Te respondemos con una valoración de viabilidad y una muestra del esquema propuesto.

  • Valoración de viabilidad de la fuente
  • Esquema propuesto y canal de entrega
  • Sin compromiso y sin datos personales
No se pudo enviar. Escríbenos desde el formulario de contacto.
Recibido. Revisa tu correo y descarga mientras tanto las muestras reales en /muestras/.

¿Tu fuente no está en el Store?

Cuéntanos qué necesitas y lo evaluamos.

Sigue explorando