Datasets de scraping y precios con esquema documentado, muestras descargables sin registro y un catálogo legible por máquinas. Esta página explica cómo un agente, un asistente o un pipeline con LLM puede encontrarlos, leerlos y, si procede, lanzar la extracción.
Rastriq no opera una API ni un servidor MCP propios: los datos se leen de ficheros estáticos de esta web o se piden a través de la plataforma Apify, donde están publicados los actores.
Cada actor devuelve los campos nativos de su fuente y cada página de marca o de vertical incluye su diccionario de campos con tipo y ejemplo. Un agente puede leer ese diccionario antes de pedir datos y saber qué columnas esperar, en qué unidad vienen los importes y qué campo distingue un precio con impuestos de uno sin ellos.
Cuando una entrega combina varias fuentes, aplicamos un esquema común: mismas columnas y mismos tipos para marcas, portales o boletines distintos. Cada fila conserva la URL de origen y la fecha de captura, y las reglas de calidad marcan los casos dudosos en un campo de avisos en lugar de eliminar la fila. Así el agente decide qué hacer con ellos.
| Campo | Tipo | Qué significa |
|---|---|---|
| brand / model | string | Marca y modelo tal como los publica la fuente |
| market | string | País o mercado del configurador o portal |
| base_price | number | Precio publicado por la fuente, en la moneda de la fila |
| currency | string | Código ISO 4217 de la moneda |
| source_url | string | URL pública de la que sale la fila |
| scraped_at | datetime | Fecha y hora de captura en formato ISO 8601 |
| qa_flags | array | Avisos de calidad: la fila se marca y se entrega, no se filtra |
Ejemplo del esquema común de los datasets normalizados; los nombres nativos de cada actor están en la página de su fuente. Más detalle en normalización de datos y en el hub de configuradores OEM.
Cada fuente tiene una muestra pública de hasta 100 filas, saneada y sin campos personales, en JSON y CSV. Son el mismo esquema que recibirás en la entrega completa, así que sirven para probar un parser, un prompt o una herramienta de un agente antes de comprar nada.
Los datasets proceden de fuentes públicas y contienen atributos de producto y de anuncio, no datos personales; las muestras se sanean antes de publicarlas. La licencia de datos permite el uso interno sin límite, los productos derivados y el entrenamiento, ajuste o evaluación de modelos de IA. No permite redistribuir el fichero en bruto ni revenderlo como producto equivalente.
Los datos reflejan lo que cada plataforma publicaba al capturarlos y no se garantiza que estén completos. El archivo robots.txt permite el rastreo de todo el sitio a los principales bots de IA y de búsqueda con IA: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, Google-Extended, Applebot-Extended y CCBot.
Sí. Un agente puede leer sin cuenta el catálogo en catalog.json, el índice llms.txt y las muestras JSON o CSV de la carpeta muestras. Para ejecutar una extracción nueva necesita una cuenta de Apify y usar la API o el servidor MCP de Apify, porque los actores están publicados allí.
No. Rastriq no opera una API ni un servidor MCP propios. Los datos se sirven como ficheros estáticos de rastriq.es y como actores del Apify Store. Para automatizar su ejecución se usa la API REST de Apify o su servidor MCP, ambos configurados con tu propia cuenta y tu token.
Las muestras públicas se descargan en JSON y CSV. Los datasets que genera un actor en Apify se pueden exportar además a Excel, XML, HTML y RSS. Las entregas recurrentes de un dataset licenciado salen en CSV o JSON, también en un bucket S3 propio, con diccionario de campos.
Sí. La licencia de datos de Rastriq permite usar los datasets para entrenar, ajustar o evaluar modelos de aprendizaje automático, incluidos los que luego se comercialicen. No permite redistribuir el fichero en bruto ni revenderlo como un producto de datos equivalente. Los productos derivados sí están permitidos.
No. Los datasets se construyen con atributos públicos de producto y de anuncio, no con datos personales. Las muestras se sanean antes de publicarse: se excluyen teléfonos, correos, nombres de vendedores, autores y números de bastidor. Si una fuente expone ese tipo de campos, no se incluyen en las muestras ni en las páginas.
En rastriq.es/catalog.json, un DataCatalog de schema.org con cada dataset, su cobertura, sus campos, el enlace a la muestra y la licencia. Para un índice en Markdown pensado para modelos de lenguaje existe rastriq.es/llms.txt, y el contenido completo en texto limpio está en llms-full.txt.
Cuéntanos fuentes, mercados y frecuencia y te decimos qué podemos entregar, ya sea como actor en Apify, dataset licenciado o proyecto a medida.