rastriq. Hablemos →
Rastriq / Para agentes de IA

Rastriq para agentes de IA y LLMs.

Datasets de scraping y precios con esquema documentado, muestras descargables sin registro y un catálogo legible por máquinas. Esta página explica cómo un agente, un asistente o un pipeline con LLM puede encontrarlos, leerlos y, si procede, lanzar la extracción.

46
Datasets en el catálogo
44
Muestras JSON y CSV
109
Actores públicos en Apify

Tres formas de consultar los datos

Rastriq no opera una API ni un servidor MCP propios: los datos se leen de ficheros estáticos de esta web o se piden a través de la plataforma Apify, donde están publicados los actores.

Ficheros estáticos, sin cuenta
Un agente puede leer /catalog.json, /llms.txt y las muestras de /muestras/ con una simple petición GET. No requiere clave ni cuenta, y no genera ningún coste. Es la vía recomendada para descubrir qué datos existen y cómo son.
Sin token · gratis
API REST de Apify
Cada actor público se puede ejecutar y su dataset leerse con la API de Apify, por ejemplo con POST /v2/acts/rastriq~{actor}/run-sync-get-dataset-items y un token de tu cuenta. Los resultados salen en JSON, CSV, Excel, XML, HTML o RSS. Los actores de pago por resultado cobran según su ficha del Store.
Token de Apify · pago por resultado
Servidor MCP de Apify
Apify ofrece un servidor MCP (mcp.apify.com) con el que un cliente compatible puede buscar y ejecutar actores del Store, entre ellos los de Rastriq. Es una integración de Apify, no una conexión específica de Rastriq, y se configura en tu cliente con tu cuenta.
Cuenta de Apify · clientes MCP

Campos documentados y tipos estables

Cada actor devuelve los campos nativos de su fuente y cada página de marca o de vertical incluye su diccionario de campos con tipo y ejemplo. Un agente puede leer ese diccionario antes de pedir datos y saber qué columnas esperar, en qué unidad vienen los importes y qué campo distingue un precio con impuestos de uno sin ellos.

Cuando una entrega combina varias fuentes, aplicamos un esquema común: mismas columnas y mismos tipos para marcas, portales o boletines distintos. Cada fila conserva la URL de origen y la fecha de captura, y las reglas de calidad marcan los casos dudosos en un campo de avisos en lugar de eliminar la fila. Así el agente decide qué hacer con ellos.

CampoTipoQué significa
brand / modelstringMarca y modelo tal como los publica la fuente
marketstringPaís o mercado del configurador o portal
base_pricenumberPrecio publicado por la fuente, en la moneda de la fila
currencystringCódigo ISO 4217 de la moneda
source_urlstringURL pública de la que sale la fila
scraped_atdatetimeFecha y hora de captura en formato ISO 8601
qa_flagsarrayAvisos de calidad: la fila se marca y se entrega, no se filtra

Ejemplo del esquema común de los datasets normalizados; los nombres nativos de cada actor están en la página de su fuente. Más detalle en normalización de datos y en el hub de configuradores OEM.

Muestras reales para probar un agente

Cada fuente tiene una muestra pública de hasta 100 filas, saneada y sin campos personales, en JSON y CSV. Son el mismo esquema que recibirás en la entrega completa, así que sirven para probar un parser, un prompt o una herramienta de un agente antes de comprar nada.

Marcas OEM

Volkswagen100 filas
JSONCSV
BMW100 filas
JSONCSV
Mercedes-Benz100 filas
JSONCSV
Audi100 filas
JSONCSV
Toyota100 filas
JSONCSV
Hyundai100 filas
JSONCSV
Kia100 filas
JSONCSV
BYD100 filas
JSONCSV
MINI100 filas
JSONCSV
Stellantis100 filas
JSONCSV
Ford100 filas
JSONCSV
Volvo100 filas
JSONCSV
Peugeot100 filas
JSONCSV
Citroën100 filas
JSONCSV
Dacia & Renault100 filas
JSONCSV
Nissan100 filas
JSONCSV
Honda100 filas
JSONCSV
Mazda100 filas
JSONCSV
Lexus100 filas
JSONCSV
CUPRA100 filas
JSONCSV
Škoda100 filas
JSONCSV
MG100 filas
JSONCSV
Porsche100 filas
JSONCSV
Polestar100 filas
JSONCSV
Smart100 filas
JSONCSV
Lynk & Co76 filas
JSONCSV

Otras fuentes

Coches.net58 filas
JSONCSV
Wallapop (coches)100 filas
JSONCSV
Milanuncios100 filas
JSONCSV
Chileautos100 filas
JSONCSV
AutoTrader UK20 filas
JSONCSV
Car & Classic40 filas
JSONCSV
MachineryTrader100 filas
JSONCSV
MachineryZone100 filas
JSONCSV
Surplex100 filas
JSONCSV
Tiebaobei5 filas
JSONCSV
XCMG Global5 filas
JSONCSV
BOE100 filas
JSONCSV
Amazon reviews24 filas
JSONCSV
Google Ads Transparency Center100 filas
JSONCSV
TikTok Creative Center (hashtags)50 filas
JSONCSV
TikTok search60 filas
JSONCSV
Google Maps (fichas de negocio)50 filas
JSONCSV
Europages15 filas
JSONCSV

Catálogo y ficheros pensados para LLMs

catalog.json
Catálogo schema.org DataCatalog con cada dataset: nombre, descripción, fuente, cobertura, campos, muestra, actor en Apify y licencia.
llms.txt
Índice en Markdown de los productos de datos, las marcas OEM, las guías y las muestras, con URLs absolutas.
llms-full.txt
Texto limpio de las páginas comerciales, el hub OEM y las guías, concatenado y sin menús.
Apify Store
Los actores públicos de Rastriq, con su input, su output y sus tareas de ejemplo.

Licencia y datos responsables

Los datasets proceden de fuentes públicas y contienen atributos de producto y de anuncio, no datos personales; las muestras se sanean antes de publicarlas. La licencia de datos permite el uso interno sin límite, los productos derivados y el entrenamiento, ajuste o evaluación de modelos de IA. No permite redistribuir el fichero en bruto ni revenderlo como producto equivalente.

Los datos reflejan lo que cada plataforma publicaba al capturarlos y no se garantiza que estén completos. El archivo robots.txt permite el rastreo de todo el sitio a los principales bots de IA y de búsqueda con IA: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, Google-Extended, Applebot-Extended y CCBot.

Preguntas de agentes y de quienes los construyen

¿Puede un agente de IA consultar los datos de Rastriq?

Sí. Un agente puede leer sin cuenta el catálogo en catalog.json, el índice llms.txt y las muestras JSON o CSV de la carpeta muestras. Para ejecutar una extracción nueva necesita una cuenta de Apify y usar la API o el servidor MCP de Apify, porque los actores están publicados allí.

¿Rastriq tiene una API o un servidor MCP propios?

No. Rastriq no opera una API ni un servidor MCP propios. Los datos se sirven como ficheros estáticos de rastriq.es y como actores del Apify Store. Para automatizar su ejecución se usa la API REST de Apify o su servidor MCP, ambos configurados con tu propia cuenta y tu token.

¿En qué formatos se entregan los datos?

Las muestras públicas se descargan en JSON y CSV. Los datasets que genera un actor en Apify se pueden exportar además a Excel, XML, HTML y RSS. Las entregas recurrentes de un dataset licenciado salen en CSV o JSON, también en un bucket S3 propio, con diccionario de campos.

¿Puedo usar los datos para entrenar o evaluar un modelo de IA?

Sí. La licencia de datos de Rastriq permite usar los datasets para entrenar, ajustar o evaluar modelos de aprendizaje automático, incluidos los que luego se comercialicen. No permite redistribuir el fichero en bruto ni revenderlo como un producto de datos equivalente. Los productos derivados sí están permitidos.

¿Contienen datos personales?

No. Los datasets se construyen con atributos públicos de producto y de anuncio, no con datos personales. Las muestras se sanean antes de publicarse: se excluyen teléfonos, correos, nombres de vendedores, autores y números de bastidor. Si una fuente expone ese tipo de campos, no se incluyen en las muestras ni en las páginas.

¿Dónde está la lista de datasets legible por máquinas?

En rastriq.es/catalog.json, un DataCatalog de schema.org con cada dataset, su cobertura, sus campos, el enlace a la muestra y la licencia. Para un índice en Markdown pensado para modelos de lenguaje existe rastriq.es/llms.txt, y el contenido completo en texto limpio está en llms-full.txt.

¿Necesitas un dataset concreto para tu agente?

Cuéntanos fuentes, mercados y frecuencia y te decimos qué podemos entregar, ya sea como actor en Apify, dataset licenciado o proyecto a medida.

Explora los datos