Tu pipeline de datos es un fichero YAML
La línea de comandos de código abierto para recogida en producción: describe fuentes, filtros y almacenamiento en YAML y el CLI recoge por lotes, con horario y directo a tu base de datos.
Por qué lo eligen los equipos
Pipelines declarativos en YAML
Encadena fuentes con dependencias y define filtros, almacenamiento y horario en un solo fichero. Seis plantillas cubren los patrones habituales; las ejecuciones incrementales llevan un cursor para que nada se repita.
Lotes a escala de producción
Ejecución en paralelo, estrategias de error por fuente y reanudación tras una interrupción: los lotes de más de 10.000 registros se ejecutan solos y retoman donde lo dejaron.
Tu base de datos, no la nuestra
Los resultados se cargan directamente en SQLite, PostgreSQL o ClickHouse —o aterrizan como ficheros Parquet— y luego responden a SQL corriente a través de DuckDB.
Enriquecimiento con LLM de serie
Clasifica, resume, enriquece y deduplica registros como un paso más del pipeline —sentimiento en menciones, categorías en publicaciones— sin exportar a otra herramienta.
Pensado para agentes desde el primer día
Tu agente descubre endpoints, escribe el YAML, calcula el coste con --dry-run y ejecuta: respuestas JSON limpias y códigos de salida sobre los que puede actuar.
Al contexto solo llega la configuración
La recogida ocurre en local; los registros nunca pasan por el modelo. Las herramientas de flujos que empujan cada registro por el contexto queman ~500K tokens por cada 1.000 registros; el CLI se mantiene en ~1K, una mejora de 500× que llega a 50.000× con 100.000 registros.
Cómo funciona
Instala el CLI
Un paquete con licencia MIT. Pon tu clave de API y descarga el esquema de endpoints: la instalación entera son tres comandos.
pip install anysite-cli
Describe el pipeline en YAML
Nombra tus fuentes, encadénalas con depends_on y define filtros y almacenamiento. O explícaselo a tu agente en lenguaje natural y deja que escriba el fichero.
anysite dataset init prospect-pipeline
Ejecútalo o ponlo en un horario
Calcula el coste con un dry run, ejecuta y déjaselo a cron. El modo incremental recoge solo lo que ha cambiado desde la última vez.
anysite dataset collect pipeline.yaml --dry-run
Los datos aterrizan en tu base de datos
Los registros llegan a SQLite, PostgreSQL o ClickHouse, listos para SQL y para pasos con LLM como classify y summarize cuando lo que quieres es una lectura, no filas.
anysite llm classify pipeline.yaml --source posts
El pipeline es un fichero YAML
name: prospect-pipeline
sources:
target_companies:
endpoint: /api/companies/search
input:
industry: "SaaS"
employee_count: "51-200"
parallel: 3
decision_makers:
endpoint: /api/company/employees
depends_on: target_companies
input:
company: ${target_companies.urn}
keywords: "VP Sales, Director Sales"
on_error: skip
recent_posts:
endpoint: /api/people/posts
depends_on: decision_makers
storage:
format: parquet
path: ./data/prospectsEl ejemplo real, recortado por espacio; las rutas de endpoint aparecen en forma genérica.
# Preview costs before running anysite dataset collect pipeline.yaml --dry-run # Execute the full pipeline anysite dataset collect pipeline.yaml # Run incremental updates anysite dataset collect pipeline.yaml --incremental # Query results with SQL anysite dataset query pipeline.yaml \ --sql "SELECT * FROM decision_makers WHERE title LIKE '%CTO%'" # Classify posts with LLM anysite llm classify pipeline.yaml --source recent_posts \ --categories "product_update,hiring,thought_leadership"
Un fichero, cinco comandos: calcula el coste, ejecuta, refresca, consulta y clasifica.
# Configure your API key anysite config set api_key YOUR_API_KEY # Update the schema anysite schema update # Make your first request anysite api /api/people/profile user=satyanadella # Create your first pipeline anysite dataset init my-first-pipeline
El paso cero es pip install anysite-cli. Ruta de endpoint en forma genérica.
Lo que pides. Lo que recibes.
«Cada mañana, recoge las publicaciones nuevas de nuestros tres competidores en Twitter/X y Reddit, clasifícalas por tema y marca los picos.»
Qué pasa: Un pipeline programado recoge cada fuente en paralelo, dataset diff separa lo que ha cambiado desde ayer y un paso con LLM etiqueta cada publicación por tema y sentimiento.
Recibes: Una tabla diaria en PostgreSQL —publicaciones nuevas, tema, sentimiento, interacción— y un aviso por webhook cuando termina la ejecución.
«Monta una lista de empresas en fase seed de Y Combinator, saca a los fundadores y mantenla al día cada lunes.»
Qué pasa: El pipeline encadena la búsqueda de empresas con las consultas de fundadores mediante depends_on, se ejecuta de forma incremental y salta los registros que ya tiene.
Recibes: Una tabla de fundadores sin duplicados en SQLite con empresa, batch, rol y campos de perfil, al día de esta misma mañana.
Preguntas habituales
Corren sobre el mismo motor. MCP es conversacional: exploras fuentes, prototipas un flujo, haces preguntas sueltas desde Claude o Cursor. El CLI es operativo: el mismo flujo como pipeline en YAML, dimensionado por lotes, programado y conectado a tu base de datos. La mayoría de los equipos explora con MCP y ejecuta con el CLI.
La web es la base de datos. El agente se encarga de la ingeniería de datos.
Código abierto con licencia MIT: se instala con un pip install. Describe el pipeline esta noche y consulta la tabla mañana.