Saltar al contenido
//Anysite CLI

Tu pipeline de datos es un fichero YAML

La línea de comandos de código abierto para recogida en producción: describe fuentes, filtros y almacenamiento en YAML y el CLI recoge por lotes, con horario y directo a tu base de datos.

Empieza gratisCódigo abierto con licencia MIT: se instala con pip install anysite-cli.
550+fuentes detrás de una clave
3bases de datos: SQLite, PostgreSQL, ClickHouse
~1Ktokens en contexto, sea cual sea el tamaño del lote
MITlicencia, abierto en GitHub

Por qué lo eligen los equipos

Pipelines declarativos en YAML

Encadena fuentes con dependencias y define filtros, almacenamiento y horario en un solo fichero. Seis plantillas cubren los patrones habituales; las ejecuciones incrementales llevan un cursor para que nada se repita.

Lotes a escala de producción

Ejecución en paralelo, estrategias de error por fuente y reanudación tras una interrupción: los lotes de más de 10.000 registros se ejecutan solos y retoman donde lo dejaron.

Tu base de datos, no la nuestra

Los resultados se cargan directamente en SQLite, PostgreSQL o ClickHouse —o aterrizan como ficheros Parquet— y luego responden a SQL corriente a través de DuckDB.

Enriquecimiento con LLM de serie

Clasifica, resume, enriquece y deduplica registros como un paso más del pipeline —sentimiento en menciones, categorías en publicaciones— sin exportar a otra herramienta.

Pensado para agentes desde el primer día

Tu agente descubre endpoints, escribe el YAML, calcula el coste con --dry-run y ejecuta: respuestas JSON limpias y códigos de salida sobre los que puede actuar.

Al contexto solo llega la configuración

La recogida ocurre en local; los registros nunca pasan por el modelo. Las herramientas de flujos que empujan cada registro por el contexto queman ~500K tokens por cada 1.000 registros; el CLI se mantiene en ~1K, una mejora de 500× que llega a 50.000× con 100.000 registros.

Cómo funciona

01 · Instalar

Instala el CLI

Un paquete con licencia MIT. Pon tu clave de API y descarga el esquema de endpoints: la instalación entera son tres comandos.

pip install anysite-cli

02 · Describir

Describe el pipeline en YAML

Nombra tus fuentes, encadénalas con depends_on y define filtros y almacenamiento. O explícaselo a tu agente en lenguaje natural y deja que escriba el fichero.

anysite dataset init prospect-pipeline

03 · Ejecutar

Ejecútalo o ponlo en un horario

Calcula el coste con un dry run, ejecuta y déjaselo a cron. El modo incremental recoge solo lo que ha cambiado desde la última vez.

anysite dataset collect pipeline.yaml --dry-run

04 · Consultar

Los datos aterrizan en tu base de datos

Los registros llegan a SQLite, PostgreSQL o ClickHouse, listos para SQL y para pasos con LLM como classify y summarize cuando lo que quieres es una lectura, no filas.

anysite llm classify pipeline.yaml --source posts

El pipeline es un fichero YAML

Un pipeline, tres fuentes encadenadas
name: prospect-pipeline
sources:
  target_companies:
    endpoint: /api/companies/search
    input:
      industry: "SaaS"
      employee_count: "51-200"
    parallel: 3
  decision_makers:
    endpoint: /api/company/employees
    depends_on: target_companies
    input:
      company: ${target_companies.urn}
      keywords: "VP Sales, Director Sales"
    on_error: skip
  recent_posts:
    endpoint: /api/people/posts
    depends_on: decision_makers
storage:
  format: parquet
  path: ./data/prospects

El ejemplo real, recortado por espacio; las rutas de endpoint aparecen en forma genérica.

Del dry run a la clasificación con LLM
# Preview costs before running
anysite dataset collect pipeline.yaml --dry-run

# Execute the full pipeline
anysite dataset collect pipeline.yaml

# Run incremental updates
anysite dataset collect pipeline.yaml --incremental

# Query results with SQL
anysite dataset query pipeline.yaml \
  --sql "SELECT * FROM decision_makers WHERE title LIKE '%CTO%'"

# Classify posts with LLM
anysite llm classify pipeline.yaml --source recent_posts \
  --categories "product_update,hiring,thought_leadership"

Un fichero, cinco comandos: calcula el coste, ejecuta, refresca, consulta y clasifica.

De cero al primer pipeline en cuatro comandos
# Configure your API key
anysite config set api_key YOUR_API_KEY

# Update the schema
anysite schema update

# Make your first request
anysite api /api/people/profile user=satyanadella

# Create your first pipeline
anysite dataset init my-first-pipeline

El paso cero es pip install anysite-cli. Ruta de endpoint en forma genérica.

Lo que pides. Lo que recibes.

Vigilancia de la competencia, en cron

«Cada mañana, recoge las publicaciones nuevas de nuestros tres competidores en Twitter/X y Reddit, clasifícalas por tema y marca los picos.»

Qué pasa: Un pipeline programado recoge cada fuente en paralelo, dataset diff separa lo que ha cambiado desde ayer y un paso con LLM etiqueta cada publicación por tema y sentimiento.

Recibes: Una tabla diaria en PostgreSQL —publicaciones nuevas, tema, sentimiento, interacción— y un aviso por webhook cuando termina la ejecución.

Twitter/XRedditYouTube
Dataset de clientes potenciales, actualizado cada semana

«Monta una lista de empresas en fase seed de Y Combinator, saca a los fundadores y mantenla al día cada lunes.»

Qué pasa: El pipeline encadena la búsqueda de empresas con las consultas de fundadores mediante depends_on, se ejecuta de forma incremental y salta los registros que ya tiene.

Recibes: Una tabla de fundadores sin duplicados en SQLite con empresa, batch, rol y campos de perfil, al día de esta misma mañana.

Y CombinatorBusiness dataDuckDuckGo

Preguntas habituales

Corren sobre el mismo motor. MCP es conversacional: exploras fuentes, prototipas un flujo, haces preguntas sueltas desde Claude o Cursor. El CLI es operativo: el mismo flujo como pipeline en YAML, dimensionado por lotes, programado y conectado a tu base de datos. La mayoría de los equipos explora con MCP y ejecuta con el CLI.

La web es la base de datos. El agente se encarga de la ingeniería de datos.

Código abierto con licencia MIT: se instala con un pip install. Describe el pipeline esta noche y consulta la tabla mañana.