Seu pipeline de dados é um arquivo YAML
A linha de comando de código aberto para coleta em produção: descreva fontes, filtros e armazenamento em YAML — a CLI coleta em lote, no horário marcado, direto no seu banco de dados.
Por que os times escolhem
Pipelines declarativos em YAML
Encadeie fontes com dependências, defina filtros, armazenamento e agendamento em um arquivo só. Seis templates cobrem os padrões comuns; as rodadas incrementais guardam um cursor para nada se repetir.
Lote em escala de produção
Execução em paralelo, estratégias de erro por fonte e retomada depois de interrupção — lotes de mais de 10.000 registros rodam sozinhos e continuam de onde pararam.
Seu banco de dados, não o nosso
Os resultados entram direto no SQLite, no PostgreSQL ou no ClickHouse — ou caem como arquivos Parquet — e depois respondem a SQL puro pelo DuckDB.
Enriquecimento com LLM embutido
Classifique, resuma, enriqueça e remova duplicatas como etapa do pipeline — sentimento nas menções, categoria nos posts — sem exportar para outra ferramenta.
Pronta para agentes por design
Seu agente descobre os endpoints, escreve o YAML, estima o custo com --dry-run e executa — respostas em JSON limpo e códigos de saída que ele sabe interpretar.
Só a configuração entra no contexto
A coleta roda localmente; os registros nunca passam pelo modelo. Ferramentas de workflow que empurram cada registro pelo contexto queimam ~500K tokens a cada 1.000 registros; a CLI se mantém em ~1K — um ganho de 500×, que chega a 50.000× em 100.000 registros.
Como funciona
Instale a CLI
Um pacote, licença MIT. Configure sua chave de API e baixe o schema dos endpoints — a instalação inteira são três comandos.
pip install anysite-cli
Descreva o pipeline em YAML
Nomeie as fontes, encadeie com depends_on, defina filtros e armazenamento. Ou passe o briefing em linguagem comum e deixe seu agente escrever o arquivo.
anysite dataset init prospect-pipeline
Rode — ou coloque no agendamento
Veja o custo com um dry run, execute e entregue ao cron. O modo incremental coleta só o que mudou desde a última rodada.
anysite dataset collect pipeline.yaml --dry-run
O dado cai no seu banco de dados
Os registros chegam ao SQLite, ao PostgreSQL ou ao ClickHouse, prontos para SQL — e para etapas de LLM como classify e summarize, quando você quer uma leitura, não linhas.
anysite llm classify pipeline.yaml --source posts
O pipeline é um arquivo YAML
name: prospect-pipeline
sources:
target_companies:
endpoint: /api/companies/search
input:
industry: "SaaS"
employee_count: "51-200"
parallel: 3
decision_makers:
endpoint: /api/company/employees
depends_on: target_companies
input:
company: ${target_companies.urn}
keywords: "VP Sales, Director Sales"
on_error: skip
recent_posts:
endpoint: /api/people/posts
depends_on: decision_makers
storage:
format: parquet
path: ./data/prospectsO exemplo real, encurtado — os caminhos dos endpoints aparecem em forma genérica.
# Preview costs before running anysite dataset collect pipeline.yaml --dry-run # Execute the full pipeline anysite dataset collect pipeline.yaml # Run incremental updates anysite dataset collect pipeline.yaml --incremental # Query results with SQL anysite dataset query pipeline.yaml \ --sql "SELECT * FROM decision_makers WHERE title LIKE '%CTO%'" # Classify posts with LLM anysite llm classify pipeline.yaml --source recent_posts \ --categories "product_update,hiring,thought_leadership"
Um arquivo, cinco comandos — ver o custo, rodar, atualizar, consultar, classificar.
# Configure your API key anysite config set api_key YOUR_API_KEY # Update the schema anysite schema update # Make your first request anysite api /api/people/profile user=satyanadella # Create your first pipeline anysite dataset init my-first-pipeline
O passo zero é pip install anysite-cli. O caminho do endpoint aparece em forma genérica.
O que você pede. O que você recebe.
“Toda manhã, colete os posts novos dos nossos três concorrentes no Twitter/X e no Reddit, classifique por tema e sinalize os picos”.
O que acontece: Um pipeline agendado coleta cada fonte em paralelo, o dataset diff separa o que mudou desde ontem e uma etapa de LLM rotula cada post por tema e sentimento.
Você recebe: Uma tabela diária no PostgreSQL — posts novos, tema, sentimento, engajamento — mais um webhook avisando quando a rodada termina.
“Monte uma lista de empresas seed do Y Combinator, puxe os fundadores e mantenha atualizada toda segunda-feira”.
O que acontece: O pipeline encadeia a busca de empresas com a consulta de fundadores via depends_on, roda de forma incremental e pula os registros que já tem.
Você recebe: Uma tabela de fundadores sem duplicatas no SQLite, com empresa, batch, cargo e perfil — atualizada até esta manhã.
Perguntas frequentes
Os dois rodam no mesmo motor. O MCP é conversacional: explore fontes, prototipe um workflow, faça perguntas pontuais no Claude ou no Cursor. A CLI é operacional: o mesmo workflow como pipeline YAML, em lote, agendado e gravando no seu banco. A maioria dos times explora no MCP e executa na CLI.
A web é o banco de dados. O agente é o engenheiro de dados.
Código aberto, licença MIT: um pip install e pronto. Descreva o pipeline hoje à noite; consulte a tabela amanhã.