Pular para o conteúdo
//Anysite CLI

Seu pipeline de dados é um arquivo YAML

A linha de comando de código aberto para coleta em produção: descreva fontes, filtros e armazenamento em YAML — a CLI coleta em lote, no horário marcado, direto no seu banco de dados.

Começar grátisLicença MIT, código aberto — instale com pip install anysite-cli.
550+fontes com uma chave
3bancos de dados — SQLite, PostgreSQL, ClickHouse
~1Ktokens no contexto, em qualquer tamanho de lote
MITlicença, aberto no GitHub

Por que os times escolhem

Pipelines declarativos em YAML

Encadeie fontes com dependências, defina filtros, armazenamento e agendamento em um arquivo só. Seis templates cobrem os padrões comuns; as rodadas incrementais guardam um cursor para nada se repetir.

Lote em escala de produção

Execução em paralelo, estratégias de erro por fonte e retomada depois de interrupção — lotes de mais de 10.000 registros rodam sozinhos e continuam de onde pararam.

Seu banco de dados, não o nosso

Os resultados entram direto no SQLite, no PostgreSQL ou no ClickHouse — ou caem como arquivos Parquet — e depois respondem a SQL puro pelo DuckDB.

Enriquecimento com LLM embutido

Classifique, resuma, enriqueça e remova duplicatas como etapa do pipeline — sentimento nas menções, categoria nos posts — sem exportar para outra ferramenta.

Pronta para agentes por design

Seu agente descobre os endpoints, escreve o YAML, estima o custo com --dry-run e executa — respostas em JSON limpo e códigos de saída que ele sabe interpretar.

Só a configuração entra no contexto

A coleta roda localmente; os registros nunca passam pelo modelo. Ferramentas de workflow que empurram cada registro pelo contexto queimam ~500K tokens a cada 1.000 registros; a CLI se mantém em ~1K — um ganho de 500×, que chega a 50.000× em 100.000 registros.

Como funciona

01 · Instalar

Instale a CLI

Um pacote, licença MIT. Configure sua chave de API e baixe o schema dos endpoints — a instalação inteira são três comandos.

pip install anysite-cli

02 · Descrever

Descreva o pipeline em YAML

Nomeie as fontes, encadeie com depends_on, defina filtros e armazenamento. Ou passe o briefing em linguagem comum e deixe seu agente escrever o arquivo.

anysite dataset init prospect-pipeline

03 · Rodar

Rode — ou coloque no agendamento

Veja o custo com um dry run, execute e entregue ao cron. O modo incremental coleta só o que mudou desde a última rodada.

anysite dataset collect pipeline.yaml --dry-run

04 · Consultar

O dado cai no seu banco de dados

Os registros chegam ao SQLite, ao PostgreSQL ou ao ClickHouse, prontos para SQL — e para etapas de LLM como classify e summarize, quando você quer uma leitura, não linhas.

anysite llm classify pipeline.yaml --source posts

O pipeline é um arquivo YAML

Um pipeline, três fontes encadeadas
name: prospect-pipeline
sources:
  target_companies:
    endpoint: /api/companies/search
    input:
      industry: "SaaS"
      employee_count: "51-200"
    parallel: 3
  decision_makers:
    endpoint: /api/company/employees
    depends_on: target_companies
    input:
      company: ${target_companies.urn}
      keywords: "VP Sales, Director Sales"
    on_error: skip
  recent_posts:
    endpoint: /api/people/posts
    depends_on: decision_makers
storage:
  format: parquet
  path: ./data/prospects

O exemplo real, encurtado — os caminhos dos endpoints aparecem em forma genérica.

Do dry run ao classify com LLM
# Preview costs before running
anysite dataset collect pipeline.yaml --dry-run

# Execute the full pipeline
anysite dataset collect pipeline.yaml

# Run incremental updates
anysite dataset collect pipeline.yaml --incremental

# Query results with SQL
anysite dataset query pipeline.yaml \
  --sql "SELECT * FROM decision_makers WHERE title LIKE '%CTO%'"

# Classify posts with LLM
anysite llm classify pipeline.yaml --source recent_posts \
  --categories "product_update,hiring,thought_leadership"

Um arquivo, cinco comandos — ver o custo, rodar, atualizar, consultar, classificar.

Do zero ao primeiro pipeline em quatro comandos
# Configure your API key
anysite config set api_key YOUR_API_KEY

# Update the schema
anysite schema update

# Make your first request
anysite api /api/people/profile user=satyanadella

# Create your first pipeline
anysite dataset init my-first-pipeline

O passo zero é pip install anysite-cli. O caminho do endpoint aparece em forma genérica.

O que você pede. O que você recebe.

Vigia de concorrentes, no cron

“Toda manhã, colete os posts novos dos nossos três concorrentes no Twitter/X e no Reddit, classifique por tema e sinalize os picos”.

O que acontece: Um pipeline agendado coleta cada fonte em paralelo, o dataset diff separa o que mudou desde ontem e uma etapa de LLM rotula cada post por tema e sentimento.

Você recebe: Uma tabela diária no PostgreSQL — posts novos, tema, sentimento, engajamento — mais um webhook avisando quando a rodada termina.

Twitter/XRedditYouTube
Base de prospects, atualizada toda semana

“Monte uma lista de empresas seed do Y Combinator, puxe os fundadores e mantenha atualizada toda segunda-feira”.

O que acontece: O pipeline encadeia a busca de empresas com a consulta de fundadores via depends_on, roda de forma incremental e pula os registros que já tem.

Você recebe: Uma tabela de fundadores sem duplicatas no SQLite, com empresa, batch, cargo e perfil — atualizada até esta manhã.

Y CombinatorBusiness dataDuckDuckGo

Perguntas frequentes

Os dois rodam no mesmo motor. O MCP é conversacional: explore fontes, prototipe um workflow, faça perguntas pontuais no Claude ou no Cursor. A CLI é operacional: o mesmo workflow como pipeline YAML, em lote, agendado e gravando no seu banco. A maioria dos times explora no MCP e executa na CLI.

A web é o banco de dados. O agente é o engenheiro de dados.

Código aberto, licença MIT: um pip install e pronto. Descreva o pipeline hoje à noite; consulte a tabela amanhã.