Ir para o conteúdo

Data, Infrastructure & Security

Data Engineer

Desenvolva pipelines de ingestão e modelos de dados para o NebulaOS, preservando histórico, qualidade e significado das informações que vêm dos sistemas dos clientes.

Banco de talentos

Sobre a Starya

A Starya desenvolve IA aplicada a operações complexas. Conectamos inteligência artificial, software e dados para transformar processos reais de negócio, com segurança, confiabilidade e controle.

Nossa plataforma, o NebulaOS, é a base para construir, integrar e operar essas soluções. Nosso trabalho combina engenharia próxima do cliente, desenvolvimento de produto e uma base de dados, infraestrutura e segurança.

O desafio

Projetar, implementar e manter a circulação de dados entre sistemas empresariais e o NebulaOS. Organizar ingestão, transformação e modelos de consumo para que produtos, análises e operações utilizem informações com significado e qualidade verificáveis. Preservar a relação com a fonte oficial e tornar explícitos histórico, atualização, permissões e procedimentos para corrigir ou reprocessar uma carga.

O que você vai fazer

  • Construir conectores para bancos, APIs, arquivos ou eventos conforme a necessidade da fonte. Definir carga inicial, backfill e captura de mudanças (CDC), documentando limites de leitura, pontos de continuidade e reconciliação entre o histórico carregado e as alterações recebidas durante o processamento.
  • Implementar pipelines com checkpoints, deduplicação, tratamento de eventos atrasados e retentativas limitadas. Preparar reprocessamento idempotente, diagnóstico de registros rejeitados e testes de evolução de schema; registrar como alterações de campos, tipos e contratos chegam aos consumidores e como recuperar uma execução interrompida.
  • Modelar entidades, eventos e relações com granularidade explícita e semântica acordada. Preservar histórico e validade temporal, distinguindo momento do evento e do processamento; definir tratamento de correções, exclusões e mudanças cadastrais para reconstruir o estado pertinente a uma análise ou operação.
  • Desenvolver transformações em SQL e Python e organizar camadas de dados brutos, tratados e de consumo conforme o desenho. Versionar código e modelos, documentar linhagem e separar regras reutilizáveis de adaptações por cliente, com testes e responsáveis pela manutenção de cada parte.
  • Implementar verificações de completude, consistência, unicidade e atualização para cada conjunto de dados. Relacionar alertas a consumidores e efeitos no processo; disponibilizar evidências de qualidade e procedimentos para investigar divergências, corrigir transformações e validar a carga antes de retomar seu consumo.
  • Manter os sistemas do cliente como fontes oficiais dos dados que originam e executar escritas por integrações autorizadas. Aplicar isolamento entre organizações, acesso e retenção acordados nas cargas, modelos e cópias, conferindo destinos e preservando rastreabilidade durante correções e reprocessamentos.

O que buscamos

  • Conhecimento de SQL para modelagem, transformações e investigação de consultas, incluindo joins, agregações, granularidade e efeitos de duplicidades ou valores ausentes no resultado.
  • Experiência com Python para integração e processamento de dados, organizando código testável, tratamento de erros e automação de tarefas que possam ser reexecutadas com segurança.
  • Compreensão de ingestão e contratos de dados: cargas incrementais, ordenação, alterações de schema e recuperação de falhas; capacidade de escolher estratégias compatíveis com a fonte.
  • Prática em modelagem analítica e histórica, com capacidade de explicar chaves, relacionamentos, validade temporal e significado das medidas junto aos especialistas e consumidores.
  • Experiência mantendo pipelines versionados e verificações de qualidade, usando evidências para investigar divergências e documentar permissões, dependências e procedimentos de correção.

Diferenciais

  • Experiência com dbt ou abordagem equivalente para organizar transformações SQL, testes, documentação e dependências, considerando evolução dos modelos e consumo por diferentes equipes.
  • Vivência com BigQuery, ClickHouse ou mecanismos analíticos equivalentes, incluindo escolhas de particionamento, organização física, desempenho e custo coerentes com as consultas e cargas.
  • Experiência com CDC, eventos ou integrações empresariais heterogêneas, especialmente na reconciliação de histórico, dados atrasados e mudanças de significado entre sistemas.

Seu impacto

Seu trabalho será acompanhado por atualização e cobertura das verificações de qualidade, tempo para disponibilizar uma fonte, esforço de reprocessamento e custo por volume útil processado. Regressões após mudanças de origem e divergências percebidas pelos consumidores ajudam a escolher melhorias. As medidas devem considerar granularidade, janela e necessidade de cada operação.

Com quem você constrói

Trabalha com PM e especialistas do cliente na semântica e nos critérios de aceitação. Com SWE, combina contratos de APIs e eventos; com FDEs, entende particularidades das fontes. SRE participa da capacidade e recuperação, e Segurança dos requisitos de acesso e proteção. Os responsáveis pelas fontes autorizam mudanças e integrações de escrita.

Data, Infrastructure & Security

Outros perfis nesta área