Ir para o conteúdo

Data, Infrastructure & Security

Site Reliability Engineer (SRE)

Construa infraestrutura, automações e observabilidade para implantar e operar o NebulaOS, recuperar falhas e manter capacidade e custos adequados ao uso.

Banco de talentos

Sobre a Starya

A Starya desenvolve IA aplicada a operações complexas. Conectamos inteligência artificial, software e dados para transformar processos reais de negócio, com segurança, confiabilidade e controle.

Nossa plataforma, o NebulaOS, é a base para construir, integrar e operar essas soluções. Nosso trabalho combina engenharia próxima do cliente, desenvolvimento de produto e uma base de dados, infraestrutura e segurança.

O desafio

Construir mecanismos e práticas para operar o NebulaOS com comportamento observável e caminhos de recuperação conhecidos. Conectar infraestrutura, serviços e dependências às jornadas atendidas, usando evidências para orientar mudanças, dimensionamento e redução do trabalho manual. Trabalhar com quem desenvolve os componentes para que diagnóstico, recuperação e custos façam parte de sua evolução.

O que você vai fazer

  • Definir indicadores de serviço (SLIs) e objetivos de confiabilidade (SLOs) com os responsáveis pelas jornadas. Documentar sucesso, falha, janela de medição e dependências; usar o orçamento de erro acordado para discutir ritmo de mudanças e priorização de melhorias com as equipes.
  • Instrumentar métricas, traces e logs técnicos para conectar sintomas ao serviço, à fila ou à integração envolvida. Construir alertas acionáveis, painéis e roteiros de diagnóstico sem registrar dados pessoais, credenciais, prompts ou conteúdo de conversas, distinguindo tentativa enviada, resultado desconhecido e conclusão confirmada.
  • Automatizar provisionamento e configuração com infraestrutura como código, contemplando rede, identidade, recursos e dependências. Manter módulos versionados, revisão de alterações, validação de planos e detecção de divergências entre configuração declarada e ambiente, com procedimentos reproduzíveis para criar ou recuperar componentes.
  • Implementar implantação progressiva com critérios de promoção, observação e interrupção. Preparar rollbacks com quem mantém cada serviço, conferindo compatibilidade de configurações e schemas; para mudanças com efeitos persistentes, combinar reconciliação ou compensação e testar o procedimento antes da ampliação.
  • Exercitar restauração de backups e recuperação de serviços com cenários representativos, registrando estado recuperado, dependências e limitações encontradas. Participar da resposta e investigação de incidentes, transformando recorrências em ações com responsável e evidência de conclusão junto aos donos dos componentes.
  • Planejar capacidade a partir de demanda, filas, saturação e latência. Em serviços de inferência, analisar concorrência, uso de recursos e custo por execução útil com Engenharia e Pesquisa; comparar dimensionamento, limites e otimizações usando cargas representativas e qualidade esperada do serviço.

O que buscamos

  • Conhecimento de Linux, redes e containers para investigar comunicação, recursos e processos, relacionando o comportamento da aplicação às condições do ambiente de execução.
  • Experiência com Kubernetes ou orquestração equivalente e infraestrutura declarativa, compreendendo implantação, configuração, permissões, dependências e recuperação de componentes.
  • Capacidade de automatizar operações em Python, Go ou TypeScript, com código versionado, testes e tratamento de falhas para tarefas repetíveis e investigáveis.
  • Prática em observabilidade e análise de incidentes, usando sinais operacionais para formular hipóteses, localizar causas e escolher ações de recuperação e prevenção.
  • Experiência colaborando em mudanças de produção, relacionando disponibilidade, compatibilidade e capacidade aos critérios de liberação e aos procedimentos de retorno ou reconciliação.

Diferenciais

  • Experiência em AWS, OCI ou nuvens equivalentes e com Terraform ou ferramentas semelhantes, incluindo módulos reutilizáveis, revisão de planos e gestão de dependências.
  • Vivência com OpenTelemetry, Datadog ou soluções equivalentes para instrumentação e diagnóstico, considerando cardinalidade, custo de coleta e utilidade dos sinais para as equipes.
  • Experiência operando serviços de inferência, aceleradores ou cargas intensivas de dados, investigando filas, latência, memória e consumo para orientar dimensionamento e otimizações.

Seu impacto

O impacto será acompanhado pelos objetivos de confiabilidade das jornadas, duração e recorrência de incidentes, recuperação demonstrada em testes e esforço manual recorrente. Latência, saturação e custo por trabalho útil ajudam a avaliar capacidade. Metas e janelas serão combinadas por serviço, considerando dependências e consequências para quem usa o NebulaOS.

Com quem você constrói

Produção é trabalho compartilhado com as equipes que constroem serviços e integrações. SRE desenvolve mecanismos e participa do diagnóstico; os donos dos componentes implementam correções e mantêm procedimentos. Colabora com Dados na recuperação de cargas, Pesquisa na execução de modelos e Segurança nos controles operacionais, alinhando prioridades com as lideranças.

Data, Infrastructure & Security

Outros perfis nesta área

  • Data, Infrastructure & Security

    Data Engineer

    Desenvolva pipelines de ingestão e modelos de dados para o NebulaOS, preservando histórico, qualidade e significado das informações que vêm dos sistemas dos clientes.

  • Data, Infrastructure & Security

    Security Engineer

    Implemente e teste autorização, isolamento entre clientes e proteção de dados no NebulaOS, do código e das integrações à infraestrutura de execução.