Sobre a Starya
A Starya desenvolve IA aplicada a operações complexas. Conectamos inteligência artificial, software e dados para transformar processos reais de negócio, com segurança, confiabilidade e controle.
Nossa plataforma, o NebulaOS, é a base para construir, integrar e operar essas soluções. Nosso trabalho combina engenharia próxima do cliente, desenvolvimento de produto e uma base de dados, infraestrutura e segurança.
O desafio
Construir mecanismos e práticas para operar o NebulaOS com comportamento observável e caminhos de recuperação conhecidos. Conectar infraestrutura, serviços e dependências às jornadas atendidas, usando evidências para orientar mudanças, dimensionamento e redução do trabalho manual. Trabalhar com quem desenvolve os componentes para que diagnóstico, recuperação e custos façam parte de sua evolução.
O que você vai fazer
- Definir indicadores de serviço (SLIs) e objetivos de confiabilidade (SLOs) com os responsáveis pelas jornadas. Documentar sucesso, falha, janela de medição e dependências; usar o orçamento de erro acordado para discutir ritmo de mudanças e priorização de melhorias com as equipes.
- Instrumentar métricas, traces e logs técnicos para conectar sintomas ao serviço, à fila ou à integração envolvida. Construir alertas acionáveis, painéis e roteiros de diagnóstico sem registrar dados pessoais, credenciais, prompts ou conteúdo de conversas, distinguindo tentativa enviada, resultado desconhecido e conclusão confirmada.
- Automatizar provisionamento e configuração com infraestrutura como código, contemplando rede, identidade, recursos e dependências. Manter módulos versionados, revisão de alterações, validação de planos e detecção de divergências entre configuração declarada e ambiente, com procedimentos reproduzíveis para criar ou recuperar componentes.
- Implementar implantação progressiva com critérios de promoção, observação e interrupção. Preparar rollbacks com quem mantém cada serviço, conferindo compatibilidade de configurações e schemas; para mudanças com efeitos persistentes, combinar reconciliação ou compensação e testar o procedimento antes da ampliação.
- Exercitar restauração de backups e recuperação de serviços com cenários representativos, registrando estado recuperado, dependências e limitações encontradas. Participar da resposta e investigação de incidentes, transformando recorrências em ações com responsável e evidência de conclusão junto aos donos dos componentes.
- Planejar capacidade a partir de demanda, filas, saturação e latência. Em serviços de inferência, analisar concorrência, uso de recursos e custo por execução útil com Engenharia e Pesquisa; comparar dimensionamento, limites e otimizações usando cargas representativas e qualidade esperada do serviço.
O que buscamos
- Conhecimento de Linux, redes e containers para investigar comunicação, recursos e processos, relacionando o comportamento da aplicação às condições do ambiente de execução.
- Experiência com Kubernetes ou orquestração equivalente e infraestrutura declarativa, compreendendo implantação, configuração, permissões, dependências e recuperação de componentes.
- Capacidade de automatizar operações em Python, Go ou TypeScript, com código versionado, testes e tratamento de falhas para tarefas repetíveis e investigáveis.
- Prática em observabilidade e análise de incidentes, usando sinais operacionais para formular hipóteses, localizar causas e escolher ações de recuperação e prevenção.
- Experiência colaborando em mudanças de produção, relacionando disponibilidade, compatibilidade e capacidade aos critérios de liberação e aos procedimentos de retorno ou reconciliação.
Diferenciais
- Experiência em AWS, OCI ou nuvens equivalentes e com Terraform ou ferramentas semelhantes, incluindo módulos reutilizáveis, revisão de planos e gestão de dependências.
- Vivência com OpenTelemetry, Datadog ou soluções equivalentes para instrumentação e diagnóstico, considerando cardinalidade, custo de coleta e utilidade dos sinais para as equipes.
- Experiência operando serviços de inferência, aceleradores ou cargas intensivas de dados, investigando filas, latência, memória e consumo para orientar dimensionamento e otimizações.
Seu impacto
O impacto será acompanhado pelos objetivos de confiabilidade das jornadas, duração e recorrência de incidentes, recuperação demonstrada em testes e esforço manual recorrente. Latência, saturação e custo por trabalho útil ajudam a avaliar capacidade. Metas e janelas serão combinadas por serviço, considerando dependências e consequências para quem usa o NebulaOS.
Com quem você constrói
Produção é trabalho compartilhado com as equipes que constroem serviços e integrações. SRE desenvolve mecanismos e participa do diagnóstico; os donos dos componentes implementam correções e mantêm procedimentos. Colabora com Dados na recuperação de cargas, Pesquisa na execução de modelos e Segurança nos controles operacionais, alinhando prioridades com as lideranças.