Sobre a Starya
A Starya desenvolve IA aplicada a operações complexas. Conectamos inteligência artificial, software e dados para transformar processos reais de negócio, com segurança, confiabilidade e controle.
Nossa plataforma, o NebulaOS, é a base para construir, integrar e operar essas soluções. Nosso trabalho combina engenharia próxima do cliente, desenvolvimento de produto e uma base de dados, infraestrutura e segurança.
O desafio
Investigar, implementar e avaliar modelos e sistemas de IA para o NebulaOS, com foco em operações que exigem decisões verificáveis e controle sobre dados e ações. Você constrói evidências para escolher métodos, definir limites de uso e acompanhar seu comportamento quando crescem o volume, a concorrência e a diversidade das operações. O trabalho conecta pesquisa aplicada, avaliação rigorosa e engenharia para sustentar a evolução do produto em ambientes regulados.
O que você vai fazer
- Transformar problemas e riscos da operação em hipóteses, referências de comparação e critérios de aceitação com Produto, QA e especialistas do domínio. Medir acerto, omissão, ação indevida e abstenção; avaliar critérios de encaminhamento, efetividade e carga da revisão humana, considerando a consequência do erro em cada tarefa.
- Construir datasets e protocolos de avaliação com origem e uso autorizados, versões e critérios de anotação. Incluir casos frequentes, raros e críticos; separar desenvolvimento e teste, examinar contaminação e recortes por contexto e preservar isolamento e proteção de dados sensíveis.
- Avaliar modelos, recuperação de informação (RAG), contexto e uso de ferramentas como partes de um sistema. Testar respostas sem sustentação, fontes conflitantes, falhas de dependências e ações incorretas em ambientes controlados, verificando o resultado da tarefa e seus efeitos com Engenharia e QA.
- Combinar avaliações automatizadas e humanas. Calibrar avaliadores baseados em modelos contra julgamentos de especialistas, investigar discordâncias e estimar variabilidade e incerteza. Documentar cobertura e limites da avaliação, inclusive quando a evidência disponível for insuficiente para recomendar uma ampliação de uso.
- Projetar experimentos de escala com SWE e SRE para medir concorrência, vazão, latência de cauda, erros e timeouts sob cargas representativas. Calcular custo por tarefa concluída incluindo tentativas malsucedidas e repetições. Comparar inferência, modelos e contexto, verificando se ganhos de desempenho preservam qualidade e controles nos recortes críticos.
- Versionar código, datasets, corpus de recuperação, prompts e configurações; registrar versões ou identificadores de modelos externos e limites de reprodução. Vincular resultados aos artefatos avaliados e entregar experimentos, suítes de avaliação e evidências que apoiem revisão e liberação de mudanças, sem expor conteúdo sensível em logs ou relatórios.
- Acompanhar avaliações em produção com dados e amostras autorizados, comparando o comportamento observado ao validado. Investigar mudanças de distribuição e qualidade, incorporar falhas aos testes e propor critérios de ampliação gradual, interrupção ou retorno à versão anterior com os responsáveis pelo serviço.
O que buscamos
- Fundamentos de aprendizado de máquina, estatística e desenho experimental, com capacidade de formular hipóteses, escolher baselines, analisar amostras e interpretar incerteza, viés e limitações das medidas.
- Experiência prática com Python e engenharia de software para implementar experimentos e mecanismos de avaliação, organizar testes e dependências e produzir código que outras pessoas consigam executar, revisar e manter.
- Experiência avaliando modelos ou aplicações de IA, com métricas por tarefa, conjuntos de teste versionados, análise de erros e comparação entre versões. Compreender contaminação, cobertura, avaliações humanas e limitações dos avaliadores automáticos.
- Capacidade de investigar desempenho de sistemas de IA e relacionar qualidade a latência, concorrência, consumo de recursos e custo. Traduzir resultados experimentais em requisitos de execução e validação com a engenharia.
- Prática de rastreabilidade e controle de mudanças, com atenção a acesso autorizado, dados restritos e registros de avaliação. Conseguir explicar qual versão foi avaliada, com quais dados, critérios e limites de uso.
- Capacidade de ler trabalhos técnicos, transformar métodos em comparações executáveis e discutir resultados com especialistas do domínio. Comunicar incertezas e consequências operacionais de forma útil para decisões compartilhadas de produto e liberação.
Diferenciais
- Experiência com IA em saúde, seguros, serviços financeiros ou outros ambientes regulados, trabalhando com especialistas na definição de critérios, revisão humana, evidências de validação e acompanhamento de mudanças.
- Vivência com inferência em escala, adaptação ou otimização de modelos, incluindo experimentos que comparem eficiência e qualidade sob cargas representativas, em colaboração com engenharia de produto e infraestrutura.
- Experiência com avaliações adversariais, calibração de avaliadores automáticos ou programas de avaliação humana, investigando erros raros, discordâncias e comportamento de agentes com múltiplas etapas.
Seu impacto
Seu impacto será avaliado pelas decisões de evolução sustentadas por evidências: avaliações reproduzíveis, regressões relevantes detectadas antes da ampliação e limites de uso claros. Qualidade por tarefa e recorte, erros críticos e custo e latência conforme a carga cresce orientam essa avaliação. Cada mudança deve estar relacionada à versão, aos critérios e aos resultados que sustentaram sua liberação.
Com quem você constrói
AI Research desenvolve e mantém métodos, avaliadores e critérios de qualidade; QA integra essas avaliações à regressão das jornadas. SWE incorpora as capacidades ao produto e SRE colabora na infraestrutura e nos experimentos de escala. Dados apoia os conjuntos de avaliação; Segurança e especialistas do domínio ajudam a definir riscos e controles. Produto e os responsáveis pelo serviço compartilham as decisões de uso e liberação.