Principais Responsabilidades

Triagem e Remediação de Alertas

  • Triagem, investigação e remediação de alertas complexos de Wipeout usando procedimentos orientados por runbook.
  • Executar replays de pipeline, reruns e análise de logs para diagnosticar e resolver alertas fora do SLO.
  • Manter o desempenho individual e em nível de pod em nível de SLO em ou acima de 80%.
  • Aproveitar ferramentas de desenvolvimento/triagem assistidas por IA (por exemplo, assistentes de codificação e depuração baseados em LLM) para acelerar a investigação e a resolução.

Análise da Causa Raiz e Feedback de Engenharia

  • Identificar, marcar e categorizar as causas raiz de alertas fora do SLO e padrões recorrentes de defeitos.
  • Aplicar e ajudar a refinar uma taxonomia/esquema da causa raiz em coordenação com stakeholders de engenharia do Google.
  • Escalar as descobertas estruturadas para as equipes principais de desenvolvimento para apoiar a deduplicação a montante e correções permanentes.

Documentação e Melhoria de Processos

  • Elaborar, refinar e manter manutenções leves e procedimentos operacionais padrão (SOPs).
  • Estabelecer e documentar caminhos bem iluminados para remediação de alertas repetíveis.
  • Contribuir para a melhoria contínua dos processos operacionais para reduzir a recorrência de problemas conhecidos.

Governança Operacional

  • Gerenciar o roteamento e escalonamento diário da triagem própria dentro do pod.
  • Apoiar auditorias de qualidade em repositórios internos e resultados de remediação.
  • Participar das cadências de governança (por exemplo, relatórios de status, revisões mensais de entregáveis) conforme exigido pelo contrato.
Habilidades Obrigatórias
  • Python
  • SQL
  • 3+ anos de experiência prática relevante em sistemas distribuídos/depuração de infraestrutura (preferencial).
Qualificações Preferenciais
  • Experiência prévia em ambientes de tecnologia em grande escala ou nuvem em hiperescala.
  • Experiência com sistemas de privacidade, retenção ou pipeline de exclusão de dados.
  • Exposição prévia a modelos de engajamento de serviços gerenciados por fornecedores/baseados em entregáveis.
  • Experiência contribuindo para a taxonomia da causa raiz ou para os marcos de classificação de defeitos.
Habilidades Técnicas Obrigatórias
  • Python forte proficiência em scripts, automação e depuração de pipelines.
  • C++ proficiência prática para inspecionar e depurar grandes alterações na base de código.
  • SQL forte proficiência em consulta de dados e diagnóstico de pipelines.
  • 3+ anos de experiência prática relevante em sistemas distribuídos/depuração de infraestrutura (preferencial).
Habilidades Operacionais e Analíticas
  • Experiência comprovada em gestão operacional de incidentes e análise de logs de sistemas.
  • Experiência comprovada em depuração de pipelines em sistemas de software em grande escala.
  • Experiência em remediação de defeitos baseada em runbook em ambientes de produção.
  • Capacidade de classificar e categorizar defeitos técnicos em taxonomias estruturadas.
Similar jobs

C++ & python sênior

Apply Now
Back to search page