Principais Responsabilidades
Triagem e Remediação de Alertas
- Triagem, investigação e remediação de alertas complexos de Wipeout usando procedimentos orientados por runbook.
- Executar replays de pipeline, reruns e análise de logs para diagnosticar e resolver alertas fora do SLO.
- Manter o desempenho individual e em nível de pod em nível de SLO em ou acima de 80%.
- Aproveitar ferramentas de desenvolvimento/triagem assistidas por IA (por exemplo, assistentes de codificação e depuração baseados em LLM) para acelerar a investigação e a resolução.
Análise da Causa Raiz e Feedback de Engenharia
- Identificar, marcar e categorizar as causas raiz de alertas fora do SLO e padrões recorrentes de defeitos.
- Aplicar e ajudar a refinar uma taxonomia/esquema da causa raiz em coordenação com stakeholders de engenharia do Google.
- Escalar as descobertas estruturadas para as equipes principais de desenvolvimento para apoiar a deduplicação a montante e correções permanentes.
Documentação e Melhoria de Processos
- Elaborar, refinar e manter manutenções leves e procedimentos operacionais padrão (SOPs).
- Estabelecer e documentar caminhos bem iluminados para remediação de alertas repetíveis.
- Contribuir para a melhoria contínua dos processos operacionais para reduzir a recorrência de problemas conhecidos.
Governança Operacional
- Gerenciar o roteamento e escalonamento diário da triagem própria dentro do pod.
- Apoiar auditorias de qualidade em repositórios internos e resultados de remediação.
- Participar das cadências de governança (por exemplo, relatórios de status, revisões mensais de entregáveis) conforme exigido pelo contrato.
Habilidades Obrigatórias
- Python
- SQL
- 3+ anos de experiência prática relevante em sistemas distribuídos/depuração de infraestrutura (preferencial).
Qualificações Preferenciais
- Experiência prévia em ambientes de tecnologia em grande escala ou nuvem em hiperescala.
- Experiência com sistemas de privacidade, retenção ou pipeline de exclusão de dados.
- Exposição prévia a modelos de engajamento de serviços gerenciados por fornecedores/baseados em entregáveis.
- Experiência contribuindo para a taxonomia da causa raiz ou para os marcos de classificação de defeitos.
Habilidades Técnicas Obrigatórias
- Python forte proficiência em scripts, automação e depuração de pipelines.
- C++ proficiência prática para inspecionar e depurar grandes alterações na base de código.
- SQL forte proficiência em consulta de dados e diagnóstico de pipelines.
- 3+ anos de experiência prática relevante em sistemas distribuídos/depuração de infraestrutura (preferencial).
Habilidades Operacionais e Analíticas
- Experiência comprovada em gestão operacional de incidentes e análise de logs de sistemas.
- Experiência comprovada em depuração de pipelines em sistemas de software em grande escala.
- Experiência em remediação de defeitos baseada em runbook em ambientes de produção.
- Capacidade de classificar e categorizar defeitos técnicos em taxonomias estruturadas.