Comunique primeiro: avise os stakeholders de que o dashboard está desatualizado e dê uma previsão de tempo, porque o silêncio transforma um problema de dados em um problema de confiança. Depois encontre a primeira task que falhou, e não o erro mais barulhento, já que as falhas seguintes normalmente são sintomas. Decida entre reprocessar a fatia que falhou e servir os dados de ontem com um aviso. Corrija, reexecute de forma idempotente, verifique as contagens de linhas e então documente a causa.
Por que os entrevistadores perguntam isso
Isso testa maturidade operacional e trato com stakeholders ao mesmo tempo. Os entrevistadores querem comunicação cedo, triagem a partir do topo do grafo de dependências e não do fundo, e uma decisão sobre dados parciais. Candidatos que só descrevem ler um stack trace esquecem que o impacto no negócio precisa ser gerenciado em paralelo com a correção.
Como estruturar sua resposta
- Notifique os stakeholders imediatamente com impacto e previsão.
- Encontre a primeira falha na DAG, não a última mensagem de erro.
- Classifique a causa: dado de origem, infraestrutura ou mudança de código.
- Escolha entre reexecutar, servir parcial ou segurar com aviso de dado desatualizado.
- Valide a reexecução com contagens de linhas e reconciliação antes de declarar resolvido.
Exemplo de resposta
Antes de depurar qualquer coisa eu posto no canal dos stakeholders que o dashboard está mostrando dados desatualizados, o que está afetado e quando eu vou atualizar de novo. Essa única mensagem evita umas dez interrupções e mantém a confiança intacta mesmo que a correção leve duas horas. Depois eu vou ao topo da DAG, porque em uma cadeia de quinze tasks que falharam, quatorze estão apenas depois de um problema real. Normalmente a causa real cai em três baldes: o dado de origem mudou, a infraestrutura oscilou, ou alguém fez merge de uma mudança. Uma olhada rápida em se algo entrou em deploy ontem resolve isso rápido. Da última vez que isso me aconteceu, o sistema de origem tinha renomeado uma coluna durante a noite sem avisar, então o modelo de staging falhou por campo faltando. Eu corrigi o modelo, reexecutei as partições afetadas, e como o pipeline é idempotente dava para fazer isso com segurança e sem limpeza. Depois eu conferi as contagens de linhas contra o dia anterior antes de dizer a alguém que estava resolvido, e abri uma conversa sobre contrato de dados com o time da origem.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você decidiria se publica dados parciais?
- O que você colocaria no lugar para que uma mudança de schema na origem não cause isso de novo?
- Como você comunica o frescor dos dados aos usuários do dashboard automaticamente?
Mais perguntas para Engenheiro de Dados
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas