Cada token é projetado em um vetor de query, um de key e um de value. Você pontua cada query contra cada key com um produto escalar, escala pela raiz quadrada da dimensão da head, aplica softmax nos scores para virar pesos, e faz a soma ponderada dos values. Cada token acaba carregando uma representação misturada a partir de quaisquer outros tokens que ele achou relevantes. Múltiplas heads fazem isso em paralelo com projeções diferentes.
Por que os entrevistadores perguntam isso
Transformers sustentam quase tudo que está sendo lançado hoje, então entrevistadores esperam uma explicação mecânica em vez de uma analogia sobre atenção ser como foco. O fator de escala e o softmax são os detalhes que as pessoas esquecem, e o custo quadrático no comprimento da sequência é o follow up para onde eles estão te levando, porque é isso que restringe o tamanho do contexto e o custo de serving na prática.
Como estruturar sua resposta
- Descreva as projeções de query, key e value em uma frase.
- Percorra produto escalar, escala, softmax e soma ponderada em ordem.
- Diga o que múltiplas heads acrescentam.
- Note o custo quadrático no comprimento da sequência e por que isso importa.
Exemplo de resposta
Cada embedding de token é multiplicado por três matrizes aprendidas para produzir uma query, uma key e um value. A query é o que este token está procurando, a key é o que ele anuncia, o value é o que ele repassa se for selecionado. Você tira o produto escalar de cada query com cada key, o que dá um score de compatibilidade para cada par de posições. Divida pela raiz quadrada da dimensão da head, porque senão os produtos escalares crescem com a dimensionalidade e empurram o softmax para uma região onde ele é efetivamente um argmax duro com gradientes que desaparecem. O softmax ao longo da linha transforma esses scores em pesos que somam um, e aí você tira a soma ponderada dos vetores de value. Então cada token sai carregando uma mistura dos tokens com que ele se importou. Múltiplas heads rodam essa operação inteira em paralelo com projeções separadas, então uma head pode acompanhar sintaxe enquanto outra acompanha correferência, e as saídas são concatenadas e projetadas. O custo que vale citar é que a matriz de scores é o comprimento da sequência ao quadrado, e é exatamente por isso que servir contexto longo é caro e por que flash attention e KV caching importam tanto.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- O que o KV cache guarda durante a decodificação autorregressiva, e por quê?
- Como o mascaramento causal muda a computação?
- Do que as variantes de atenção subquadrática abrem mão?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas