Cada token se proyecta a un vector query, uno key y uno value. Puntúas cada query contra cada key con un producto escalar, escalas por la raíz cuadrada de la dimensión de la cabeza, aplicas softmax a las puntuaciones para convertirlas en pesos, y tomas la suma ponderada de los values. Cada token acaba con una representación mezclada a partir de los tokens que le resultaron relevantes. Varias cabezas hacen esto en paralelo con proyecciones distintas.
Por qué lo preguntan los entrevistadores
Los transformers están debajo de casi todo lo que se publica ahora, así que los entrevistadores esperan una explicación mecánica y no una analogía sobre que la atención es como el foco. El factor de escala y el softmax son los detalles que la gente olvida, y el coste cuadrático en la longitud de secuencia es la repregunta hacia la que te llevan, porque es lo que limita en la práctica la longitud de contexto y el coste de servir.
Cómo estructurar tu respuesta
- Describe las proyecciones query, key y value en una frase.
- Recorre en orden el producto escalar, el escalado, el softmax y la suma ponderada.
- Di qué añaden varias cabezas.
- Anota el coste cuadrático en la longitud de secuencia y por qué importa.
Ejemplo de respuesta
Cada embedding de token se multiplica por tres matrices aprendidas para producir una query, una key y un value. La query es lo que este token busca, la key es lo que anuncia, el value es lo que pasa adelante si lo seleccionan. Haces el producto escalar de cada query con cada key, lo que da una puntuación de compatibilidad para cada par de posiciones. Divides por la raíz cuadrada de la dimensión de la cabeza, porque si no los productos escalares crecen con la dimensionalidad y empujan el softmax a una zona donde es de hecho un argmax duro con gradientes que se desvanecen. El softmax a lo largo de la fila convierte esas puntuaciones en pesos que suman uno, y luego tomas la suma ponderada de los vectores value. Así que cada token se lleva una mezcla de los tokens que le importaron. Varias cabezas ejecutan toda esa operación en paralelo con proyecciones separadas, así que una cabeza puede seguir la sintaxis mientras otra sigue la correferencia, y las salidas se concatenan y se proyectan. El coste que vale la pena nombrar es que la matriz de puntuaciones es longitud de secuencia al cuadrado, que es justo por lo que servir contexto largo sale caro y por lo que flash attention y la caché KV importan tanto.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Qué guarda la caché KV durante la decodificación autorregresiva, y por qué?
- ¿Cómo cambia el enmascarado causal el cálculo?
- ¿A qué renuncian las variantes de atención subcuadráticas?
Más preguntas para Ingeniero de machine learning
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas