Pregunta de entrevista para Ingeniero de machine learning

Diseña un sistema de generación aumentada por recuperación sobre nuestra documentación interna. ¿Cuáles son las piezas?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Ingiere y trocea los documentos con una división consciente de la estructura, calcula embeddings de los trozos e indéxalos en un almacén vectorial junto a metadatos para filtrar. En consulta, calcula el embedding de la pregunta, recupera candidatos, opcionalmente reordena con un cross encoder, y luego construye un prompt con los pasajes recuperados y sus citas. Evalúa la recuperación y la generación por separado, y mantén el índice actualizado según cambien los documentos.

Por qué lo preguntan los entrevistadores

RAG es el sistema de ML aplicado más común que se está construyendo ahora mismo, así que los entrevistadores quieren saber si puedes razonarlo como un sistema de ingeniería y no como una demo. Escuchan la estrategia de troceado, una etapa de reordenación, el filtrado por metadatos y, sobre todo, la evaluación separada de recuperación y generación, porque la mayoría de los fallos de RAG son fallos de recuperación mal diagnosticados como que el modelo es malo.

Cómo estructurar tu respuesta

  • Recorre la ruta offline: trocear, calcular embeddings, indexar, con metadatos.
  • Recorre la ruta online: embedding, recuperar, reordenar, prompt.
  • Insiste en evaluar la recuperación por separado de la generación.
  • Cubre la frescura, los permisos y la cita de fuentes.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Offline troceo por estructura y no por un número fijo de caracteres, para que los encabezados y las secciones se mantengan intactos, con un poco de solape para no perder una frase que cruce un límite. Cada trozo recibe un embedding más metadatos: fuente, sección, última modificación y grupo de acceso, porque los permisos hay que aplicarlos en la recuperación y no pidiéndoselo educadamente al modelo. Eso va a un índice vectorial con un índice de palabras clave al lado, ya que la búsqueda híbrida gana de forma consistente a la vectorial pura en documentación interna llena de códigos de error y nombres de producto que los embeddings manejan mal. Online calculo el embedding de la consulta, saco unos cincuenta candidatos, reordeno con un cross encoder hasta cinco o seis, y luego construyo el prompt con esos pasajes e instrucciones para citarlos y para decir claramente cuando el contexto no cubre la pregunta. En lo que insisto es en la evaluación separada. Construyo un conjunto de preguntas reales con los documentos fuente correctos conocidos y mido el recall en k solo para la recuperación. La mayoría de las veces, cuando una respuesta está mal, la recuperación nunca sacó el trozo correcto, y ningún trabajo de prompt arregla eso.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo elegirías un tamaño de trozo para un corpus dado?
  • ¿Qué haces cuando el contexto recuperado se contradice a sí mismo?
  • ¿Cómo mantienes el índice sincronizado con documentos que cambian a diario?

Más preguntas para Ingeniero de machine learning

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot