Todas las entradas

Contratación · August 2, 2026 · 12 min de lectura

Preguntas de entrevista para ingenieros de prompts: cómo evaluar las respuestas

Preguntas de entrevista para ingenieros de prompts dirigidas al responsable de contratación: 24 preguntas agrupadas por competencia, cómo suenan las respuestas fuertes y débiles, y cuándo evaluar en lugar de preguntar.

Por Aayesha Patel · Co-founder, Hanzomon Inc

Compartir

Parte de Los cinco pilares de la contratación: qué miden las evaluaciones

Contratación
En esta página

Esta guía es para el responsable de contratación sentado frente a un candidato a ingeniero de prompts, intentando determinar si las respuestas fluidas describen una disciplina real o un guión memorizado. Esa distinción nunca ha sido más difícil de trazar, porque el candidato casi con certeza se preparó con un asistente. Cualquier pregunta con una respuesta ordenada y consultable —defina el prompting few-shot, enumere tres formas de reducir las alucinaciones— es ahora un examen filtrado: leyeron los mismos hilos que usted, los pasaron a un modelo y llegaron con una recitación pulida que no dice nada sobre si pueden hacer el trabajo. Así que esto no es una lista de preguntas para disparar y marcar. Es una guía para evaluar las respuestas: cómo suena una respuesta fuerte frente a una débil, cómo puntuar de forma consistente y —la parte que todos los artículos de listas omiten— cuándo dejar de preguntar y empezar a ver a la persona trabajar. El puesto se ha consolidado, pasando de ser un truco de redacción a una disciplina de sistemas basada en la medición, y la habilidad con las frases es ahora la señal de impostor más clara.

¿Cómo se puntúan las respuestas de la entrevista de forma consistente?

Antes de las preguntas, la puntuación — porque las entrevistas no estructuradas recompensan a quien más se parece al entrevistador, no a quien puede hacer el trabajo. Decida las preguntas de una vez, haga a cada candidato las mismas en el mismo orden y escriba qué contiene una respuesta débil, adecuada y fuerte antes de que nadie se siente. Eso es la puntuación anclada conductualmente, y es el único cambio que más mejora la precisión con que una entrevista predice el rendimiento.

El anclaje funciona porque le obliga a comprometerse con un estándar mientras todavía está tranquilo, en lugar de convencerse de que un candidato agradable a las cuatro de la tarde es ideal. Una rúbrica práctica va de uno a cinco, con rúbricas conductuales: para una pregunta de depuración, un uno «recurre a cambios de redacción aleatorios, sin hipótesis, sin medición»; un cinco «agrupa los fallos por tipo, establece una teoría, cambia una variable y comprueba que se mantuvo en todo el conjunto». Usted puntúa no qué tan elocuente es alguien sino si el comportamiento que describe coincide con el trabajo. La mecánica de ejecutar esto bien —redacción de rúbricas, calibración del panel, reducción del efecto halo— se encuentra en nuestra guía de entrevistas estructuradas, y son ciencia genérica de entrevistas, no nada que nos sea propio.

Escriba las rúbricas antes de leer un solo currículum. Una vez que ha conocido a un candidato que le gusta, su rúbrica se dobla silenciosamente para encajarle. El punto del anclaje es fijar el estándar mientras todavía es objetivo, para que la entrevista mida al candidato frente al puesto en lugar de frente a su primera impresión.

Preguntas sobre hábitos de evaluación y medición

Este es el corazón del puesto, así que dedique aquí el mayor esfuerzo de anclaje. Un ingeniero de prompts que no puede medir es un redactor con un vocabulario más amplio. Cada pregunta a continuación hace lo mismo desde un ángulo diferente: ¿convierte usted «la salida no parece bien» en un número, o en otra ronda de ajustes?

  • ¿Cómo sabe cuándo un prompt ha mejorado realmente? — una respuesta fuerte recurre a un conjunto de casos y una métrica; la señal de alerta es «se lee mejor», porque una sensación no es una medición.
  • Cuénteme cómo construyó un conjunto de evaluación para un prompt real. — los candidatos fuertes recopilan fallos reales, etiquetan las salidas esperadas y ejecutan los cambios contra todo el conjunto; la señal de alerta es tratar tres ejemplos seleccionados a mano como una cobertura suficiente.
  • Cuénteme una vez que pensó que un prompt estaba arreglado y no lo estaba. — usted quiere una regresión específica que perdieron y detectaron; la señal de alerta es un candidato que no puede recordar haberse equivocado, lo que significa que nunca midió lo suficientemente de cerca.
  • ¿Cómo decide que un cambio vale la pena lanzarlo cuando la métrica sube en algunos casos y baja en otros? — las respuestas fuertes ponderan qué fallos importan más; la señal de alerta es optimizar un número principal mientras se rompen casos límite.
  • ¿Qué tamaño debe tener un conjunto de evaluación antes de que confíe en él? — escuche el juicio sobre la cobertura, no un número mágico; la señal de alerta es «un par de ejemplos está bien» o una regla rígida aplicada ciegamente al problema.
  • Cuando dos prompts puntúan igual en su conjunto, ¿cómo elige? — los candidatos fuertes hablan de robustez y comportamiento en casos no vistos; la señal de alerta es elegir el que parece más ingenioso por su propia causa.

La pregunta principal aquí es la primera, y la brecha entre las respuestas junior y senior es notable. Un ingeniero de prompts junior describe inspeccionar visualmente algunas salidas y decidir que se ven mejor — no es un error tanto como algo no escalable; funciona hasta que el prompt importa. Un candidato senior responde de forma estructural: nombra el conjunto de casos, dice que contiene una distribución representativa de los tipos de fallos de producción, y lee el diff en lugar de la puntuación absoluta, porque un cambio que arregla diez casos y silenciosamente rompe dos es una pérdida neta disfrazada de victoria. La respuesta junior se queda sin recorrido después de «se ve mejor».

La segunda pregunta principal es la historia de la regresión. Pregunte a cualquier ingeniero de prompts experimentado sobre una vez en que una corrección no se mantuvo y escuchará una real, contada con la textura arrepentida de alguien que ha sido quemado: una actualización del modelo convirtió silenciosamente una salida limpia en algo sutilmente peor, nadie lo notó hasta que un número downstream se movió, y lo rastrearon y colocaron una guardia para que el siguiente emerja automáticamente. Un candidato que no puede producir esta historia nunca ha lanzado prompts que importaban, o nunca los midió lo suficientemente de cerca — en cualquier caso, es descalificador para un puesto construido sobre mantener la salida honesta a lo largo del tiempo.

Nota de la era de la IA: cada pregunta aquí tiene una forma pública y memorizable, así que un candidato que se preparó con un asistente sonará fluido sobre conjuntos de evaluación y métricas. El seguimiento que sobrevive a la preparación es la especificidad — «cuénteme el conjunto de casos real de su último proyecto: cuántos casos, extraídos de dónde, etiquetados por quién». La fluidez ensayada colapsa en vaguedad ahí. Mejor aún, muévalo a una muestra de trabajo y observe si construyen el conjunto que acaban de describir.

Preguntas sobre recuperación y diseño de contexto

La ingeniería de prompts moderna rara vez se detiene en el prompt. La mayor parte del trabajo relevante consiste en proporcionar al modelo el contexto correcto — documentos recuperados, salidas de herramientas, estado estructurado — y un candidato fuerte sabe que una gran instrucción sobre un contexto malo sigue fallando. Este grupo evalúa si ven el sistema completo o solo el cuadro de texto.

  • ¿Cómo decide qué contexto darle al modelo frente a qué dejar fuera? — las respuestas fuertes tratan el contexto como un presupuesto invertido en lo que cambia la respuesta; la señal de alerta es meter todo y enterrar la señal.
  • Cuénteme una vez en que el modelo se equivocó y la corrección estaba en la recuperación, no en el prompt. — usted quiere a alguien que localice un fallo en la capa correcta; la señal de alerta es creer que cada problema cede a una mejor redacción.
  • ¿Cómo estructura la información recuperada para que el modelo la use realmente? — los candidatos fuertes ordenan, etiquetan y formatean el contexto deliberadamente; la señal de alerta es pegar fragmentos en bruto y esperar.
  • ¿Qué hace cuando el sistema de recuperación devuelve algo plausible pero incorrecto? — escuche si detectan y gestionan el contexto incorrecto; la señal de alerta es no tener conciencia de que la recuperación puede envenenar silenciosamente un buen prompt.
  • ¿Cómo evita que una ventana de contexto larga degrade la respuesta? — las respuestas fuertes saben que más contexto no es gratuito y diluye la atención; la señal de alerta es tratar una ventana grande como licencia para dejar de curar.
  • ¿Cómo depuraría una respuesta correcta en aislamiento pero incorrecta para la situación del usuario? — usted quiere a alguien que compruebe si el modelo recibió el contexto correcto; la señal de alerta es detenerse en «la salida se ve bien».

La pregunta principal aquí es el diagnóstico de recuperación frente a prompt, y separa al pensador de sistemas del experto en redacción claramente. Una respuesta junior trata una salida incorrecta como un prompt que hay que reformular, y pasa una tarde ajustando la redacción de un problema que ninguna redacción puede resolver. Una respuesta senior pregunta qué recibió realmente el modelo: ¿se recuperó el documento correcto? Si lo fue y la respuesta sigue siendo incorrecta, eso es un problema de instrucciones; si no, ningún prompt lo salvará. Ese instinto — localizar el fallo en la capa correcta antes de tocar nada — distingue al puesto del certificado, y se hace eco del punto que nuestra guía de cómo contratar a un ingeniero de prompts hace sobre candidatos que insisten en que un prompt puede arreglarlo todo.

Preguntas sobre depuración del comportamiento del modelo

Cuando un prompt se comporta mal, la corrección depende completamente del motivo. Un candidato que no puede distinguir una alucinación de una deriva de formato de un rechazo excesivamente celoso aplicará el remedio equivocado y empeorará las cosas. Este grupo pone a prueba si leen los modos de fallo con precisión en lugar de reaccionar a ellos.

  • El modelo sigue devolviendo JSON envuelto en una disculpa parlanchina. ¿Cómo lo diagnostica y arregla? — los candidatos fuertes lo nombran como deriva de formato y razonan sobre instrucciones y ejemplos; la señal de alerta es tratar un fallo de formato como uno factual.
  • ¿Cómo distingue una alucinación de un fallo de recuperación de un rechazo? — usted quiere a alguien que distinga los tres, porque la corrección para cada uno es diferente; la señal de alerta es agrupar todas las respuestas incorrectas en «el modelo es malo».
  • Un prompt funciona nueve de cada diez veces y falla la décima de forma impredecible. ¿Cómo lo aborda? — las respuestas fuertes buscan el patrón en lugar de declarar al modelo aleatorio; la señal de alerta es aceptar el no-determinismo como licencia para dejar de investigar.
  • ¿Cómo hace que un prompt sobreviva a un cambio de versión del modelo? — escuche si construyen contra el comportamiento en lugar de sobreajustar a los quirks de un modelo; la señal de alerta es un prompt tan ajustado al modelo actual que es frágil por diseño.
  • Cuando el modelo rechaza una solicitud legítima, ¿cómo lo resuelve sin debilitar la seguridad? — los candidatos fuertes reformulan con precisión en lugar de intimidar al modelo o deshabilitar las salvaguardas; la señal de alerta es tratar cada rechazo como un obstáculo a hackear.
  • ¿Cómo reproduce un fallo intermitente de forma suficientemente fiable para arreglarlo? — usted quiere un enfoque sistemático para aislar las variables; la señal de alerta es «simplemente lo intento de nuevo hasta que ocurre», sin método para repetirlo.

La pregunta principal en este grupo es la de los fallos intermitentes, porque expone el temperamento tanto como la habilidad. Un candidato más débil escucha «falla una de cada diez veces de forma impredecible» y se encoge de hombros — el modelo es no-determinista, qué se puede hacer. Un candidato fuerte escucha un patrón esperando ser encontrado: recopilan los casos fallidos, buscan lo que comparte el uno de cada diez y tratan la varianza como una señal en lugar de una excusa. Pregunte qué harían si no pudieran reproducirlo, y la buena respuesta no es «rendirse» sino instrumentar el sistema para capturar la próxima ocurrencia con suficiente contexto para diagnosticarla.

Nota de la era de la IA: nombrar correctamente los modos de fallo — alucinación, deriva de formato, rechazo — es exactamente el vocabulario que un candidato puede absorber de un asistente en una tarde, así que etiquetar con fluidez es el mínimo ahora, no una señal. El seguimiento que sobrevive a la preparación es aplicado: muéstreles una salida rota real y pídale que la categorice y proponga una corrección, en vivo. Hacer coincidir la palabra con el desorden que tiene delante es la competencia, no conocer la palabra.

Preguntas sobre prácticas de trabajo: versionado, revisión y colaboración

Los prompts que importan son código, y necesitan la misma disciplina: control de versiones, revisión, documentación y una forma de trabajar con las personas cuyo producto depende de ellos. Este grupo le dice si un candidato trata la ingeniería de prompts como un oficio individual o una disciplina de ingeniería practicada con un equipo.

  • ¿Cómo versiona y hace rollback de prompts en producción? — los candidatos fuertes tratan los prompts como artefactos versionados con un camino de rollback; la señal de alerta es editar prompts en vivo sin historial y sin vuelta atrás.
  • ¿Cómo revisa el cambio de prompt de otra persona antes de que se lance? — usted quiere una revisión real centrada en los resultados de la evaluación, no solo en la legibilidad; la señal de alerta es «lo leí y parecía bien», sin un conjunto de pruebas en el proceso.
  • ¿Cómo documenta un prompt para que la siguiente persona entienda por qué tiene la forma que tiene? — las respuestas fuertes capturan los modos de fallo que el prompt defiende; la señal de alerta es ingeniosidad no documentada que solo el autor puede mantener.
  • Cuénteme una vez en que tuvo que explicar un trade-off de prompt a un stakeholder no técnico. — escuche lenguaje claro y honestidad sobre los límites; la señal de alerta es esconderse detrás de la jerga o prometer demasiado.
  • ¿Cómo mantiene los prompts consistentes en un equipo para que el producto no desarrolle personalidades divididas? — usted quiere convenciones compartidas y una fuente de verdad; la señal de alerta es cada ingeniero manteniendo su propio estilo privado.
  • ¿Cómo decide cuándo un prompt se ha vuelto demasiado complejo y necesita ser dividido o rediseñado? — los candidatos fuertes reconocen la complejidad insostenible y refactorizan; la señal de alerta es añadir otra instrucción a un prompt que ya colapsa bajo su propio peso.

La pregunta principal aquí es la de la explicación al stakeholder, y importa más de lo que su formulación suave sugiere. Los ingenieros de prompts trabajan junto a equipos de operaciones y de marca que sienten cada regresión directamente, y la capacidad de decir «esto es una limitación de recuperación, no algo que pueda solucionar con un prompt» — sin condescendencia ni promesas excesivas — mantiene esas relaciones intactas. Un candidato junior se refugia en la jerga o promete una corrección que no existe; uno senior explica el trade-off en los propios términos del stakeholder y gestiona la expectativa antes de que se rompa. Esta es la combinación de medición y comunicación que nuestro hub de ingeniería de prompts por puesto describe: el juicio técnico es necesario, pero la honestidad sobre los límites es lo que lo hace utilizable por un equipo.

Nota de la era de la IA: las preguntas sobre procesos son las más fáciles de falsificar, porque un asistente puede generar una descripción perfecta según el libro de texto de versionado, revisión y documentación bajo demanda. El seguimiento que lo sobrevive son las evidencias: pida ver cómo estructuraron un repositorio de prompts, o cómo una revisión suya específica detectó un problema específico. Una muestra de trabajo donde revisan el cambio de prompt defectuoso de un compañero revela en diez minutos lo que una hora de charla sobre procesos no puede.

Captura de pantalla de un conjunto de preguntas generado por IA para un puesto de ingeniero de prompts, con preguntas agrupadas por competencia listas para la evaluación de candidatos
Un conjunto de preguntas generado por puesto para un rol de ingeniero de prompts: las preguntas están ajustadas al trabajo real, para que la entrevista evalúe las competencias que la evaluación no pudo resolver completamente en lugar de repetirlas.

¿Cuándo debe dejar de preguntar y empezar a evaluar?

Aquí está la verdad incómoda sobre cada pregunta anterior: una entrevista muestrea afirmaciones, no trabajo. Un candidato puede describir un hermoso bucle de medición que nunca ha ejecutado, y una respuesta ensayada ahora es indistinguible de una vivida hasta que profundice en los detalles — y aun así, los detalles se pueden inventar. Las preguntas valen la pena hacerlas, no confiar en ellas solas. En algún momento el movimiento honesto es dejar de pedirle a alguien que describa el trabajo y verle hacerlo.

El ejercicio más predictivo para este puesto es casi embarazosamente simple: entréguele al candidato un prompt mediocre y un conjunto de casos en los que falla, y obsérvelo mientras diagnostica e itera con un modelo genuinamente disponible. ¿Lee los fallos antes de tocar el prompt, los agrupa por tipo, cambia una variable y comprueba la corrección en todo el conjunto — o reformula por instinto y inspecciona visualmente un único caso? Ejecútelo antes del proceso de entrevista, no después, y deje que lo que vea decida qué preguntas anteriores merecen su tiempo limitado — dedicando la conversación a las áreas de diagnóstico de recuperación y comunicación con stakeholders que una muestra cubre menos directamente.

Este es el puente sobre el que construimos todo nuestro enfoque: una tarea realista y relevante para el puesto con herramientas de IA disponibles, observada como evaluación de candidatos en lugar de un cuestionario. Es lo que hace una evaluación de habilidades de ingeniería de prompts — poner a la persona en algo cercano a un martes por la mañana y observar cómo dirige el modelo, lo detecta equivocándose con confianza y verifica antes de lanzar. Leer esas señales es una habilidad propia; cómo evaluar la fluidez en IA cubre cómo se ve una colaboración fuerte y débil, junto con la guía hermana sobre preguntas de entrevista para ingenieros de IA para el puesto adyacente. Pese nuestro enfoque como guste — la lógica se sostiene: el bucle es lo que se lanza el próximo trimestre, y la única forma honesta de verlo es observarlo. Para ver el lado de la evaluación, reserve una demo.

Las mejores entrevistas a ingenieros de prompts no recompensan las respuestas más fluidas. Recompensan al candidato cuya historia sobrevive un seguimiento difícil y cuya muestra de trabajo muestra el mismo bucle que describió. Haga las preguntas, puntúelas contra rúbricas, luego deje de preguntar y observe — porque la habilidad con las frases es la señal del impostor, y solo el trabajo dice la verdad.
Interview questionsPrompt engineeringTechnical hiringCandidate evaluationAI fluency
A

Escrito por

Aayesha Patel · Co-founder, Hanzomon Inc

Co-founder of Hanzomon. Writes about skills-based hiring, fair assessment and building a better candidate experience.

Preguntas frecuentes

¿Qué debo preguntar a un ingeniero de prompts en una entrevista?

Haga preguntas que obliguen al candidato a describir un bucle de medición, no un truco de redacción. Las más efectivas son concretas: cómo supo que un prompt mejoró, una vez en que una actualización del modelo arruinó sus salidas y un caso que decidió que no era un problema de prompt en absoluto. Después de cada respuesta, pregunte «¿cómo lo midió?». Un ingeniero de prompts que no puede responder con un conjunto de casos y un número está describiendo una afición, no una disciplina.

¿Cómo se evalúan las respuestas de un ingeniero de prompts en una entrevista?

Puntúe con rúbricas escritas antes de la entrevista y use las mismas preguntas para cada candidato. Para cada pregunta, decida de antemano qué contiene una respuesta débil, adecuada y fuerte. Un ingeniero de prompts fuerte habla en modos de fallo, conjuntos de evaluación y cambios de una variable a la vez. Uno débil habla en vocabulario —few-shot, chain-of-thought— sin ningún método debajo. Juzgue el bucle que describen, no los términos que conocen.

¿Cuáles son las mejores preguntas de entrevista para ingenieros de prompts en 2026?

Las mejores sobreviven a un candidato que se preparó con un asistente. Omita todo lo que tenga una respuesta memorizable, como «¿qué es el prompting few-shot?». Prefiera preguntas sobre su propio trabajo pasado —una regresión que detectaron, un conjunto de evaluación que construyeron, un trade-off que realizaron bajo presión de tiempo— y luego profundice en detalles que el asistente no pudo proporcionar. Combine la entrevista con una muestra de trabajo para verificar el bucle en lugar de recompensar el ensayo.

¿Deben permitirse herramientas de IA en las entrevistas a ingenieros de prompts?

Para la conversación de entrevista, el acceso a herramientas es secundario; usted está evaluando el juicio y el comportamiento pasado. Para la muestra de trabajo, la respuesta es claramente sí. El trabajo se realiza con un modelo a mano, así que prohibirlo pone a prueba un puesto que ya no existe y filtra a las personas equivocadas. Observe cómo el candidato dirige el modelo, detecta cuando está equivocado con confianza y verifica que la corrección se mantuvo antes de declarar la victoria.

¿Cuántas preguntas debe incluir una entrevista a un ingeniero de prompts?

Menos de las que la mayoría de los procesos intentan. Una entrevista estructurada enfocada de ocho a diez preguntas bien elegidas, puntuadas con rúbricas, supera a una extensa de cuarenta preguntas que premia la resistencia. Use una muestra de trabajo para decidir qué competencias merecen tiempo de entrevista y luego dedique la conversación a profundizar en las dos o tres áreas que la muestra dejó ambiguas. La profundidad en las preguntas que importan supera a la cobertura de las que no importan.

Publicaciones relacionadas

Míralo con tu propia descripción de puesto

Únete a la lista de acceso anticipado y observa cómo H-Evaluate crea una evaluación para un puesto real.

Míralo con tu propia descripción de puesto