Prueba de habilidades generada por IA

Prompt engineering test

El prompt engineering es el rol de IA para el que más fácilmente se contrata por fe. El título atrae a coleccionistas de certificados y revendedores de plantillas cuyos portfolios son prompts ordenados que funcionaron una vez, para algo, en algún lugar — nada de lo cual te dice si su enfoque se sostiene en cien casos reales o sobrevive a la próxima versión del modelo. Un currículum no puede separar un vocabulario fluido de una habilidad real. Una prueba de prompt engineering sí puede, porque deja de pedir a los candidatos que definan 'few-shot' y 'chain-of-thought' y en su lugar los observa trabajar un prompt que falla hasta que lo han mejorado de forma medible.

La prueba de prompt engineering de H-Evaluate mide la disciplina debajo de la jerga: iteración sistemática, construcción de conjuntos de evaluación y redacción de instrucciones lo suficientemente robustas como para sobrevivir a un cambio de modelo. Los candidatos leen un conjunto de fallos, forman una hipótesis sobre por qué la salida se rompe, cambian una variable y verifican que la corrección se mantuvo en todo el conjunto de casos en lugar de en el único ejemplo que tenían delante. Cada candidato trabaja la misma tarea bajo las mismas condiciones, por lo que el proceso supera al pulido y un practicante autodidacta puede superar a una insignia de curso. Se corresponde con el pilar AI Fluency del marco de cinco pilares de H-Evaluate, ejecutado en el AI Sandbox con el modelo genuinamente disponible y el bucle de diagnóstico observado, no solo el artefacto final. Los ítems son generados por IA para el puesto específico en lugar de reutilizados de un banco.

Qué mide

Iteración sistemática

Leer un fallo, formular una teoría específica sobre por qué ocurre, cambiar una variable y medir el resultado — en lugar de ajustar el texto al azar hasta que algo pase. Este bucle de medición es la señal más fuerte que separa a un practicante real de un revendedor de plantillas.

Construcción y uso de conjuntos de evaluación

Transformar 'parece mejor' en un conjunto de casos con salidas esperadas, para que la mejora sea un número en lugar de una sensación. Los candidatos fuertes construyen o piden un conjunto de evaluación casi de inmediato y se niegan a juzgar un cambio en un solo ejemplo.

Robustez de las instrucciones

Redactar prompts y mensajes de sistema que sobrevivan a un cambio de versión del modelo en lugar de sobreajustarse a los quirks del modelo actual. Señala a alguien que construye para la durabilidad por encima de la astucia y sabe que un prompt ajustado a una versión se romperá en la siguiente.

Lectura de modos de fallo

Distinguir rápidamente entre alucinación, deriva de formato y una negativa excesiva, porque la corrección para cada uno es diferente — y saber cuándo un problema es de recuperación o de datos que la capa de instrucciones no puede resolver en absoluto.

Formatos de preguntas

Tarea de iteración sobre casos fallidos — mejorar un prompt mediocre frente a un conjunto de casos en los que falla, en el AI SandboxEjercicio de conjunto de evaluación — definir salidas esperadas y medir un cambio en todo el conjunto, no en un solo ejemploDiagnóstico de modos de fallo — clasificar un lote de salidas incorrectas por tipo y elegir la corrección adecuada para cada unaEscenario de robustez — ajustar instrucciones para que la salida se mantenga cuando el modelo o la entrada cambianPreguntas de juicio — decidir si un problema reside en el prompt o en la recuperación, los datos o el modeloRespuesta corta escrita explicando cómo sabe el candidato que un prompt realmente ha mejorado

Para quién es

Usa esta prueba para roles donde la calidad del prompt está cerca del producto: ingenieros de prompts dedicados, ingenieros de IA y agentes de IA que son propietarios de la capa de instrucciones, y personal de producto o contenidos que gestiona sistemas de IA a escala. Es más útil cuando tus prompts llegan a los cientos y derivan de forma medible cuando un modelo se actualiza; por debajo de eso, evalúa en su lugar la fluidez en IA general. Combínala con nuestra prueba de AI Fluency para el juicio y la verificación entre tareas, y con una prueba de programación o dominio cuando el puesto también construye el sistema circundante. Es adecuada para contrataciones de nivel intermedio a senior, ya que el valor reside en el juicio más que en la juniority.

Cómo interpretar los resultados

  • 1Puntúa el bucle, no el artefacto. Un candidato que llegó a un buen prompt por suerte debería quedar por debajo de uno que llegó a un prompt ligeramente peor mediante un proceso limpio y repetible — porque el próximo trimestre, ante un problema que no puedes prever, es el bucle el que produce el resultado.
  • 2Pondera más la disciplina de medición: ¿construyeron o pidieron un conjunto de evaluación, cambiaron una cosa a la vez y verificaron la corrección en todo el conjunto? Reformular al azar que por casualidad pasó es una señal más débil que un proceso disciplinado que quedó ligeramente corto.
  • 3Calibra el umbral al alcance y la seniority. Ser propietario de los prompts de una funcionalidad es una demanda diferente a ser propietario de la estrategia de instrucciones del agente para toda una línea de productos; lee la banda frente a lo que el puesto realmente requiere.
  • 4Trata el resultado como una señal entre varias y combínalo con una entrevista estructurada sobre un conjunto de evaluación pasado, una actualización de modelo que rompió sus prompts y un caso que juzgaron que no era un problema de prompt — las afirmaciones de proceso son fáciles de hacer y vale la pena sondear.

Prueba de habilidades generada por IA

Evalúa a los candidatos en esta habilidad con preguntas generadas por IA

Configura una evaluación adaptada al puesto y observa cómo cambia según la seniority — sin registro.

Puestos relacionados

Lecturas relacionadas

Preguntas frecuentes

¿Qué mide una prueba de prompt engineering?

Mide la disciplina detrás de un buen prompting en lugar de la redacción ingeniosa: iteración sistemática, construcción de conjuntos de evaluación y redacción de instrucciones lo suficientemente robustas como para sobrevivir a un cambio de modelo. La pregunta central es si un candidato puede transformar 'la salida parece incorrecta' en una mejora medible y repetible — leyendo fallos, cambiando una variable y verificando que la corrección se mantuvo en todo un conjunto de casos. El vocabulario como 'few-shot' es la parte más pequeña del trabajo.

¿Cómo se evalúa a un ingeniero de prompts?

Dale un prompt mediocre y un conjunto de casos en los que falla, luego observa cómo diagnostica e itera — el trabajo condensado en un ejercicio. Estás calificando el bucle, no el prompt final: ¿leen primero los fallos, los agrupan por tipo, cambian una cosa y vuelven a ejecutar, y construyen o piden una forma de medir el cambio en todo el conjunto? Los candidatos fuertes buscan un conjunto de evaluación casi de inmediato; los débiles reformulan al azar o pegan una plantilla.

¿Son fiables las pruebas de prompt engineering para contratar?

Una bien construida es mucho más fiable que un currículum o un examen de definiciones, porque observa el comportamiento real que el trabajo necesita en lugar del relato del candidato sobre él. La fiabilidad proviene de puntuar un proceso observable — iteración, medición, robustez — frente a una rúbrica consistente para cada candidato, y de ejecutarlo con el modelo genuinamente disponible para que veas el bucle, no solo el artefacto. Combínala con una entrevista estructurada para confirmar que el proceso se generaliza.

¿Todavía necesitas evaluar el prompt engineering en 2026?

Donde la calidad del prompt es genuinamente el producto — automatización de soporte, sistemas de contenidos, instrucciones de agentes a escala — sí. Escribir un prompt aceptable es ahora el mínimo para muchos trabajos, pero ser propietario de una capa de instrucciones de cientos de prompts que derivan cuando un modelo se actualiza es una especialización que vale la pena evaluar directamente. Si tu superficie de IA es una funcionalidad o dos, evalúa en su lugar la fluidez en IA general en lugar de una habilidad dedicada de prompt engineering.

¿Cuál es la diferencia entre una prueba de prompt engineering y una de AI Fluency?

Una prueba de AI Fluency mide el juicio general de trabajar bien con IA en cualquier tarea — delegar con sensatez, verificar la salida y usarla de forma responsable. Una prueba de prompt engineering profundiza específicamente en la capa de instrucciones: iterar sistemáticamente en prompts, construir conjuntos de evaluación y hacer que las instrucciones sean robustas ante los cambios de modelo. La fluidez pregunta si alguien trabaja bien con IA; la prueba de prompts pregunta si puede diseñar y medir las instrucciones que la configuran.