Prueba de habilidades generada por IA
AI fluency test
En 2026 la mayor parte del trabajo del conocimiento se realiza con un asistente de IA en el bucle, lo que hace que la fluidez en IA sea una de las cosas más predictivas que puedes evaluar en una contratación — y una que la mayoría de los procesos de selección siguen midiendo mal. Una línea en el currículum sobre ser 'fluente en IA' no te dice nada, y preguntar a un candidato cómo usaría la IA de forma responsable te gana la respuesta del libro de texto cada vez. El cribado basado solo en la descripción falla aquí porque la fluidez es un comportamiento, no una afirmación. Una prueba de AI Fluency reemplaza el relato con el acto: coloca a un candidato en una tarea real con IA disponible y observa cómo trabaja realmente con ella.
La prueba de AI Fluency de H-Evaluate mide el juicio, no el entusiasmo ni las trivialidades sobre prompts. La señal más fuerte no es con qué entusiasmo alguien recurre a la IA sino qué tan bien conoce sus límites — así que la prueba está construida alrededor de una tarea donde el modelo está inequívocamente equivocado, y observas si el candidato lo detecta. Lee la capacidad en cuatro dimensiones en lugar de una puntuación genérica, y calibra el umbral al puesto y la seniority. Se corresponde con el pilar AI Fluency del marco de cinco pilares de H-Evaluate, ejecutado en el AI Sandbox para que el modelo esté genuinamente disponible y tanto el resultado como el proceso sean capturados — porque dos candidatos pueden llegar a la misma respuesta, uno detectando el error y el otro por suerte. Las tareas son generadas por IA para el puesto específico en lugar de extraídas de un banco compartido.
Qué mide
Delegación
Decidir qué entregar a la IA y qué conservar manualmente — usar el modelo donde genuinamente mejora la calidad y elegir no usarlo donde hacer el trabajo directamente es mejor. Para roles senior esto se convierte en el juicio de dividir un problema difícil con sensatez y justificar la división.
Descripción
Decirle al modelo lo que realmente se quiere — enmarcar una tarea, dar el contexto y las restricciones correctos, y dirigir hacia un resultado útil. No una redacción ingeniosa por sí misma, sino la claridad que hace que la IA produzca trabajo sobre el que vale la pena construir.
Discernimiento
Juzgar lo que devuelve: detectar una respuesta confiadamente incorrecta, saber qué afirmaciones verificar con más atención y verificar antes de confiar en la salida. La dimensión de señal más alta, revelada por una tarea con un resultado plausible pero falso sembrado en ella.
Diligencia
Usar la IA de forma responsable y asumir el resultado — gestionar datos confidenciales y posibles sesgos con sensatez, y tratar la precisión como responsabilidad del candidato en lugar de la herramienta. Observado a través de un escenario que invita, y recompensa resistir, un atajo descuidado.
Formatos de preguntas
Para quién es
Usa esta prueba para cualquier rol que ahora se realice con IA en el bucle — que es la mayoría: ingenieros, analistas, soporte, ventas, marketing y personal de operaciones que usan estas herramientas a diario. No es una medida solo para ingenieros. Calibra el umbral al puesto: valores por defecto seguros y verificación diligente para una contratación junior, buenas decisiones de delegación bajo ambigüedad para una contratación senior. Pondera el pilar hacia abajo donde un puesto genuinamente usa poco la IA, en lugar de inventar una tarea. Combínala con nuestra prueba de prompt engineering donde el puesto es propietario de una capa de instrucciones, y con pruebas de dominio y situacionales para construir el cuadro completo a través de los cinco pilares.
Cómo interpretar los resultados
- 1Léelo en relación con el puesto, no como una puntuación universal de fluidez en IA. El umbral para un agente de soporte junior que redacta una respuesta con ayuda de IA no es el umbral para un ingeniero senior que pondera si confiar en una migración generada; enmarca el resultado frente a lo que el puesto específico demanda.
- 2Puntúa el comportamiento, no la impresión de soltura. 'Aceptaron una salida confiadamente incorrecta sin verificarla, en la misma tarea que recibió cada candidato' es defendible; 'parecían cómodos con la IA' no lo es — la confianza y la jerga son exactamente lo que no quieres recompensar.
- 3Pondera las cuatro dimensiones según el trabajo y léelas por separado: un candidato fuerte en Descripción pero débil en Discernimiento entrega errores fluentes no verificados, lo que es un área concreta que sondear en la entrevista.
- 4Trátalo como una señal entre varias. Se sitúa como un pilar ponderado, no como una insignia añadida — combínalo con una entrevista estructurada y los otros pilares, y da a cada candidato el mismo acceso a las herramientas para medir la fluidez, no quién tenía una suscripción de pago en casa.
Prueba de habilidades generada por IA
Evalúa a los candidatos en esta habilidad con preguntas generadas por IA
Configura una evaluación adaptada al puesto y observa cómo cambia según la seniority — sin registro.
Puestos relacionados
Lecturas relacionadas
Cómo evaluar la AI fluency: guía práctica por puesto
Cómo evaluar la AI fluency en la contratación: qué medir, cómo puntuar cada parte, cómo se ve una fluidez sólida frente a una débil y las tareas que revelan el criterio real.
El Marco 4D para la fluidez con la IA: de la Delegación a la Diligencia
La 'fluidez con la IA' es demasiado vaga para contratar en base a ella. El Marco 4D la divide en Delegación (Delegation), Descripción (Description), Discernimiento (Discernment) y Diligencia (Diligence): cuatro habilidades que puedes evaluar.
Preguntas frecuentes
¿Qué mide una prueba de AI Fluency?
Mide el juicio de trabajar bien con IA, no el entusiasmo ni las trivialidades sobre prompts — en cuatro capacidades: delegar el trabajo adecuado a la IA, describir las tareas con claridad, discernir si la salida puede ser de confianza y usarla de forma responsable. La señal más fuerte es qué tan bien conoce el candidato los límites de la herramienta: si detecta una respuesta confiadamente incorrecta y verifica antes de confiar en ella, en lugar de con qué entusiasmo recurre a la IA en primer lugar.
¿Cómo se evalúa la fluidez en IA en la contratación?
Da a los candidatos una tarea realista con IA disponible y observa cómo la usan, en lugar de pedirles que la describan — el cribado basado solo en la descripción obtiene la respuesta del libro de texto de casi todo el mundo. El ítem de señal más alta planta una salida plausible pero falsa o sutilmente incorrecta y observa si la detectan. Captura el proceso, no solo el artefacto final, y calibra el umbral al puesto y la seniority en lugar de perseguir una puntuación genérica.
¿Debería permitirse a los candidatos usar IA durante la prueba?
Sí, si el trabajo usa IA. Prohibirla mide una versión del puesto que ya no existe, por lo que no puede predecir el comportamiento en el trabajo. Da a los candidatos acceso a las herramientas de IA y observa dónde confían en el modelo, dónde verifican y dónde eligen no usarlo — esa observación es la evaluación. H-Evaluate ejecuta la tarea en el AI Sandbox para que el modelo esté genuinamente disponible y el proceso sea capturado.
¿Es la fluidez en IA la misma para todos los roles?
No — es relativa al puesto. El umbral para un agente de soporte junior que redacta una respuesta con ayuda de IA y la verifica antes de enviarla no es el umbral para un ingeniero senior que decide si confiar en una migración generada. Evalúa la fluidez frente a lo que el puesto específico demanda, calibrado a la seniority, que es por qué se sitúa como un pilar ponderado en lugar de una puntuación universal única, y por qué la misma tarea puede plantearse en dos niveles de dificultad.
¿Cuál es la diferencia entre una prueba de AI Fluency y una de prompt engineering?
Una prueba de AI Fluency mide el juicio general al trabajar con IA en cualquier tarea — delegar, describir, discernir y usarla de forma responsable. Una prueba de prompt engineering profundiza en la capa de instrucciones: iterar sistemáticamente en prompts, construir conjuntos de evaluación y hacer que las instrucciones sean robustas ante los cambios de modelo. La fluidez pregunta si alguien trabaja bien con IA en su rol; la prueba de prompts pregunta si pueden diseñar y medir las instrucciones que impulsan un sistema de IA.