Évaluation des compétences

Évaluation des compétences de Ingénieur IA

Ingénieur IA est le titre le plus rebadgé de la tech en ce moment : un après-midi à suivre un tutoriel API se retrouve présenté comme de l'ingénierie IA, et la compétence qui compte vraiment — savoir comment vous savez qu'une fonctionnalité fonctionne — n'apparaît jamais sur un CV. Le rôle construit des fonctionnalités produit alimentées par LLM sur des modèles entraînés par quelqu'un d'autre : pipelines de récupération, harnais d'évaluation, orchestration de prompts et d'outils, le tout dans un budget de latence et de coût. Un candidat rebadgé peut décrire des prompts qu'il a écrits ; le véritable peut vous dire comment il a prouvé que la fonctionnalité fonctionnait.

C'est pourquoi les trivialités sur les prompts et un CV soigné sont les mauvais filtres. Le seul signal fiable est un travail adapté au poste : placez une fonctionnalité LLM réaliste cassée d'une façon intéressante devant le candidat, donnez-lui un modèle avec lequel travailler, et observez comment il le dirige, vérifie son résultat, et le corrige quand il a tort avec assurance. H-Evaluate génère cette tâche par fiche de poste, dans un environnement où un modèle est réellement disponible — génération par poste, pour qu'aucun candidat ne l'ait répétée — et note le comportement de maîtrise de l'IA qui définit le rôle.

Quoi évaluer

Les compétences qui prédisent la performance dans ce poste, rattachées aux cinq piliers du recrutement.

Pratique / sandbox

Échantillon de travail sur une fonctionnalité cassée

Travailler une fonctionnalité réaliste cassée avec un modèle disponible — un endpoint de récupération renvoyant de mauvaises réponses fluentes, un agent bouclant sur un mauvais appel d'outil — et être observé sur la façon dont ils dirigent, vérifient et corrigent le modèle plutôt que de lui faire confiance.

Connaissance du domaine

Savoir-faire en récupération et orchestration

De vrais pipelines plutôt qu'un seul appel d'embedding — chunking, classement et gestion du cas où la récupération ne renvoie rien d'utile — plus suffisamment de savoir-faire logiciel pour faire fonctionner la fonctionnalité en production avec journalisation et mécanismes de repli.

Cognitif

Discipline d'évaluation

La compétence définissante : construire le jeu d'évaluation avant de faire confiance à la correction, distinguer l'évaluation hors ligne de l'évaluation en ligne, et traiter « ça avait l'air juste quand j'ai essayé » comme un aveu, pas une preuve.

Jugement situationnel

Jugement situationnel sur les modes d'échec et le coût

Nommer l'hallucination, l'injection de prompt et la dérive sans être sollicité, concevoir pour le cas où le modèle a tort, et raisonner en tokens et millisecondes — savoir quand un modèle moins cher est suffisant et ce qu'une fonctionnalité coûte à grande échelle.

Comportemental

Responsabilité et collaboration

Comment ils ont géré une fonctionnalité qui a été livrée puis cassée en production — le récit de vérification et ce qu'ils ont changé — plutôt qu'un récit soigné sur un prompt dont ils étaient fiers.

Pratique / sandbox

Maîtrise de l'IA

La relation de travail entre la personne et le modèle, notée sur le cadre 4D avec le Discernement et la Diligence pondérés le plus — repérer le modèle qui a tort avec assurance est tout l'objet du rôle.

Comment structurer l'évaluation

  • 1Construisez la tâche autour d'une fonctionnalité cassée d'une façon intéressante — un endpoint de récupération renvoyant des réponses délibérément erronées, une chaîne de prompts qui explose silencieusement le budget de latence — pas un puzzle au tableau blanc.
  • 2Exécutez-la dans un environnement où un modèle est réellement disponible plutôt qu'interdit, parce que c'est le seul moyen de voir le comportement de maîtrise de l'IA qui définit le rôle.
  • 3Observez s'ils cherchent une évaluation avant de faire confiance à leur propre correction, nomment un mode d'échec que vous n'avez pas mentionné, et remarquent l'implication de coût du modèle qu'ils ont choisi.
  • 4Pondérez le Discernement et la Diligence au-dessus des autres compétences — repérer le modèle qui a tort compte plus que la fluidité sur les prompts.
  • 5Gardez-la courte et notez selon le même barème : un seul échantillon de travail adapté au poste associé à un entretien structuré bat six rounds de feeling.

Signaux qui prédisent la réussite

  • +Cherche un jeu d'évaluation avant de faire confiance à son propre changement
  • +Nomme un mode d'échec — hallucination, injection de prompt, dérive — sans être sollicité
  • +Raisonne sur le coût et la latence sans être demandé, et sait quand un modèle moins cher est suffisant
  • +Peut vous dire exactement comment il savait que sa dernière fonctionnalité fonctionnait

Signaux d'alerte à surveiller

  • Décrit des prompts qu'il a écrits mais ne peut pas dire comment il savait que la fonctionnalité fonctionnait
  • Fait confiance à « ça avait l'air juste quand j'ai essayé » comme preuve plutôt que de construire une évaluation
  • Conçoit comme si le modèle était toujours juste, sans plan pour quand il a tort
  • Livre un prototype avec une belle démo mais ne peut pas le faire tourner en production

Évaluation vs entretien

Vous ne pouvez pas rendre la discipline d'évaluation visible avec des questions seules, parce que le candidat rebadgé a lu les mêmes billets de blog que vous. Un échantillon de travail avec un modèle disponible le montre directement — vous observez s'ils cherchent une évaluation avant de faire confiance à une correction, et s'ils repèrent le modèle qui a tort avec assurance. Utilisez l'évaluation pour recueillir ces preuves, puis utilisez l'entretien structuré pour parcourir leur échantillon de travail avec eux : pourquoi cette correction, comment ils l'ont vérifiée, ce qu'ils vérifieraient avant de livrer. Le récit de vérification compte plus que la correction.

Évaluation des compétences

Configurez cette évaluation par poste et séniorité

Voyez l'accent se déplacer en temps réel lorsque vous changez le poste et le niveau — sans inscription.

Lectures connexes

Questions fréquentes

Comment évaluer un ingénieur IA ?

Donnez-leur une tâche adaptée au poste avec un modèle disponible et observez-les travailler — le diriger, vérifier son résultat, le corriger. Un endpoint de récupération qui renvoie des réponses délibérément erronées est un bon prompt. Vous cherchez quelqu'un qui cherche une évaluation avant de faire confiance à sa propre correction, qui nomme les modes d'échec sans être sollicité, et qui raisonne sur le coût et la latence sans être demandé. Les trivialités sur les prompts ne sont pas le signal.

Quelles compétences un test d'ingénieur IA doit-il couvrir ?

La discipline d'évaluation d'abord : la capacité à prouver qu'une fonctionnalité fonctionne avant de la livrer, et à écrire le jeu d'évaluation qui le prouve. Puis le raisonnement sur les modes d'échec autour de l'hallucination, de l'injection de prompt et de la dérive, plus l'ingénierie de latence et de coût, le savoir-faire en récupération et orchestration, et suffisamment de savoir-faire logiciel pour le faire tourner en production. La profondeur d'entraînement des modèles est optionnelle — c'est l'ingénieur machine learning.

Quelle est la différence entre un ingénieur IA et un ingénieur machine learning ?

Un ingénieur machine learning entraîne, affine et sert des modèles — l'extrémité à saveur de recherche. Un ingénieur IA construit des fonctionnalités produit au-dessus de modèles entraînés par quelqu'un d'autre : pipelines de récupération, orchestration de prompts et d'outils, harnais d'évaluation, et le budget de latence et de coût autour d'eux. L'ingénieur IA traite le modèle comme un composant autour duquel ingénierer. La plupart des équipes qui livrent des fonctionnalités LLM veulent la deuxième personne, pas la première.

Un ingénieur IA est-il un vrai emploi ou un ingénieur logiciel rebadgé ?

C'est un vrai rôle avec une compétence centrale distincte : la discipline d'évaluation. La version imposteur existe aussi — de nombreux CV rebadgent l'expérience de tutoriels API comme de l'ingénierie IA. Le signe révélateur est de savoir si la personne peut vous dire comment elle savait qu'une fonctionnalité fonctionnait. Un candidat rebadgé décrit des prompts qu'il a écrits ; un véritable ingénieur IA décrit le jeu d'évaluation, les modes d'échec qu'il a traqués et le budget de coût qu'il a tenu.