スキルアセスメント

AIエンジニアのスキルアセスメント

AIエンジニアは、テック業界で今最も肩書きを転用されているタイトルです——APIチュートリアルを半日こなしただけでAIエンジニアリングとして履歴書に書け、本当に重要なスキル——ある機能が動いているとどうやって知るか——は職務経歴書に現れません。この職種は、誰かが学習させたモデルを使ってLLMバックのプロダクト機能を構築します——検索パイプライン、評価ハーネス、プロンプトとツールのオーケストレーション、すべてレイテンシーとコストの予算内で。転用された候補者は自分が書いたプロンプトを説明できますが、本物は機能が動いていることをどう証明したかを語れます。

だからこそ、プロンプトの雑学や磨かれた職務経歴書は間違ったスクリーニングです。唯一信頼できるシグナルは職務の形をした仕事です——面白い方法で壊れている現実的なLLM機能を候補者の前に置き、モデルを使わせ、どのようにそれを指示し、出力を検証し、自信を持って間違えたときに修正するかを見ます。H-Evaluateはそのタスクを求人票ごとに生成します——モデルが実際に使える環境で、求人ごとの生成により候補者は事前に見たことがなく——この職種を定義するAI習熟度の行動を採点します。

何を評価するか

この職務でのパフォーマンスを予測するコンピテンシーを、5つの採用ピラーに対応づけています。

実践/サンドボックス

壊れた機能の実務サンプル

手元にモデルを置いて現実的な壊れた機能に取り組む——流暢に間違った答えを返す検索エンドポイント、不正なツール呼び出しでループするエージェント——そして、モデルを信頼するのではなく、どのように指示・検証・修正するかを観察する。

専門知識

検索とオーケストレーションのクラフト

単一の埋め込み呼び出しではなく実際のパイプライン——チャンキング・ランキング・検索が有用な結果を返さない場合の処理——加えて、ロギングとフォールバックを備えた本番環境で機能を実行するのに十分なソフトウェアクラフト。

認知能力

評価規律

この職種を定義するスキル——修正を信頼する前に評価セットを構築し、オフライン評価とオンライン評価を区別し、「試したときに正しそうに見えた」を証拠ではなく告白として扱う。

状況判断

失敗モードとコストの判断力

幻覚・プロンプトインジェクション・ドリフトを指示なしに挙げ、モデルが間違えることを前提に設計し、トークンとミリ秒で推論する——より安価なモデルで十分な場面と、ある機能がスケールしたときのコストを知っている。

行動特性

オーナーシップと協働

出荷してから本番で壊れた機能にどう対処したか——誇らしく思っていたプロンプトについての整った語りではなく、検証のストーリーと何を変えたか。

実践/サンドボックス

AI習熟度

人とモデルの間の実際の作業関係は、4Dフレームワークで採点され、識別力と誠実さが最も重く重み付けされる——モデルが自信を持って間違えることを見つけることがこの職種の本質。

アセスメントの設計方法

  • 1ホワイトボードのパズルではなく、面白い方法で壊れた機能のタスクを構築しましょう——自信を持って間違った答えを返す検索エンドポイント、静かにレイテンシー予算を超えるプロンプトチェーン。
  • 2モデルを実際に禁止するのではなく使える環境で実施しましょう——この職種を定義するAI習熟度の行動を観察できる唯一の方法だからです。
  • 3候補者が自分の修正を信頼する前に評価に手を伸ばすか、自分が言及しなかった失敗モードを挙げるか、選んだモデルのコストへの影響に気づくかを見ましょう。
  • 4他のコンピテンシーよりも識別力と誠実さを重視しましょう——モデルが間違えることを見つけることは、プロンプトの流暢さより重要です。
  • 5短く採点基準を統一しましょう——職務の形をした実務サンプル1つと構造化面接1回で、6ラウンドの感覚論より優れています。

成功を予測するシグナル

  • +自分の変更を信頼する前に評価セットに手を伸ばす
  • +幻覚・プロンプトインジェクション・ドリフトなどの失敗モードを指示なしに挙げる
  • +求められずともコストとレイテンシーを推論し、より安価なモデルで十分な場面を知っている
  • +自分の最後の機能がどうやって動いていたかを証明したかを正確に語れる

注意すべき危険信号

  • 自分が書いたプロンプトを説明するが、機能が動いていることをどうやって知ったか言えない
  • 「試したときに正しそうに見えた」を証拠として信頼し、評価セットを構築しない
  • モデルが常に正しいことを前提に設計し、間違えたときのプランがない
  • 見栄えの良いデモでプロトタイプを出荷するが、本番環境で実行できない

アセスメント対面接

評価規律は、候補者もあなたと同じブログ記事を読んでいるため、質問だけで可視化することはできません。実務サンプルにモデルを置くと直接示されます——修正を信頼する前に評価に手を伸ばすか、モデルが自信を持って間違えることを見つけるかを観察できます。アセスメントを使ってその証拠を集め、次に構造化面接でその実務サンプルを一緒に歩みましょう——なぜその修正を選んだか、どう検証したか、出荷前に何を確認するか。検証のストーリーは修正よりも重要です。

スキルアセスメント

職種と役職レベルでこのアセスメントを設定

職種とレベルを変えると重み付けがリアルタイムで変化します——登録不要。

関連記事

よくある質問

AIエンジニアをどう評価すればよいですか。

手元にモデルを置いて職務の形をしたタスクを与え、実際に作業させましょう——指示し、出力を検証し、修正させます。自信を持って間違った答えを返す検索機能は良いプロンプトです。自分の修正を信頼する前に評価に手を伸ばす人、失敗モードを指示なしに挙げる人、求められずともコストとレイテンシーを推論する人を見ています。磨かれたプロンプトの雑学はシグナルではありません。

AIエンジニアのテストでカバーすべきスキルは何ですか。

まず評価規律——出荷前に機能が動いていることを証明する能力と、それを証明する評価セットを書く能力。次に幻覚・プロンプトインジェクション・ドリフトについての失敗モード思考、レイテンシーとコストのエンジニアリング、検索とオーケストレーションのクラフト、本番環境で実行するのに十分なソフトウェアクラフト。モデルの学習の深さはオプションです——それは機械学習エンジニアの仕事です。

AIエンジニアと機械学習エンジニアの違いは何ですか。

機械学習エンジニアはモデルを学習・チューニング・サービングします——リサーチ色の強い側です。AIエンジニアは、誰かが学習させたモデルの上にプロダクト機能を構築します——検索パイプライン・プロンプトとツールのオーケストレーション・評価ハーネス、そしてそれを囲むレイテンシーとコストの予算。AIエンジニアはモデルを、設計で対処すべきコンポーネントとして扱います。LLM機能を出荷するほとんどのチームが必要としているのは後者であり、前者ではありません。

AIエンジニアは実在する職種ですか、それとも転用されたソフトウェアエンジニアですか。

固有のコアスキルを持つ実在の職種です——評価規律。詐欺師版も実在します——多くの職務経歴書がAPIチュートリアルの経験をAIエンジニアリングとして転用しています。見分け方は、その人が機能が動いていることをどうやって知ったかを語れるかどうかです。転用された候補者は自分が書いたプロンプトを説明しますが、本物のAIエンジニアは評価セット・追い求めた失敗モード・維持したコスト予算を語ります。