採用 · August 2, 2026 · 約13分
AIエンジニアの面接質問:回答の評価方法
採用マネージャー向けAIエンジニア面接質問集:RAG、エージェント設計、信頼性に関する強い回答と弱い回答の違い、および採点アプローチ。
← 「採用の5つのピラー:アセスメントが測定するもの」の一部
このガイドは、AIエンジニアのループを回す採用マネージャーまたはエンジニアリングリードのために書かれています——本番のLLM機能に組み込み、それを誠実で高速で手頃に保つ役割の人を採用しようとしている方向けです。候補者向けに書かれているわけではありませんが、候補者が読んであなたが何を求めているかを正確に知ることは歓迎します。この認識が重要なのは、そのことがこれらのAIエンジニア面接質問が乗り越えなければならない問題を名指しするからです。2026年、候補者はアシスタントで準備してきており、あなたがきれいに書き下せるどんな質問も、生涯一度も検索パイプラインを出荷したことのない人が同じようにきれいに答えることができます。暗記可能な質問リストは流出した試験問題です。ですからこのガイドはリスト以上のものを提供します。各質問について、強い回答がカバーすること、弱い回答がどう聞こえるか、ジュニアとシニアの回答がどう分岐するか、面接官を誠実に保つ採点アプローチ、そして——採用を決めるスキルについて——質問をやめて実際に働く姿を見始めるポイントを伝えます。ショートワークサンプルの後、オファーの前に、単独のスクリーンとしてではなく、ループの中で使用してください。
面接の回答を一貫してスコアリングする方法
候補者と会う前に、話しているときではなく、良い回答がどう聞こえるかを決めてください。その単一の習慣が構造化面接とラポートコンテストの違いです。残りはそこから続きます。すべての候補者に同じ順番で同じ質問をし、直感ではなく書いたアンカーに照らして各回答を採点します。
実用的なルーブリックは行動アンカーを事前に書き出した1〜5のスケールです。ある質問について、5は「未誘導で失敗モードを名指し、自分の仕事からの具体的な例を挙げ、修正をどう測定したかを説明する」と書かれているかもしれません。3は「具体的な体験例のない正しい教科書の回答を提供する」、1は「定義を暗唱するか質問をそらす」といった形です。尋ねる予定のすべての質問にそれらのアンカーを書いてください。1日午後かかりますが、プロセス全体で最もレバレッジの高い1時間です。曖昧な印象を比較可能なスコアに変えるからです。これは汎用の構造化面接科学であり、独自のものではありません。構造化面接ガイドでその実践を説明しています。各面接官は独立してスコアを出し、その後でメモを比較します。デブリーフで最も声の大きい人が静かに決定にならないように。
検索拡張システム
検索はほとんどのLLM製品機能が存在し、そのほとんどが静かに失敗する場所です。これらの質問は候補者が検索を失敗モードを持つエンジニアリングシステムとして理解しているか、それとも暗記したレシピとして理解しているかを探ります。具体性がその指標です。強い回答は検索がどこで壊れるかを名指しします。弱い回答はステージを順番に暗唱して止まります。
- 検索拡張機能でのユーザーの質問からモデルの回答までに何が起きるか説明してください — 強い回答はチャンキング、インデックス作成、ランキング、プロンプト組み立てをトレードオフを持つ選択として説明します。赤いフラグは決定なしの固定パイプラインとしてステージを暗唱することです。
- 検索機能が自信を持って、流暢に、間違った回答を返します。どう診断しますか? — 強い回答はプロンプトに触れる前に検索の失敗と生成の失敗を分けます。赤いフラグは何が検索されたかを確認せずに直接プロンプトの調整に飛びつくことです。
- コーパスに対するチャンクサイズとオーバーラップをどう決めますか? — 強い回答はドキュメントとクエリの形に結びつけ、測定すると認めます。赤いフラグは一つの数字を普遍的に正しいものとして引用することです。
- クエリに対して検索が有用なものを何も返さないときどうしますか? — 強い回答は設計されたフォールバックを持ち、モデルにコンテキストを作り出させません。赤いフラグは検索が常に何か関連するものを返すと仮定することです。
- モデルの回答とは別に検索が実際に良いかどうかをどう評価しますか? — 強い回答は検索固有のメトリクスとラベル付きセットを名指しします。赤いフラグは最終的な回答が正しそうに見えるかだけで検索を判断することです。
- いつ検索をまったく使わず、コンテキストをプロンプトに直接入れますか? — 強い回答はコーパスのサイズ、鮮度、コストを理由付けします。赤いフラグはすべてのLLM機能に検索を必須として扱うことです。
検索失敗の質問がここでの最重要質問ですので、十分な時間を使ってください。ジュニアの回答は機能全体を一つのブラックボックスとして扱います。回答が間違っていたのでプロンプトを書き直し、モデルに物事を作らないよう指示する一行を追加して、期待します。シニアの回答はどちらが壊れたかを知るまでプロンプトに触れることを拒否します。失敗したクエリに対して検索されたチャンクを引き出して読みます。適切なドキュメントがそもそも検索されていなければ、プロンプトは決して問題ではなかった——バグは上流にあり、コンテキストウィンドウに届かなかったドキュメントをどんなプロンプトの叱責も修正できません。適切なドキュメントが検索されていてもモデルがまだ間違って答えるなら、今度は生成の問題です。検索のステージを完璧に暗唱して、なぜリトリーバーが間違ったドキュメントを返したかを言えない候補者は、地図を暗記していて現地を歩いたことがありません。
AI時代の注意点:このグループのすべての質問は、検索の語彙が徹底的にドキュメント化されているため、アシスタントから読んでいる候補者が美しく答えることができます。アシスタントを乗り越えるのは目の前の壊れた機能です。磨きを削ぎ落とすワークサンプルのフォローアップ。流暢で間違った回答を返す検索エンドポイントを渡して、プロンプトに触れる前に検索されたチャンクを読むかどうかを見てください。実際にこの仕事をやったことがある人は誰も最初にプロンプトに手を伸ばしません。

エージェントとツールの設計
エージェントは現在この分野で最も手を伸ばされすぎているパターンであり、それが抑制をシグナルにします。最も優秀なAIエンジニアはエージェントへの賛成と同じくらい頻繁にあなたをエージェントから遠ざけます。これらの質問は候補者がツール呼び出しを配線できるかどうかよりも、アーキテクチャ全体が間違いだとわかるかどうかについてです。チームが本当にエージェント的な製品を構築しているなら、AIエージェントエンジニアの採用方法と組み合わせてください。
- エージェントを使わず固定ワークフローを選ぶのはいつですか? — 強い回答はうまくいく最も単純なものをデフォルトとし、真にオープンエンドなタスクのためにエージェントを取っておきます。赤いフラグはエージェントをあらゆるものに対する当然の現代的な選択として扱うことです。
- エージェントが呼び出すツールがゴミを返すが、モデルはそれを信じて続けます。どう設計で対処しますか? — 強い回答はツールのアウトプットを検証し、ツールが成功したと決して仮定しません。赤いフラグはモデルが自信を持っているからといってツールのレスポンスを信頼することです。
- 午前2時にエージェントが不正な形式のツール呼び出しでループしないようにどうしますか? — 強い回答はループ制限、タイムアウト、オブザーバビリティを説明します。赤いフラグは失敗の封じ込めがなく、エージェントが何をしたかを見る方法もないことです。
- エージェントがどのアクションを自律的に実行し、どれに人間のループが必要かをどう判断しますか? — 強い回答は爆発半径と可逆性を理由付けします。赤いフラグは取り返しのつかないミストの代償を何も考えずに完全自律化することです。
- 実行ごとにツールのパスが変わるエージェントをどうテストしますか? — 強い回答は単一の固定トランスクリプトではなく行動と結果を評価します。赤いフラグはハッピーパスのデモが機能することを意味すると仮定することです。
- 廃棄または簡素化したエージェント設計を説明してください。何が引き下げさせましたか? — 強い回答は実際の痛みからの獲得した懐疑論を示します。赤いフラグはエージェント的なアプローチを一度も疑ったことがないことです。
「エージェントをいつ使わないか」がこのグループの最重要質問であり、流行の候補者への罠です。ジュニアの回答、特に現在のエージェントチュートリアルの波を読んできた人は、デフォルトでエージェントに手を伸ばし、実際には3つの連続したAPI呼び出しでしかないタスクのための精巧な複数ステップのオーケストレーションを説明します。洗練さと判断力を混同しています。シニアの回答は逆の端から始まります。タスクが実際に何を必要とするかを問い、エージェントはレイテンシ、コスト、非決定論、そして失敗モードのカテゴリ全体を追加することに注意し、パスが事前に本当にわかり得ない問題のために取っておきます。エージェントにできたが普通のワークフローの方が良かったと喜んで教えてくれます。エージェントからあなたを遠ざけるエンジニアは、たいてい後処理をしたことがあります。
AI時代の注意点:アシスタントはどんなプロンプトに対しても印象的に聞こえるエージェントアーキテクチャを喜んで生成するため、それで準備した候補者はエージェントについて流暢に説明できても本番環境で一度も実行したことがないかもしれません。それを乗り越えるフォローアップはエージェントがもっともらしいが過剰なライブタスクです。シグナルは彼らが退屈なワークフローを選ぶかどうかです。ワークサンプルでその判断を下す様子を見ることは、彼らが練習できるどんな回答にも勝ります。
評価と信頼性
これが役職の決定的なコンピテンシーですので、それに応じて重み付けしてください。AIエンジニアの価値全体は、機能が機能するかどうかを知ること——そしてそれをユーザーに届く前に証明できること——にあります。尋ねられる最も有用な単一の質問は、過去の機能が機能していたとどう知ったかです。その答えが本物とリバッジしただけの人を、ループの他のどんなものよりも速く分けます。
- 最後のLLM機能を出荷する前に実際に機能していたとどう知りましたか? — 強い回答は評価セット、オフラインとオンラインのチェック、信頼したメトリクスを説明します。赤いフラグは「何度か試したときに正しく見えた」です。
- オフライン評価とオンライン評価の違いは何ですか?またいつ両方が必要ですか? — 強い回答は各々が得意なことのために使います。赤いフラグはデモと評価を混同することです。
- 一度も評価セットがなかった機能の評価セットをどう構築しますか? — 強い回答は実際の失敗例から始めて意図的に増やします。赤いフラグはアウトプットを目視するだけの方法しかないことです。
- 基盤となるモデルがプロバイダーによって静かに更新され、あなたの機能が静かに劣化します。どう捕捉しますか? — 強い回答は継続的に実行するリグレッションスイートを持ちます。赤いフラグは先週機能していた機能が今日も機能していると仮定することです。
- 信頼できないユーザー入力を受け取る機能でプロンプトインジェクションをどう防ぎますか? — 強い回答はモデルの入力を敵対的なものとして扱い、境界を設計します。赤いフラグはユーザーのテキストがモデルをハイジャックできることへの認識がないことです。
- 実際に対処できる方法で幻覚をどう測定しますか? — 強い回答は主張を取得可能なソースに基づかせてカウントします。赤いフラグは幻覚を測定不能として、したがって無視することです。
「機能していたとどう知りましたか?」はそれ自体の探索に値します。ループで最速のインポスター検出器だからです。聞いてから沈黙して、彼らがスペースを埋めるようにしてください。リバッジした候補者——AIエンジニアリングが実際にはAPIチュートリアルを追った午後である人——は誇りに思ったプロンプトとステークホルダーを感心させたデモについて話します。真のAIエンジニアは評価セットについて話します。実際の失敗ケースからどう組み立てたか、捕捉したリグレッション、機能が皆が想定していたよりも悪いと教えた不快な数字について。ジュニアバージョンは評価が重要とわかっていますが、ローンチ前に一度だけオフラインで実行したことがあるだけです。シニアバージョンは決して止まらない評価を持っています。前日に機能していた機能の下でプロバイダーがモデルを更新したことで焼かれた経験があるからです。同じ質問、3つの異なる回答、そして渡す回答にシニアリティが聞こえます。
AI時代の注意点:評価規律は会話でアシスタントが本当に偽装できない唯一のコンピテンシーです。正直な回答は、壊れた具体的なものとそれを候補者がどう測定したかの話だからです。それでも準備は語彙を供給できます。それを解決するワークサンプルのフォローアップ。機能しているように見える機能を渡して、自分の修正を信頼する前に評価に手を伸ばすかどうかを観察してください。まず証明せずに出荷できない人たちが欲しい人です。
本番環境の判断力:コスト、レイテンシ、フォールバック
最後のグループは、LLM機能を実際のユーザーに出荷した人と印象的なプロトタイプを作った人を分けます。本番環境の判断力はトークン、ミリ秒、そして何かが壊れる日のプランに現れます。これらは地味な質問であり、だからこそ識別します——誰も練習しないため、回答はたいてい正直です。
- あなたの機能は1,000コールあたりいくらかかりますか?またどうやって調べますか? — 強い回答はトークンで考え、コストがどこに潜んでいるかを知ります。赤いフラグは自分が構築した機能のコストを一度も見たことがないことです。
- より安く小さいモデルで機能の一部が十分かどうかをどう判断しますか? — 強い回答はタスクの難しさでルーティングし、品質のトレードオフを測定します。赤いフラグはどこでも最大のモデルをデフォルトとすることです。
- モデルプロバイダーがピーク時に障害を起こします。あなたの機能はどうなりますか? — 強い回答はフォールバックを持ち、グレースフルにデグレードします。赤いフラグはプランBのない単一のハード依存です。
- 遅いプロンプトチェーンのレイテンシをどうコントロール下に置きますか? — 強い回答はキャッシング、並列化、チェーンのトリミングを名指しします。赤いフラグは遅さをLLMの本質として受け入れることです。
- コードと同じようにプロンプトをどうバージョン管理してロールバックしますか? — 強い回答はプロンプトをロールバックパスを持つバージョン管理されたアーティファクトとして扱います。赤いフラグは本番環境でプロンプトを直接編集して履歴がないことです。
- 実際のユーザーへの誤動作後にLLM機能をデバッグするために何をログに記録しますか? — 強い回答は入力、検索されたコンテキスト、モデルのアウトプットを捕捉します。赤いフラグは成功または失敗のフラグを超えるログがないことです。
コストの質問はループで最も明かしやすい質問の一つです。これほど少ない候補者が予算を持たされたことがあるからです。機能あたり1,000コールのコストを聞くと、ジュニア候補者はよく瞬きします——構築して出荷して、その請求書を一度も見たことがない。誰か他の人がその行を所有していたからです。ジュニアには失格ではありませんが、彼らがどこにいるかを教えてくれます。シニア候補者は仕事の通貨で答えます。この機能はすべてのドキュメントをすべてのプロンプトに詰め込んでいるため高価です。だから検索をキャッシュし、簡単なクエリをより安いモデルにルーティングし、まずチェーンをトリミングします。コストの行が痛みを与えるのを感じて、それが構築の仕方を変えました。数学をテストしているのではありません。その数字が彼らにとってリアルかどうかをテストしています。
AI時代の注意点:本番環境の判断力は会話で最も安全に探索できるグループです。正直な回答はアシスタントが候補者のために発明できない退屈な戦争の話だからです。準備を乗り越えるフォローアップは特定の数字を聞いて沈黙することです。最後の機能が何のコストがかかったかとなぜかを教えてくれるなら、予算を持っていました。一般論に手を伸ばすなら、持っていませんでした。
いつ質問を止めてテストを始めるべきか
候補者が上のすべての質問にためらいなく答えられる瞬間こそ、質問を最も信頼しないべき瞬間です。面接は主張をサンプリングし、ワークサンプルは仕事をサンプリングします。壊れた検索機能をどう診断するかの自信を持った説明は主張です。誰かが検索されたチャンクを引き出して読み、その後でプロンプトに触れるかどうかを決める様子を見ることは証拠です——そして2026年、アシスタントが自信を持った説明をオンデマンドで提供できる状況では、このギャップはかつてないほど重要です。
ですから面接の前、後ではなくワークサンプルを実施してください。候補者に職務の形に似たタスクを渡してください——流暢で間違った回答を返す検索機能、不正な形式のツール呼び出しでループするエージェント、静かにレイテンシ予算を超えるプロンプトチェーン——AIエンジニアのアセスメントからAIを禁止することはこの役職の誰もやらない仕事をテストすることになるため、モデルが禁止されるのではなく本当に利用可能な環境で。このようなワークサンプルテストはどんな質問よりも業務上の行動をはるかによく予測し、どの探索が貴重な面接時間に値するかを教えてくれます。サンプルがすでに健全な評価規律を示しているなら、それが曖昧にした本番環境の判断力かエージェントの抑制を代わりに深く掘り下げてください。レポートに質問を選ばせてください。
これが当社のものを含む、アセスメントプラットフォームがループでその位置を占める場所です。当社のAI SandboxはAIエンジニアリングの役職に対してまさにこの職務の形に似たセッションを実行し、レポートはその後の面接をどこに向けるかを教えます——能力レベルで、あなたの決定を指示することなく。役職の広い採用ケースはAIエンジニアの採用方法にあります。モデルがどう機能するかではなく、誰かがモデルとどう働くかを読む規律はAI Fluencyの評価方法であり、AIエンジニアにとってモデルが間違えているときを見抜くことが仕事全体だからです。4DフレームワークのDelegation(委任)、Description(記述)、Discernment(識別)、Diligence(誠実さ)に照らして採点されます——後の2つがAIエンジニアには最も重い重み付けを持ちます。壊れたリポジトリとストップウォッチを使って自前のバージョンを作ることもできます。当社のものを見たい場合はデモを予約してください。いずれにしても原則は成立します。会話を開くために質問し、そして質問を止めて観察を始めてください。
最良のAIエンジニアは最もスムーズな回答を持つ人ではありません。問題なさそうに見える機能を渡されたとき、測定するまで信頼することを拒否し——デモが隠していた不快な数字をあなたに告げる人です。そのインスティンクトを面接し、ワークサンプルで確認してください。さもなければ、よく準備された回答を実際に出荷されるものと見間違え続けることになります。
執筆者
Aayesha Patel · Co-founder, Hanzomon Inc
Co-founder of Hanzomon. Writes about skills-based hiring, fair assessment and building a better candidate experience.