채용 · July 29, 2026 · 10분 읽기
AI 프로덕트 매니저 채용 방법: 무엇을 테스트해야 하는가
AI 프로덕트 매니저 채용 방법: 이 역할이 담당하는 업무, 기존 PM과의 차이점, 테스트해야 할 평가 역량, 그리고 이를 드러내는 실무 과제.
← The five pillars of hiring: what assessments measure의 일부
목차
팀 중 하나가 이제 대화하는 기능 — 코파일럿, 요약기, 행동을 취하는 에이전트 — 을 출시하고 있다면, 아마도 AI 프로덕트 매니저를 곧 채용하게 될 것이고, 채용을 시작하기 전에 이 직함이 왜 존재하는지 알아야 합니다. 기존 프로덕트 매니지먼트는 결정론적 기능을 전제로 합니다: 스펙을 작성하고, 엔지니어링이 구축하면, 모든 사용자에게 매번 동일하게 동작합니다. 그 아래에 모델을 넣으면 그 전제가 무너집니다. 출력이 달라지고, 때로는 확신을 갖고 틀리며, '스펙을 충족하는가'는 더 이상 예/아니오 질문이 아닙니다. AI 프로덕트 매니저는 정확히 그 간극을 담당합니다: 모델이 시도해야 할 것과 하지 말아야 할 것의 범위 설정, 누구도 완전히 예측할 수 없는 결과물에 대해 '좋음'이 어떤 의미인지 정의, 그리고 실패했을 때 어떻게 할지 담당. 이 가이드는 AI 프로덕트 매니저를 단순히 직함에 'AI'를 추가한 많은 후보자들과 구별해야 하는 채용 담당자를 위한 것입니다. 이것은 AI가 만들어낸 역할에 관한 시리즈 다섯 편 중 하나로, AI 엔지니어, 프롬프트 엔지니어, AI 에이전트 엔지니어, AI 거버넌스 리드와 함께합니다.
AI 프로덕트 매니저는 실제로 무엇을 하는가?
AI 프로덕트 매니저는 일반 PM과 동일한 발견-출시 루프를 수행하지만, 그 중간 과정이 다릅니다. 출시하는 기능이 매번 동일하게 동작하지 않기 때문입니다. 그들의 일주일은 '스펙 작성'보다는 '충분히 좋은 것이 무엇인지 결정하고, 그렇지 않을 때를 위해 설계하는' 것에 가깝습니다. 구체적으로, 일상적인 업무는 다음과 같은 모습입니다:
- 모델이 시도해야 할 것과 하지 말아야 할 것의 범위 설정 — 생성된 답변이 진정으로 유용한 경우와 출시하기에 너무 위험하거나 신뢰할 수 없는 경우 사이의 선을 긋는 것.
- 기능의 평가 기준 정의: '좋은 결과물'이 구체적이고 검증 가능한 용어로 무엇을 의미하는지, 그리고 팀이 변경 사항이 상황을 개선했는지 아니면 조용히 악화시켰는지 파악하는 방법.
- 비결정론적 결과에 대한 품질 기준 설정 및 유지 — 어떠한 버전도 완벽하지 않다는 점을 고려하여 출시할 만큼 충분히 좋은 것이 어느 정도인지 결정.
- 자체 개발 대 외부 도입 모델 결정: 타사 모델 사용, 파인튜닝, 또는 사내 구축 중 비용, 지연시간, 통제권, 그리고 프론티어가 얼마나 빠르게 움직이는지를 고려하여 결정.
- 가드레일과 에스컬레이션 경험 담당 — 모델이 불확실하거나 틀렸을 때 제품이 어떻게 대응하는지, 그리고 사용자가 확신에 찬 실수 대신 사람이나 안전한 기본값으로 어떻게 연결되는지.
- 모델의 한계를 로드맵의 정직함으로 번역 — 세 번째 실행에서 무너진 데모를 약속하는 대신, 모델이 아직 진정으로 할 수 없는 것을 이해관계자에게 알리는 것.
그 중에서 '모델을 잘 프롬프트하는' 것이 얼마나 적은지 주목하세요. 프롬프트는 수단이고, 직무는 확률적 시스템에 대한 판단력입니다. 이 구분은 후보자를 평가하기 시작할 때 매우 중요합니다. 시장에는 영리한 프롬프트를 시연할 수 있는 사람은 넘쳐나지만, 기능이 언제 답변을 거부해야 하는지를 진지하게 말할 수 있는 사람은 훨씬 적기 때문입니다.

왜 지금 이 역할이 존재하는가?
모델 위에서 출시하는 것이 기존 방식의 변형이 아닌 별개의 고유한 기술로 밝혀졌기 때문입니다. 결제 흐름은 카드를 청구하거나 그렇지 않습니다; 통과 또는 실패하는 수용 기준을 작성할 수 있습니다. 언어 모델은 동일한 입력에 두 가지 다른 답변을 줄 수 있으며, 그 중 하나는 미묘하게 틀렸지만 둘 다 유창합니다. 바로 이 단일한 속성이 이 역할이 하는 모든 것으로 파급됩니다. 예측할 수 없는 동작에 대한 고정된 스펙을 작성할 수 없으므로, 대신 평가 기준을 작성합니다. 기능이 작동한다고 약속할 수 없으므로, 얼마나 자주 작동하는지와 실패의 비용이 얼마인지를 추론합니다. 이 중 어떤 것도 프로덕트 매니저 채용 방법의 체크리스트에는 없습니다 — 그것이 핵심입니다. 이제 그것은 하나의 직업이 되었습니다. 더 넓은 변화는 AI 네이티브 채용에서 다루고 있으며, AI 프로덕트 매니저는 그 중 가장 명확한 예 중 하나입니다.
핵심적인 변화는 동작을 명시하는 것에서 품질을 정의하는 것으로의 전환입니다. 기존 PM은 '스펙이 말하는 대로 동작하는가?'를 묻습니다. AI 프로덕트 매니저는 '결과물이 좋다는 것을 어떻게 알 수 있으며, 얼마나 자주, 그리고 그렇지 않을 때 어떻게 되는가?'를 묻습니다. 테스트하는 모든 것은 이 질문으로 연결되어야 합니다.
실제로 AI 프로덕트 매니저가 필요한가?
종종 그렇지 않습니다 — 그리고 이 역할의 좋은 후보자는 피칭이 끝나기 전에 그렇게 말할 것입니다. 기존 기능 뒤에 단일 모델 호출을 추가하는 것은 전담 채용을 필요로 하지 않습니다; 현재의 프로덕트 매니저와 유능한 엔지니어 한 명으로 충분히 담당할 수 있습니다. 너무 일찍 전문가를 영입하는 것은 실제 실패 모드입니다: 보통 비싼 인재가 필요하지도 않은 기능을 관리하다 지루해하는 결말로 끝납니다.
확률적 컴포넌트가 곁들이에서 메인 요리로 옮겨갈 때 — 모델의 결과물이 제품 가치의 핵심이 되고, 확신을 갖고 틀릴 경우의 비용이 누군가가 해당 실패 모드를 실제 업무로 담당해야 할 만큼 높을 때 — 전담 인재가 진정으로 필요합니다. 환불 초안을 작성하는 지원 코파일럿, 티켓을 접수하는 에이전트, 변호사들이 의존하는 요약기: 이들은 오류율을 삶의 업으로 생각하는 담당자가 필요합니다. 설정 페이지에 덧붙여진 '이것을 요약하기' 버튼은 그렇지 않습니다. 어느 쪽인지 확실하지 않다면, 그 불확실함 자체가 답입니다 — 기존 PM으로 시작하고, 판단 결정이 쌓이기 시작할 때 전문가를 채용하세요.
강력한 AI 프로덕트 매니저와 리브랜딩된 후보자를 구별하는 것은 무엇인가?
이 모든 직함은 리브랜딩된 이력서를 끌어들이는데, 이 직함은 특히 심합니다. 여기서 전형적인 사기꾼은 챗봇 하나를 출시하고 직함에 'AI'를 추가한 후 전문가로 자처하는 프로덕트 매니저입니다. 챗봇을 출시한 것이 아무것도 아닌 것은 아니지만 — 그것이 중요한 역량의 증거는 아니며, 인터뷰는 두 가지를 구별하도록 설계되어야 합니다. 진짜가 어떤 모습인지는 다음과 같습니다:
- 평가 역량 — 가장 강력한 단일 신호. 측정할 수 있을 만큼 구체적인 용어로 기능에 대해 '좋은 결과물'이 무엇을 의미하는지 정의할 수 있는가? 리브랜딩된 후보자는 모델이 '정확하다'고 이야기하지만, 진짜 전문가는 이 특정 작업에서 정확함이 무엇을 의미하는지, 어떻게 샘플링할 것인지, 사용자가 발견하기 전에 회귀를 어떻게 포착할 것인지를 말합니다.
- 모델을 사용하지 말아야 할 때에 대한 판단 — 어떤 문제에는 모델이 잘못된 도구임을 알고, 결정론적 규칙이나 일반 양식이 사용자에게 더 잘 맞을 것이라고 기꺼이 말하는 것. 사기꾼은 반사적으로 모델에 손을 뻗지만, 강력한 후보자는 선택적으로 손을 뻗습니다.
- 이해관계자와 함께 오류율을 추론하는 편안함 — 비기술적인 임원 맞은편에 앉아서 기능이 대부분의 경우 올바르고 나머지에 대한 계획이 있다는 것을 손을 흔들지 않고 설명하는 것. 이것은 불편하고 구체적이기 때문에 대부분의 리브랜딩된 후보자가 무너지는 지점입니다.
- 가드레일과 에스컬레이션 설계 감각 — '모델이 틀렸을 때 어떻게 되는가'를 나중에 제출할 엣지 케이스가 아닌 핵심 프로덕트 작업으로 취급하는 것.
- 로드맵의 정직함 — 엄선된 데모가 가능할 것 같다고 제안한 것이 아닌, 모델이 아직 진정으로 할 수 없는 것을 설명하는 것.
심층적인 머신러닝 수학이 그 목록에 없다는 것을 알 수 있습니다. 유용하고, 일부 제품에서는 중요하지만, 강력함과 약함을 구별하는 것은 아닙니다. 뛰어난 AI 프로덕트 매니저 중에는 손실 함수를 도출할 수 없는 사람도 많습니다. 그들이 할 수 있는 것은 확률적 문제의 범위를 설정하고, 압박 아래에서 품질 기준을 유지하며, 실패에 대해 정직하게 추론하는 것입니다 — 그리고 그것은 연구 역량이 아닌 프로덕트 역량입니다.
가장 흔한 잘못된 채용은 자신감 넘치는 데모 구동자입니다 — 세련된 프로토타입으로 눈을 현혹시키지만 기능이 언제 답변을 거부해야 하는지 말할 수 없는 후보자입니다. 데모는 행복한 경로를 보여줍니다. 직무는 불행한 경로입니다. 두 번째를 평가하세요, 그렇지 않으면 첫 번째를 위해 채용하게 됩니다.
그 역량들을 어떻게 테스트하는가?
진짜 역량을 테스트하는 방법과 같습니다: 트리비아가 아닌 직무 형태의 작업으로. 트랜스포머 아키텍처에 관한 인터뷰 질문은 누군가가 벼락치기를 했는지 알려줄 뿐입니다; 이 사람이 품질 기준을 유지할 수 있는지에 대해서는 아무것도 말하지 않습니다. 후보자에게 실제 작업을 주고 어떻게 하는지 지켜보세요 — 세 가지 연습이 대부분의 신호를 커버하며, 각각 위의 역량 중 하나에 매핑됩니다. AI 도구를 실제로 사용할 수 있는 환경에서 진행하세요, 그것이 실제 업무 방식이기 때문입니다. 이것은 실무 과제 테스트 뒤에 있는 '말하지 말고 보여줘'의 논리와 같습니다.
1. 기능의 평가 기준 작성
그럴듯한 AI 기능 — 예를 들어, 고객 이메일에 대한 답변 초안을 작성하는 코파일럿 — 을 제시하고 평가 기준을 작성하게 하세요: 여기서 '좋은 결과물'이 무엇을 의미하는지, 어떻게 측정할 것인지, 그리고 아래의 모델이 변경될 때 회귀를 어떻게 포착할 것인지. 이것은 루프에서 가장 높은 신호를 가진 연습입니다. 강력한 후보자는 구체적이고 검증 가능한 기준을 만들고 이 특정 작업에서 중요한 실패 모드를 지명합니다. 리브랜딩된 후보자는 모호한 형용사를 만들어내고 고개를 끄덕여 주기를 바랍니다.
2. 할루시네이션 사고 트리아지
시나리오를 제시하세요: 출시된 기능이 방금 고객에게 확신을 갖고 거짓된 내용을 말했고, 그것이 소셜 미디어에 올라와 있습니다. 다음 한 시간, 다음 날, 다음 스프린트에서 무엇을 할 것인가? 즉각적인 완화와 체계적인 수정을 분리할 수 있는지, 이것을 일회성으로 취급하는 대신 얼마나 자주 발생하는지를 추론하는지, 그리고 지표뿐만 아니라 영향을 받은 사용자에 대해 생각하는지 살펴보세요. 이 연습은 가드레일 사고와 오류율 추론을 동시에 드러냅니다.
3. 모델 대 규칙 트레이드오프 결정
모델이나 일반 결정론적 규칙으로 해결할 수 있는 문제 — 예를 들어, 지원 티켓 라우팅 — 를 제시하고 결정을 내리고 방어하게 하세요. 중요한 것은 답이 아니라 추론 과정입니다. 강력한 후보자는 오류 비용, 유지보수 부담, 설명 가능성, 그리고 각각의 실패 모드를 고려하며, 때로는 '여기서는 모델을 사용하지 않겠다'는 결론에 도달합니다. 그 의지가 바로 신호입니다. 이것은 채용 신호로서의 AI Fluency와 직접 연결됩니다 — 도구에 언제 손을 뻗지 않아야 하는지 아는 것이 Fluency의 절반입니다.
AI 도구가 있는 환경에서 이것들을 관찰하며 진행하는 것이 우리 자신의 견해가 귀결되는 지점입니다. AI Sandbox는 후보자를 그 도구들을 사용할 수 있는 현실적인 환경에 놓고 산출물만 읽는 것이 아닌 과정을 볼 수 있도록 구축되었습니다 — 물론, 이것은 정확히 벤더가 할 말입니다. 평가하는 것은 비결정론 아래에서의 판단력이며, 판단력은 누군가가 그것을 발휘하는 것을 지켜봄으로써만 볼 수 있습니다. 그 신호들을 명확하게 읽는 프레임워크로는 AI Fluency 평가 방법과 4D 프레임워크가 핵심 작업을 담당하며, 이 역할에서는 위임(delegation)과 분별(discernment)이 가장 큰 비중을 차지합니다.
인터뷰 루프는 어떤 모습인가?
구조화하고 짧게 유지하세요. 공유 채점 기준표, 주어진 수준의 모든 후보자에게 동일한 연습, 그리고 첫인상을 교환하는 대신 증거를 두고 논쟁하는 디브리핑 — 이 규율이 결정을 공정하고 방어 가능하게 만들며, 'AI를 정말 이해하는 것 같았다'는 것이 정확히 리브랜딩된 이력서를 숨기는 종류의 분위기이기 때문에 여기서 평소보다 더 중요합니다. 구조화된 인터뷰의 메커니즘은 따로 읽어보세요. 효과적인 루프:
- 리크루터 스크린 — 범위와 시니어리티를 확인하고, 한 번 탐색하세요: 그들이 담당한 AI 기능과 그것에서 '좋음'이 무엇을 의미했는지 설명하게 하세요. 그 답이 빠르게 판별합니다.
- 평가 기준 실무 과제 — 위의 연습을 AI가 사용 가능한 환경에서 관찰하며 공유 루브릭으로 채점.
- 크로스 펑셔널 인터뷰 — ML 또는 응용 엔지니어가 자체 개발 대 외부 도입 및 모델 대 규칙 추론을 탐색; 디자인 파트너가 가드레일과 에스컬레이션 경험을 탐색.
- 이해관계자 커뮤니케이션 인터뷰 — 가능하면 비기술적인 사람이 후보자가 전문 용어 뒤에 숨지 않고 오류율과 로드맵의 정직함을 설명할 수 있는지 테스트.
- 채점 기준표에 대한 디브리핑 — 모든 인터뷰어가 위의 차원에 연결된 증거를 가져오고, 방에서 가장 큰 목소리가 아닌 총합으로 결정.
시니어리티와 보상, 솔직하게
숫자를 만들어내지 않겠습니다 — 이 역할의 시장 범위는 책임감 있게 인용하기엔 너무 빠르게 변합니다. 정성적으로: 이 역할이 기존 프로덕트 판단력과 희소한 새로운 역량을 혼합하기 때문에, 동등한 기존 PM 밴드와 같거나 그 이상에 위치하는 경향이 있으며, 역량이 확산됨에 따라 실제지만 냉각 중인 희소성 프리미엄이 있습니다. 시니어리티는 근무 연수보다 확률적 컴포넌트의 중요성을 더 많이 반영합니다. 자신의 시장에 맞게 벤치마킹하고, 직함 인플레이션보다 입증된 평가 역량에 가중치를 두세요 — 이 역할에서는 직함이 특히 노이즈가 많습니다.
첫 90일: 좋음이 어떤 모습인가
강력한 AI 프로덕트 매니저는 첫 달을 화려하지 않은 일을 하며 보냅니다: 기존 기능이 실제로 어떻게 동작하는지 정직하게 파악하는 것. 이것은 팀이 변경 사항이 도움이 됐는지 알 수 있도록 평가 설정을 구축하거나 수정하는 것과 데모가 아닌 실제 실패 사례를 살펴보는 것을 의미합니다. 90일이 되면, 좋음이란 팀이 주요 기능에 대한 '좋은 결과물'의 공유된 구체적 정의, 모델이 틀렸을 때를 위한 가드레일-에스컬레이션 스토리, 그리고 처음부터 한계에 대해 정직했기 때문에 이해관계자들이 신뢰하는 로드맵을 갖고 있는 것처럼 보입니다. 대신 새로운 데모의 소용돌이가 있고 그것이 작동하는지 더 명확하지 않다면, 데모 구동자를 채용한 것입니다 — 두 번째 분기에 느끼게 될 것입니다.
이 역할은 페인트칠을 한 기존 프로덕트 매니지먼트도 아니고, 머신러닝 연구도 아닙니다. 이것은 특정한 기술입니다: 확률적으로 동작하는 기능을 담당하고, 결과물이 고정되지 않을 때 좋음이 무엇인지 정의하며, 모델이 부족한 부분에 대해 사용자, 이해관계자, 그리고 자신에게 정직한 것. 그것을 위해 채용하고, 직무 형태의 작업으로 테스트하며, 아직 그 역할이 필요하지 않다는 결론을 기꺼이 내리세요.
작성자
Aayesha Patel · Co-founder, Hanzomon Inc
Co-founder of Hanzomon. Writes about skills-based hiring, fair assessment and building a better candidate experience.