전체 글

채용 · July 18, 2026 · 9분 읽기

행동 평가: 직감이 아닌 루브릭으로 채용하기

행동 평가는 채용에서 가장 자주 직감에 맡겨지는 영역입니다. 행동 기반 평정 척도(BARS)와 구조화된 과거 행동 질문이 모호한 특성을 두 평가자가 합의할 수 있는 관찰 가능하고 비교 가능한 신호로 바꾸는 방법을 살펴봅니다.

Jakir Patel 작성 · Founder, Hanzomon

공유

채용의 다섯 가지 기둥: 평가가 실제로 측정하는 것의 일부

채용
목차

업무 능력은 있지만 팀과 함께 일하지 못하는 사람을 채용하면 한 분기 안에 그 영향이 나타납니다. 놓친 인계, 코드 리뷰에서의 마찰, 조용한 이탈이 그것입니다. 누군가가 팀에서 어떻게 행동하는지 — 압박 속에서, 갈등 상황에서, 아무도 보고 있지 않을 때 — 는 순수한 역량만큼이나 재직 기간과 성과를 좌우합니다. 그럼에도 행동 평가는 대부분의 채용팀이 단 한 번의 면접에서 직감으로 축소해 버리는 영역입니다. 어떤 채용 담당자나 인재 리더에게도 이것은 가장 위험하게 추측하는 지점입니다. 반드시 추측에 의존할 필요는 없습니다. 이 글은 채용의 다섯 가지 기둥 중 하나인 행동 기둥 — 기술적으로 뛰어난 후보자가 실제로 성장할 수 있는지를 결정하는 특성과 업무 스타일 — 에 대한 실무자 가이드입니다.

행동 평가가 실제로 측정하는 것

행동 평가는 성격 퀴즈가 아니며 느낌 점검도 아닙니다. 상황에 관계없이 반복적으로 나타나는 안정적이고 업무와 관련된 특성을 측정합니다. 즉, 어떻게 협력하는지, 갈등에 어떻게 반응하는지, 좌절을 어떻게 다루는지, 모호한 상황에서 얼마나 주도성을 발휘하는지입니다. 이러한 패턴은 어떤 단일 프로젝트보다도 오래 지속됩니다. 후보자는 화요일에 코딩 테스트를 통과할 수 있지만, 까다로운 코드 리뷰를 받아들이는 방식은 여러분이 몇 년간 함께 살아가야 할 행동입니다.

중요한 구분은 특성 대 의사결정입니다. 행동 기둥은 후보자가 직장에서 어떤 사람인지를 묻습니다. 그 자매 기둥인 상황 판단은 특정 딜레마를 얼마나 잘 추론하는지를 묻습니다. 둘 다 필요하지만 서로 다른 질문에 답하며, 이 둘을 혼동하는 것이 많은 면접이 따뜻한 느낌과 약한 신호를 만들어내는 이유입니다.

'문화 적합성'의 문제점

대부분의 팀은 행동을 평가하려고 합니다. 단지 '문화 적합성'이라는 레이블 아래, 비구조화된 대화에서, 가장 강한 인상에 따라 판단할 뿐입니다. 이것이 편향이 채용에 조용히 스며드는 지점입니다. 적합성에 대한 비구조화된 판단은 익숙함에 보상을 줍니다 — 패널 자신을 떠올리게 하는 후보자, 취미를 공유하는 후보자, 면접을 매끄럽게 진행하는 후보자가 아닌, 가장 많이 기여할 후보자가 아닙니다. 실패 유형은 팀이 행동을 측정한다는 것이 아니라, 구조 없이 측정한 뒤 직감이 만들어낸 숫자를 신뢰한다는 것입니다.

재구성이 도움이 됩니다. '문화 적합성'을 '문화 기여' 또는 더 정확하게는 해당 역할이 실제로 필요로 하는 정의된 행동 특성 집합으로 대체하십시오. '이 사람이 우리 팀을 더 나아지게 할 것인가?'는 증거로 답할 수 있는 질문입니다. '내가 그들을 좋아하는가?'는 그렇지 않습니다. 프로세스에서 주관성을 제거하는 방법에 대해서는 채용의 편향 줄이기 가이드가 더 광범위한 도구를 다루며, 행동 앵커는 그 중 가장 날카로운 도구 중 하나입니다.

비공식적으로 평가된 '문화 적합성'은 그 외에는 엄격한 프로세스에서 편향이 가장 흔하게 숨어드는 단일 지점입니다. 루브릭도 없고 기록도 없는 단계가 있다면 그 결과를 신호가 아닌 의견으로 취급하십시오.

앵커가 행동을 비교 가능하게 만든다

해결책은 행동 기반 평정 척도, 즉 BARS입니다. 모든 평가자가 저마다의 정의를 가진 모호한 1~5점으로 '협업'을 평가하는 대신, BARS는 각 수준이 관찰 가능한 행동에서 어떻게 보이는지를 명확하게 설명합니다. 협업의 최고 점수는 이렇게 읽힐 수 있습니다: '팀원에게 장애물을 선제적으로 공유하고, 두 가지 옵션을 제안하며, 그들의 제약에 맞게 조정한다.' 낮은 점수는 요청받을 때까지 정보를 보류하는 것을 설명합니다. 이제 '협업'은 직감으로 읽는 것이 아니라 두 평가자가 동일하게 적용하는 루브릭입니다.

이것이 면접에서 가장 큰 단일 지렛대입니다. 수십 년간의 메타분석은 구조화되고 앵커가 있는 평가가 비구조화된 판단보다 훨씬 더 예측력이 높고 신뢰할 수 있다는 점을 일관되게 밝혀냅니다 — 면접관의 직관이 아니라 구조가 일을 합니다. 앵커는 형용사를 관찰 가능한 행동으로 대체하기 때문에 평가자 간 일치도를 높이며, 이는 두 평가자가 동일한 점수로 수렴한다는 것을 의미합니다. 앵커링 이후에도 두 공정한 평가자가 여전히 동의하지 않는다면, 그 불일치 자체가 유용한 데이터입니다. 보통 앵커가 모호하고 개선이 필요하다는 것을 의미합니다.

공정한 두 평가자가 같은 답변에 서로 다른 점수를 줄 것이라면, 여러분은 후보자가 아니라 평가자를 측정하고 있는 것입니다. 앵커는 각 수준을 관찰 가능한 행동으로 정의함으로써 그 간극을 좁힙니다.

가상 질문보다 과거 행동

행동 특성의 경우, 특히 고위직에 대해 과거 행동 질문이 가장 잘 예측하는 경향이 있습니다. '상사가 내린 결정에 동의하지 않았던 때에 대해 말씀해 주세요'는 후속 질문에서 조작하기 어려운 실제 경험한 예를 끌어냅니다. 이것을 상황 판단에 속하고 습관보다 추론을 측정하는 '만약 ~라면 어떻게 하시겠습니까?' 가상 질문 형식과 대조해 보십시오. 후보자는 실제로 한 번도 실행하지 못한 이상적인 반응을 설명할 수 있지만, 세부 사항까지 탐색된 과거 이야기는 훨씬 더 만들어내기 어렵습니다. STAR 구조 — 상황(situation), 과제(task), 행동(action), 결과(result) — 를 사용하고 '팀이' 한 일이 아니라 후보자가 개인적으로 취한 '행동'을 파고드십시오. 진짜 신호는 후속 질문에 있습니다. 진짜 이야기는 '그 다음에는 어떻게 됐나요?'라는 질문 세 번에도 살아남지만 만들어낸 이야기는 세부 사항이 바닥납니다. 질문 체크리스트를 빠르게 훑는 것보다 탐색하는 데 시간을 할당하십시오. 깊이 탐색된 두 가지 예시가 표면을 벗어나지 못한 여섯 가지보다 낫습니다.

면접 전에 특성을 정의하라

누군가와 후보자와 대화하기 전에 해당 역할에서 성공을 진정으로 예측하는 두세 가지 행동 특성을 정의하십시오. 지원 담당자와 수석 엔지니어 모두 협업이 필요하지만, '협업'은 각각에서 다른 것을 의미하며 앵커가 그것을 반영해야 합니다. 일반적인 역량 라이브러리가 아닌 실제 업무에서 특성을 도출하는 것은 잘 작성된 직무 기술서가 제 역할을 하는 지점입니다. 거기에 나열한 행동이 점수를 매기는 루브릭이 됩니다. 네 가지 특성을 엄격하게 평가하는 것이 열두 가지를 직감으로 평가하는 것보다 낫습니다.

측정할 가치가 있는 특성은 역할에 따라 다르지만, 시작 목록으로 삼을 만큼 충분히 자주 반복되는 것들이 있습니다. 다음 중에서 선택한 다음, 특정 직무에 맞는 관찰 가능한 행동으로 각각을 번역하십시오:

    각 항목이 형용사가 아닌 행동으로 작성되어 있다는 점에 주목하십시오. '회복탄력적'은 레이블입니다. '계획이 어긋날 때 건설적인 태도를 유지하고 다음 단계를 명확히 유지한다'는 평가자가 답변에서 실제로 관찰하고 점수를 매길 수 있는 것입니다. 그 번역 — 형용사에서 관찰 가능한 행동으로 — 이 행동 평가 분야의 핵심을 한 번에 담아냅니다.

    후보자 응답이 구조화된 루브릭 기반 채점을 위해 대기 중인 인간 검토 대기열
    구조화된 검토 대기열은 모든 평가자가 동일한 앵커를 기준으로 동일한 행동 증거를 채점하도록 합니다.

    행동 평가가 구조화된 프로세스에서 차지하는 위치

    행동 증거는 마지막에 추가되는 '성격 라운드'가 아닌 더 광범위한 구조화된 면접에서 하나의 의도적인 단계일 때 가장 강력합니다. 이는 모든 후보자에게 동일한 질문, 동일한 앵커 루브릭, 평가자들이 의견을 비교하기 전의 독립적인 채점, 그리고 각 점수에 첨부된 서면 증거를 의미합니다. 독립적인 채점이 중요합니다. 평가자들이 먼저 논의하고 나중에 평가하면, 첫 번째 자신감 있는 목소리가 방을 고정하고, 여러분은 다시 친밀감을 측정하는 것으로 돌아갑니다.

    또한 행동이 조용히 지배하도록 두기보다 적절하게 가중치를 부여하는 것을 의미합니다. 행동 적신호는 기술적으로 강한 후보자를 정당하게 거부할 수 있습니다 — 하지만 그 적신호가 우연한 인상이 아닌 문서화되고 앵커된 관찰일 때만 그렇습니다. 구조화된 틀 안에 행동을 넣는 것의 요점은 다른 모든 기둥과 동일한 기준에 책임을 지게 하는 것입니다.

    행동 평가가 잘못되는 일반적인 방법

    좋은 의도를 가진 팀도 예측 가능한 방식으로 행동 평가를 훼손합니다. 가장 일반적인 것은 후광 효과입니다. 후보자가 한 차원에서 강하면 그 광채가 다른 모든 점수로 퍼져서, 훌륭한 기술적 답변이 조용히 협업 평가를 높입니다. 앵커된 채점은 이에 저항하지만, 평가자들이 단일 전반적 인상을 형성하고 숫자를 역산하는 대신 고유한 루브릭에 따라 각 특성을 평가할 때만 그렇습니다.

    두 번째 실패는 유창함을 증거로 취급하는 것입니다. 매끄럽고 잘 연습된 이야기를 하는 후보자가 반드시 해당 특성을 보여주고 있는 것은 아닙니다 — 단순히 자신감 있는 화자일 수 있습니다. 여기서 세부 사항을 파고드는 것이 중요합니다. 후보자가 개인적으로 무엇을 했는지, 상대방이 무엇을 말했는지, 결과가 무엇이었는지, 무엇을 바꾸겠는지 물어보십시오. 연습된 답변은 세부 사항에서 얇아지고 실제로 경험한 답변은 깊어집니다. 세 번째 함정은 특성 목록에서의 범위 확장입니다. 모든 이해관계자가 '자신의' 품질을 추가하려 하고, 결국 네 가지를 잘 평가하는 대신 열 가지를 얕게 채점하게 됩니다. 저항하십시오. 엄격하게 앵커되고 일관되게 적용된 짧은 목록이 매번 인상으로 채점된 긴 목록을 이깁니다 — 그리고 면접이 산만하게 펼쳐지는 대신 집중적으로 유지되기 때문에 지원자 경험도 인간적으로 유지됩니다.

    전반적인 견해를 형성하기 전에 고유한 앵커에 따라 각 특성을 평가하십시오. '강한 채용'을 먼저 결정하고 점수를 맞추어 채우는 순간, 루브릭을 후광 효과로 대체한 것입니다.

    Hanzomon이 행동 기둥을 평가하는 방법

    Hanzomon은 AI 네이티브 역량 평가 플랫폼이며, 행동은 그것이 평가하는 다섯 가지 기둥 중 하나입니다. 부가적인 성격 테스트가 아닌, 행동 신호는 구조화되고 역할별로 특화된 프롬프트를 통해 포착되고 행동 기반 평정 척도에 따라 채점되므로, 동일한 증거가 평가자 전반에 걸쳐 동일한 점수를 산출합니다. AI 생성 평가는 직무별로 생성되므로 행동 특성이 일반적인 템플릿이 아닌 해당 직무에 연결됩니다. 인간 평가자는 검토 대기열을 통해 행동 증거에 대한 루프 안에 머뭅니다. 업무 스타일은 바로 명확한 앵커에 따라 판단을 확인하는 사람이 혜택을 받는 미묘한 신호이기 때문입니다.

    모든 행동 점수는 앵커와 지원 증거를 함께 담고 있으므로, 결과물은 감사 가능합니다 — 후보자가 왜 그 점수를 받았는지 확인할 수 있습니다. 이러한 투명성이 행동 평가를 프로세스에서 가장 부드러운 부분에서 가장 방어 가능한 부분 중 하나로 바꾸는 것입니다. 행동 라운드가 실제 후보자 평가에서 다른 기둥들과 어떻게 맞아떨어지는지 보고 싶다면, 가장 빠른 방법은 데모 신청이나 샘플 평가를 해보는 것입니다.

    시작하기

    내일부터 행동 평가를 개선하기 위해 플랫폼이 필요하지 않습니다. 역할이 실제로 의존하는 두세 가지 특성을 선택하십시오. 각각에 대해 높은, 보통, 낮은 답변에 대한 앵커된 설명을 작성하십시오. 모든 후보자에게 동일한 과거 행동 질문을 하고, 그 앵커에 따라 독립적으로 채점한 후 의견을 비교하십시오. 그것만으로도 '문화 적합성' 추측에서 비교 가능한 증거로 이동할 수 있습니다. 행동 기둥은 채용의 거의 어떤 다른 부분보다도 구조에 더 많은 보상을 줍니다 — 이것이 팀이 직감에 맡기고 싶어하는 기둥이며, 직감이 구조가 확인해야 할 바로 그것이기 때문입니다.

    Behavioural assessmentHiring pillarsBiasStructured interviews
    J

    작성자

    Jakir Patel · Founder, Hanzomon

    Building H-Evaluate — AI-native, quality-gated hiring assessments. Writes about assessment engineering, hiring integrity and compliance-first AI.

    실무에 적용하기

    방금 읽은 내용을 채용 결정으로 바꾸는 평가, 직무별 가이드, 계산기.

    자주 묻는 질문

    행동 기반 평정 척도(BARS)란 무엇인가요?

    행동 기반 평정 척도(BARS)는 '협업'이나 '회복탄력성' 같은 각 특성의 모든 수준을 모호한 형용사가 아닌 관찰 가능한 행동으로 정의하는 채점 루브릭입니다. 예를 들어 협업의 최고 점수는 '팀원에게 장애물을 선제적으로 공유하고, 두 가지 해결 옵션을 제안하며, 그들의 제약에 맞게 조정한다'로 설명될 수 있습니다. 이를 통해 두 평가자가 같은 답변을 같은 방식으로 채점할 수 있어 편향과 일관성 없는 판단을 줄입니다.

    행동 면접과 상황 판단 면접의 차이는 무엇인가요?

    행동 면접은 '~했던 때에 대해 말씀해 주세요'와 같은 질문을 통해 후보자가 과거에 어떻게 행동했는지를 묻습니다. 이는 습관적인 특성 — 협업하거나 피드백을 받아들이거나 압박 속에서 행동하는 방식 — 을 측정합니다. 상황 판단 면접은 가상의 딜레마에 대한 추론을 테스트합니다. 둘 다 가치 있지만 다른 것을 예측합니다. 행동 질문은 특히 고위직에서 습관적인 패턴을 측정할 때 더 강한 예측 타당성을 보입니다.

    후보자 평가에서 편향을 줄이려면 어떻게 해야 하나요?

    핵심 단계는 네 가지입니다. 첫째, 면접 전에 역할별 행동 특성을 정의하십시오. 둘째, 각 특성에 대해 관찰 가능한 행동으로 앵커된 루브릭을 작성하십시오. 셋째, 모든 후보자에게 동일한 질문을 하십시오. 넷째, 의견을 비교하기 전에 평가자들이 독립적으로 채점하게 하십시오. 이러한 단계는 후광 효과와 친밀감 편향을 줄이고, '문화 적합성'과 같은 비구조화된 판단을 비교 가능한 증거로 대체합니다.

    행동 평가에서 가장 중요한 특성은 무엇인가요?

    최선의 특성은 역할에 따라 다르지만, 여러 직무에 걸쳐 자주 등장하는 특성으로는 협업(맥락 공유와 조정), 주도성(모호한 상황에서 결과 소유), 압박 하의 회복탄력성, 피드백에 대한 반응, 커뮤니케이션 명확성, 적응력이 있습니다. 중요한 것은 이러한 특성을 형용사가 아닌 관찰 가능한 행동으로 정의하는 것입니다. '회복탄력적'은 레이블이지만, '계획이 어긋날 때 건설적인 태도를 유지하고 다음 단계를 명확히 유지한다'는 평가자가 실제로 채점할 수 있는 것입니다.

    행동 평가를 위해 AI 도구를 사용해도 괜찮나요?

    AI 생성 평가는 일관된 구조화된 행동 프롬프트를 역할별로 생성하는 데 유효합니다. 그러나 업무 스타일은 인간의 확인이 가장 큰 혜택을 주는 미묘한 신호입니다. 가장 효과적인 접근 방식은 AI를 활용해 직무별 행동 질문과 앵커된 루브릭을 생성하되, 인간 평가자가 증거를 검토하고 명확한 앵커에 따라 판단을 확인하는 것입니다. 이를 통해 규모와 일관성을 갖추면서도 행동 신호의 뉘앙스를 잃지 않을 수 있습니다.

    관련 글

    직접 채용 공고로 확인하세요

    얼리 액세스 대기자 명단에 등록하고 H-Evaluate가 실제 직무의 평가를 생성하는 과정을 확인하세요.

    직접 채용 공고로 확인하세요