r=.62 대 r=.50.
전문가들이 합의한 평가와 얼마나 비슷하게 평가했는지를 보여주는 상관계수입니다. 앞이 AI, 뒤가 여러 사람의 평가를 합친 값입니다. 사람의 성과는 사람이 가장 잘 안다는 믿음에 제동을 거는 결과입니다. 연말 평가를 앞둔 리더에게 반갑기도, 조금 불편하기도 한 숫자겠지요(평가표 앞에서 오래 고민한 시간은 무엇이었나 싶고요). ^^;
닝 리(Ning Li), 화이캉 저우(Huaikang Zhou), 밍저 쉬(Mingze Xu)가 2026년 3월 16일 『Personnel Psychology』에 발표한 From Text to Insight: Leveraging Large Language Models for Performance Evaluation in Management 의 연구입니다. 두 연구에서 지식업무 산출물 744개를 분석했습니다. 다만 여기서 곧바로 리더보다 AI가 직원을 잘 평가한다고 결론 내리면, 숫자보다 해석이 앞서갑니다. 무엇을 평가했는지부터 짚어야 합니다. 저는 이 연구가 관리자에게 평가권을 내려놓으라고 말한다기보다, 그 권한을 어떻게 써왔는지 돌아보게 한다고 봅니다. 점수를 고르는 데 힘을 쏟았는지, 구성원이 다음에는 더 잘하도록 받쳐줬는지 말입니다.
연구진은 텍스트로 된 과업 산출물을 대상으로 GPT-4, GPT-5, o3, Claude Sonnet 4, DeepSeek v3 등 여러 모델과 인간 평가자의 평가를 비교했습니다. 양쪽 모두 외부 전문가 합의를 기준으로 삼았고, 고도화된 AI 모델은 그 기준과 최대 r=.62의 상관을 보였습니다. 비교 대상인 인간 평가를 합친 값은 r=.50이었습니다. 연구진은 AI를 인간 평가의 신뢰할 만한 보완 수단으로 해석합니다. 여기 적은 수치는 저널의 공개 초록에서 확인한 범위입니다.
상관계수는 두 평가가 함께 높아지고 낮아지는 경향을 나타냅니다. 정답을 맞힌 비율이 아닙니다. .62에서 .50을 빼고 정확도가 12%포인트 높다고 적어서는 곤란하죠.
아울러 최대라는 말도 놓치지 마십시오. 모든 모델의 평균이 .62였다는 뜻은 아닙니다. 연구에 포함된 모델이 9월 말 현재의 최신 모델 전체를 대표한다고 봐서도 안 되고요. 기준 역시 전문가 합의이지, 직원의 실제 기여를 빠짐없이 포착한 절대적인 정답은 아닙니다. 전문가들끼리 공유하는 관점이 평가 기준에 반영될 여지도 있습니다.
이 대목에서 저는 오히려 비교 대상에 눈길이 갑니다. 특정 관리자 한 명의 감과 겨룬 결과가 아니거든요. 여러 사람이 낸 평가를 모은 값과 비교해도 이런 가능성이 관찰됐다는 점은 가볍게 넘기기 어렵습니다. 그렇다고 우리 회사 평가표에 곧장 옮겨 쓸 근거까지 갖춘 것은 아닙니다. 한국어 보고서, 우리 직무, 우리 기준에서도 비슷한 결과가 나오는지는 따로 살펴야 합니다.
산출물을 읽는 일과 사람의 기여를 판단하는 일
문서 평가를 직원의 종합 성과평가로 넓힐 때 빈틈이 생깁니다. 문서에는 논리와 근거만 남습니다. 누가 동료의 막힌 일을 풀어줬는지, 고객의 무리한 요청을 조율했는지, 부족한 자원으로 어디까지 버텼는지는 빠져 있을 수 있습니다. 자료를 많이 넣으면 해결될까요? 일부는 보완되겠지만, 기록 자체가 없는 기여까지 저절로 생겨나지는 않습니다.
(예·가상) 기획팀의 A 팀장이 두 구성원의 사업 제현안서를 평가한다고 해보겠습니다. B 구성원은 근거 자료와 수익 전망을 갖춰 제출했습니다. C 구성원의 제안는 대안 비교가 덜 돼 있고 설명도 거칩니다. 공통 기준으로 문서 완성도를 검토하면 B에게서 높은 점수를 줄 만합니다. 그런데 C는 같은 기간 팀의 긴급 고객 대응을 맡았고, 그 업무는 팀장이 요청했습니다. 이때 제안서의 부족한 부분은 그대로 짚되, 분기 기여도를 매길 때는 긴급 대응의 성과와 업무 배분을 함께 살펴야겠지요. 문서 품질과 분기 기여도는 평가 대상부터 다릅니다.
개인적으로는 여기서 관리자의 재량이 가장 걸립니다. 사정을 안다는 이유로 문서의 결함을 덮어도 곤란하고, 문서 점수만 내밀며 본인이 맡긴 추가 업무를 모른 척해도 곤란합니다. B에게는 맡은 과제를 충실히 수행한 기여를 인정하고, C에게는 별도 업무의 결과를 확인해야 합니다. 맥락 해석에도 근거가 따라야 합니다(사정을 봐준다는 말로 끝나면 또 다른 편애가 되니까요).
업무 기록을 남기는 습관도 같이 돌아볼 만합니다. 위 가상 팀에서 B의 제안서는 폴더에 고스란히 남아 있는데, C의 고객 대응은 전화 몇 통과 짧은 메신저 대화로 끝났다면 어떨까요. 평가철에는 정리된 파일을 꺼내기 쉽습니다. 도움받은 동료가 기억을 보태주지 않으면 수습한 일은 흔적조차 흐릿하죠. 그렇다고 매번 자신이 한 일을 장문의 보고서로 쓰게 하면, 팀장은 읽을 숙제를 늘리고 구성원은 증빙 업무를 떠안습니다. 저는 주요 과제가 끝났을 때 결과와 본인 기여, 협업한 동료를 짧게 남기는 정도부터 권하고 싶습니다. 기록의 양보다 빠진 기여를 줄이는 쪽으로요.
이 사례에서 AI 평가와 관리자의 평가가 다르다면 어느 쪽을 고를지 서두를 이유가 없습니다. 서로 어떤 자료를 봤는지부터 대조하면 됩니다. AI가 놓친 긴급 대응도 있고, 관리자가 친숙한 구성원의 문서 결함을 지나쳤을 가능성도 있으니까요. 차이가 나는 항목은 다시 살펴볼 지점입니다. 누가 맞았는지 판정하기 전에, 빠뜨린 근거를 찾는 데 쓸모가 있습니다.
다음 평가에서 바꿔볼 네 가지
여기서부터는 연구가 직접 검증한 절차가 아니라, 현장 적용을 위한 제 제안입니다. 전사 평가부터 갈아엎기보다 팀에서 반복되는 산출물 하나를 골라보시기 바랍니다. 비슷한 목적의 제안서나 분석 보고서처럼 비교 기준을 설명할 수 있는 대상이면 출발하기 수월합니다. 첫 시도는 보상·승진과 연결하지 않고 기존 평가와 병행하는 편을 권합니다.
AI를 열기 전에 평가 기준부터 적으세요. 예컨대 분석 보고서라면 근거의 적절성, 대안 비교, 실행 가능성을 어떤 모습에서 확인할지 정합니다. 구성원에게도 그 기준을 알리고, 완성도가 다른 예시 문서에 적용해 보십시오. 관리자들끼리 기준 해석이 갈린다면 먼저 그 차이를 풀어야 합니다. AI에게 알아서 잘 평가하라고 맡기면, 우리도 설명 못 하는 기준이 점수로 돌아올 수 있습니다.
같은 자료를 보고 각자 먼저 평가하세요. 회사가 승인한 환경에서 필요한 자료만 사용하고, 구성원에게 AI가 맡을 역할과 검토 범위를 알립니다. 관리자는 AI 점수를 보기 전에 자기 판단과 근거를 남기십시오. AI에는 항목별 판단과 함께 해당 문서의 근거 위치, 자료 부족으로 판단하기 어려운 부분을 제시하게 합니다. 그래야 서로 다른 판단을 대조할 수 있습니다(먼저 본 점수에 슬그머니 맞추고 싶어질 수도 있으니요).
점수를 낸 다음에 남는 일
쓰다 보니 AI가 평가를 잘할수록 팀장이 덜 바빠질 것이라는 기대에도 조건이 붙습니다. 절약한 시간을 다시 보고서에 채우면 구성원이 체감할 변화는 작겠지요. 업무의 우선순위를 조정하고, 막힌 협업을 풀고, 새 과제를 맡길 기회를 마련하는 데 써야 성과코칭으로 이어집니다. AI가 정리해준 평가서를 팀장이 읽어주는 장면만으로는 부족합니다(대독할 문서 한 장이 늘어난 셈이니까요).
AI가 사람보다 일부 산출물을 더 잘 평가할 가능성은 진지하게 검토할 만합니다. 리더 여러분은 그 평가를 받은 구성원이 내일부터 무엇을 달리할 수 있을지, 거기에 어떤 지원을 얹을지까지 맡아주시길 권해 드립니다. ^^
|