제가 운영하는 서비스 로나에는 참가자가 본인의 AI 활용 사례를 다른 사람과 공유하는 기능이 있어요.
회사 자동화에는 보안이 필요한 경우들이 많으니, 공유 버튼을 누르면 AI가 민감정보를 찾아 마스킹 처리를 제안해줍니다. 그런데 이 AI가 일을 제대로 하는지 저는 한 번도 확인해본 적이 없었어요.
이번에 로나(Rona) 추천 코칭으로 「내 기능에 평가 붙이기 — AI eval 한 바퀴」를 받아서, 바로 이 지점에 평가를 붙여봤습니다. 로나는 AI를 실제 업무에 직접 써보게 만들어주는 도구인데, 이번엔 '마스킹 규칙' 을 AI와 Evalutation 해보았어요. 결국 마스킹 기준 네 가지를 추가해 잘못된 마스킹 14건을 0건으로 만들었어요.
한국어 한국어 한국어 한국어 한국어 한국어 한국어 한국어
로나 코칭이 잡아준 순서부터
그동안 확인을 안 했던 이유는 "뭘 어떻게 재야 할지 몰라서"였어요. 코칭이 순서를 이렇게 잡아줬습니다.
단계
여기서 알려준 개념
①
평가할 AI 지점 하나 고르고, "좋다"를 확인 가능한 3줄로 못 박기
②
실제 판단 기록을 뽑아 직접 눈으로 읽 기
트레이스, 열린 에러 분석
③
사람끼리 기준을 맞추고, 채점기를 만들기 전에 싼 것부터 고치기
우연 보정 일치도
④
규칙으로 잴 수 있는 것만 규칙에 맡기기
코드 검사와 AI 심판의 분업
⑤
나머지를 AI 심판으로 만들고, 그 심판을 다시 검증
맞히는 비율·틀리는 방향, 참값 보정
⑥
전부 묶어 실제 입력 위에서 한 번 돌리기
골든셋, 데이터 누수
솔직히 처음 실행했을 때는 개념이 한꺼번에 쏟아져서 벅찼어요. 그런데 각 단계에 도착할 때마 다 그 개념을 다시 꺼내서 "지금 이 업무에선 이게 뭐가 되죠?" 하고 객관식으로 되물어주더라고요. 제가 고르고 나서야 다음으로 넘어갔고, 그러니까 개념이 그때 붙었습니다. 아래 내용은 이 순서를 그대로 따라가요.
1. 원래 마스킹 기준은 이 다섯 줄이 전부였어요
AI에게 준 지시문에서 "가려야 할 것"은 이렇게 다섯 가지였습니다.
#
가려야 할 것
1
회사·조직·팀 이름 (글쓴이 소속 포함)
2
사람 이름 (동료·고객·거래처 담당자)
3
고객사·거래처·파트너 이름
4
내부 시스템 주소·도메인·저장소·문서 링크
5
매출·계약금액·단가 등 대외비 수치
반대로 "가리지 말 것"은 딱 한 줄이었어요.
일반 도구명(Claude, Slack, Notion 등)·공개 서비스명은 민감정보가 아닙니다.
그리고 마지막에 이 한 줄이 붙어 있었습니다.
애매하면 가리는 쪽으로 제안하세요.
가려야 할 것은 "등"으로 열려 있고, 가리지 말 것은 한 줄뿐인데, 애매하면 가리라고 했으니 AI 입장에선 일단 가리는 게 정답이었던 거예요.
한국 마인드맵
2. "잘했다"를 합격/불합격이 갈리는 세 줄로 못 박기
"마스킹이 잘 됐다"는 말은 사람마다 다르게 읽혀요. 코칭이 ①단계에서 시킨 대로, 재기 전에 합격인지 아닌지 바로 갈리는 세 줄부터 적었습니다.
#
합격 기준
왜 필요한가
1
실제 민감정보 중 안 가려지고 남은 게 0건
놓치면 그대로 유출이니까요
2
AI가 "여기를 가리자"고 지목한 문구가 전부 본문에 실제로 있음
없는 문장을 지목하면 마스킹이 헛돕니다
3
누구나 아는 도구 이름을 가린 게 0건
필요 없는 마스킹이 쌓이면 사례글을 못 읽게 돼요
3. 실제 사례 30건을 돌려봤더니 16건 불합격
기준을 정했으니 실제로 재볼 차례였어요. 쌓여 있던 사례 중 30건을 골라 마스킹 AI를 직접 돌리고, 결과를 하나씩 눈으로 읽었습니다.
여기서 코칭이 한 번 말렸어요. 저는 "놓침·과잉·오류" 식으로 유형을 먼저 만들어놓고 분류할 생각이었는데, 미리 만든 칸에 끼워 맞추면 우리 서비스에서만 나오는 실패는 못 본다고 하더라고요. 그래서 유형 없이 읽으면서 이상한 것만 메모했고, 메모가 쌓이니 유형이 저절로 갈라졌습니다. 결과는 30건 중 16건 불합격.
가장 많았던 건 놓침이 아니라 안 가려도 될 것까지 가린 경우였어요. 구체적으로는 이런 것들입니다.
잘못 가려진 것
실제 예
금액이 아닌 숫자
"30건을 처리했다"의 30건, 파일 개수, 걸린 시간, 발송 시각
누구나 아는 서비스 이름
Claude, Slack, Notion, 구글드라이브 같은 이름
일반 업무 용어
요청서, 체크리스트, 승인, 보류 같은 흔한 단어
겹치는 지목
myorg/my-app과 my-app을 둘 다 지목해서 치환이 꼬이고 본문이 깨 짐
한국어 텍스트가 적힌 모바일 앱
여기에 더해, 같 은 사례를 5번 돌렸더니 지목 개수가 4~9건으로 매번 흔들렸어요. 한 번 돌려보고 판단하면 안 되는 이유를 여기서 확인했습니다.
4. 채점기를 만들기 전에, 마스킹 기준 네 가지를 추가했어요
코칭 ③단계에는 두 가지가 들어 있었어요.
하나는 내 3줄 기준이 정말 쓸 만한지 확인하는 것. 같은 30건을 다른 판정자에게 3줄 기준만 주고 따로 채점하게 했더니 일치율이 86.7%로 꽤 높았어요. 그런데 코칭이 우연히 맞은 몫을 빼고 다시 재보라고 했고, 그러니 0.735로 내려갔습니다.
의미 있는 건 갈린 4건이었어요. 3건은 판정자가 달라서가 아니라, 제 3줄 기준에 해당 칸이 아예 없어서 갈린 거였습니다(본문이 깨진 경우, 응답이 아예 안 나온 경우). 이게 나중에 "고장과 품질을 따로 세자"로 이어집니다.
다른 하나가 "채점기를 만들기 전에 싼 것부터 고쳐라" 였어요. 원래 제 계획은 잘못된 마스킹을 자동으로 세는 채점기를 만드는 거였는데, 코칭이 이렇게 짚었습니다.
정교한 채점기를 먼저 만들었는데 지시문 몇 줄 고쳐서 문제가 사라져버리면, 그 채점기는 아무것도 안 잡는 도구가 되잖아요.
그래서 채점기를 미루고, 30건에서 나온 실패 유형별로 기준부터 추가했어요. 이게 이번 작업의 알맹이입니다.
① 5번의 "등"을 닫고, 금액성으로 한정
내용
전
매출·계약금액·단가 등 대외비 수치
후
매출·계약금액·단가·투자금·연봉 등 금액성 대외비 수치
(작업 분량·처리 건수·파일 개수·용량·소요 시간·발송 시각·성과 카운트는 금액이 아니므로 제외)
가리지 말아야 할 숫자를 직접 나열한 게 핵심이었어요. "등"만 놔두면 AI는 계속 모든 숫자로 번집니다.
② "가리지 말 것" 목록을 한 줄에서 예시 12개로
내용
전
일반 도구명(Claude, Slack, Notion 등)·공개 서비스명은 민감정보가 아닙니다
후
공개 서비스·도구·플랫폼 이름은 민감정보가 아닙니다. 예: Claude, Slack, Notion, 구글드라이브, 네이버, 카카오, Vercel, GitHub, Gemini, Figma, 컨플루언스, 네이버플레이스. 처음 보는 이름이라도 검색하면 나올 법한 상용 서비스면 제외하세요. 단 파일명·저장소명·내부 문서명은 가려도 됩니다
예시를 협업 도구 쪽으로만 몰아놨더니, AI가 그 밖의 서비스는 판단을 못 하고 그냥 가려버리고 있었어요. 종류를 흩어서 12개를 깔고, 모르는 이름을 만났을 때의 판단 방법("검색하면 나올 법한가")까지 적어줬습니다. 반대로 파일명·저장소명은 가리는 게 맞아서 예외로 명시해뒀고요.
③ 일반 업무 용어 제외 규칙을 새로 만듦
내용
전
(없음)
후
일반 업무 용어(요청서, 통합 DB, 체크리스트, 승인, 보류, 추출 등)는 그 조직 고유의 고유명사가 아니면 제안하지 마세요
아예 규칙 자체가 없던 자리예요. 없으면 AI는 판단하지 않고 가립니다.
④ 겹치는 지목 금지 + "애매하면 가려라"에 울타리
내용
전
애매하면 가리는 쪽으로 제안하세요
후
위 1~5번 중 하나에 해당하는지가 애매하면 가리는 쪽으로. 1~5번 어디에도 해당하지 않으면 제안하지 마세요
한 지목이 다른 지목을 포함하는 관계면 긴 쪽 하나만 내세요. 같은 문구를 두 번 내지 마세요 (치환 결과가 순서에 따라 달라집니다)
"애매하면 가려라"를 지운 게 아니라, "1~5번 안에서만 애매할 것" 이라고 범위를 씌운 거예요. 이 한 줄이 없으면 위의 ①②③을 아무리 적어도 마지막에 다시 열려버립니다.
같은 30건을 그대로 다시 돌린 결과
지시문 고치고 같은 30건 다시 돌려줘
지표
기준 추가 전
기준 추가 후
지목 총 개수
66
28
금액이 아닌 숫자를 가림
14
0
누구나 아는 서비스 이름을 가림
12
2
겹치는 지목
9
3
채점기를 한 줄도 안 만들고, 기준 네 가지를 적는 것만으로 잘못된 마스킹이 거의 사라졌어요.
5. AI에게 채점을 맡기기 전에, 채점하는 AI부터 검증했어요
그래도 채점기는 필요했어요. 매번 사람이 30건씩 읽을 순 없으니까요. 코칭 ④단계가 알려준 나누는 기준은 하나였습니다 — 규칙으로 적을 수 있으면 규칙에, 판단이 필요하면 AI에게. 자주 나오냐가 아니라 딱 판정이 되냐로 가릅니다.
"지목한 구간이 서로 겹치나?" → 규칙으로 끝나요
"이 숫자가 대외비인가?" → 규칙으로 못 적어요. AI가 봐야 합니다
판단이 필요한 쪽에 채점하는 AI(AI 심판) 를 붙였는데, 여기서 하마터면 속을 뻔했어요.
연습 문제로 재봤더니 정확도가 96%였습니다. 그런데 연습 문제 28개 중 27개가 정답이 "잘못된 마스킹"이었어요. 그러니까 아무것도 안 보고 무조건 "잘못됐다"고 찍는 심판도 똑같이 96%가 나옵니다.
이때 코칭이 넘어가지 않고 물었어요. "이 심판을 검증할 때 뭘 봐야 할까요?" 보기 중에 "정확도 하나만 보면 된다"도 있었는데, 저는 맞히는 비율과 틀리는 방향을 따로 보고 결과를 보정하는 쪽을 골랐습니다. 그래서 정답 비율을 반반 가깝게 맞춘 시험지를 따로 만들어 두 방향을 나눠 쟀어요.
재본 것
결과
잘못된 마스킹을 잘못됐다고 맞히는 비율
100%
정당한 마스킹을 건드리지 않는 비율
71.4%
전체 정확도
92.9% (무조건 찍기는 75%)
틀리는 방향이 문제였어요. 이 심판은 정당하게 가린 것의 약 29%를 "잘못됐다"고 부릅니다. 이 말을 그대로 믿고 마스킹을 더 느슨하게 조정했다면 유출이 늘어나는 쪽으로 갔을 거예요.
그래서 심판이 말한 숫자를 그대로 쓰지 않고, 틀리는 비율만큼 걷어내서 보정했습니다.
심판이 말한 잘못된 마스킹 비율 40.7%
보정한 실제 비율 17.0%
보정 없이 "아직 41%나 잘못됐네, 더 조여야겠다"고 했으면 멀쩡한 마스킹까지 풀어버렸을 겁니다.
6. 다음에 또 기준을 손볼 때를 위해, 재는 방법을 저장해뒀어요
코칭의 마지막 단계는 "만든 걸 전부 묶어서 실제 입력 위에 한 번 돌려보기"였어요. 지금까지 한 일 — 30건 돌리기 → 규칙으로 채점 → AI 심판으로 채점 → 보정 — 을 순서대로 이어붙여 저장했습니다. 다음에 기준을 또 손볼 땐 이걸 한 번 실행하면 같은 방식으로 점수가 나와요.
비즈니스 프로세스의 단계를 보여주는 다이어그램
저장하면서 세 가지를 손봤어요.
첫째, 시험지를 30개 사례 이름으로 못 박았습니다. 처음엔 "최신 30건"이라고 잡아뒀는데, 작업하는 사이 사례가 248건에서 249건으로 늘면서 시험지가 한 칸 밀렸어요. 기준을 고치기 전과 후를 비교하는 건데 정작 시험지가 서로 달랐던 거죠. 점수를 비교하려면 시험지가 매번 똑같아야 합니다. 코칭에서 골든셋이라고 부르는 게 이렇게 고정한 시험지예요.
둘째, "고장"과 "품질"을 따로 세게 했어요. 마스킹 AI가 아예 응답을 못 하고 죽으면 지목이 0건이 되는데, 0건은 자동으로 "잘못된 마스킹 0건"으로 집계됩니다. 고장이 개선처럼 보이는 거예요. 그래서 응답이 없거나 본문이 깨진 건은 점수에서 빼고 "판정 불가"로 따로 세게 만들었어요.
셋째, 시험 문제가 답안지에 섞였는지 자동으로 잡게 했습니다. 채점하는 AI에게 "이런 게 잘못된 마스킹이에요" 하고 보여준 예시 몇 개가, 알고 보니 시험지에 들어 있는 30건에서 뽑은 거였어요. 시험지를 미리 보여주고 시험을 치른 셈이죠. 코칭에서 데이터 누수라고 부르는 건데, 실제로 6건이 걸렸습니다. 예시를 시험지 밖 사례로 바꾸니 0건이 됐고, 심판 성적은 그대로였어요.
그러고 나서 드러난 숫자가 제일 뼈아팠습니다.
마스킹을 잘했는지 판정할 수 있었던 건 → 30건 중 19건
세 건 중 한 건은 잘했는지 못했는지 판정조차 못 하는 상태였어요. 결과가 안 나왔거나 본문이 이미 깨져서요. 기준을 아무리 다듬어도 이 30%는 안 움직입니다. 다음에 손볼 곳이 이 숫자 하나로 정해졌어요.
결과
항목
평가 붙이기 전
평가 붙인 후
마스킹 품질 확인 방법
없음 (확인한 적 없음)
저장해둔 순서대로 다시 실행
가려야 할 것
5줄 (5번은 "등"으로 열림)
5줄 (5번을 금액성으로 한정)
가리지 말 것
1줄 (도구명 예시 3개)
3줄 (서비스 예시 12개 + 일반 업무 용어 + 판단 방법)
겹치는 지목 규칙
없음
있음 (긴 쪽 하나만)
잘못된 마스킹
금액 아닌 숫자 14건 · 서비스 이름 12건
0건 · 2건
알게 된 것
—
3건 중 1건은 판정조차 불가 (다음 과제)
돌아보면 제일 크게 달라진 건 숫자가 아니라 순서였어요. 혼자였으면 지시문 고치기(③)만 하고 끝냈을 텐데, 그러면 좋아졌는지 알 방법이 없거든요. 재는 방법을 먼저 세우고(①②) → 고치고(③) → 그 재는 방법이 믿을 만한지까지 확인(④⑤⑥) 하는 순서를 각 단계에서 붙잡아준 게 로나 코칭에서 실제로 얻은 것이었습니다.