느낌이 아니라 데이터로 — 백엔드 엔지니어가 장애 때 하던 그대로, 자기 로그부터 깠다.
코드를 거의 안 치게 된 백엔드 엔지니어가 "나 지금 뭘 하고 있는 거지?"라는 질문에 느낌 말고 데이터로 답해본 기록입니다. 깠더니 다 나왔습니다. 내 직무가 어디로 갔는지, 어떤 평가자가 됐는지, 어디서 새는지까지.
1. 코드를 안 치게 됐는데, 나는 뭘 하는 사람이지?
저는 전형적인 백엔드 엔지니어였습니다. API를 설계하고, 쿼리를 튜닝하고, 장애가 나면 로그부터 뒤지는. 그런데 지금은 제 손으로 코드를 치는 시간이 거의 0에 수렴합니다. 하루 종일 AI에게 일을 시키고, 결과를 보고, 다음 지시를 내립니다.
그러던 중 How to Be a 30x AI Engineer with a Taste라는 글을 읽었습니다. 요지는 셋입니다. 코드 생성은 commodity가 됐다. 남는 일은 평가다. 그 평가 능력 — 글의 표현으로는 taste, "내부 평가 함수의 품질" — 이 몸값을 가른다. 그리고 불편한 문장 하나. "taste가 더 좋은 사람보다 두 배 열심히 일해도 절반의 가치밖에 못 만든다."
진짜 불편했던 건 그다음 질문입니다. 코드를 안 치게 된 건 분명한데, 그 시간에 나는 정말 "평가"를 하고 있나? 아니면 AI 옆에서 바빠 보이기만 한 건가? 느낌으로는 답할 수 없었습니다. 잘 쓰고 있다는 감각은 있는데 증거가 없어요. 그래서 백엔드 엔지니어가 장애 앞에서 하던 그대로 했습니다. 로그부터 깠습니다.
2. 그래서 로그를 깠다
깐 로그는 세 종류입니다.
전수 분석의 굵은 숫자들:
사용자 프롬프트 6,862개, 어시스턴트 턴 162,587개
도구 호출의 60%가 Bash (58,218회) — AI가 말만 하는 게 아니라 실제로 실행
서브에이전트 위임 1,296회
하루 최대 22,441턴 (5/14, 풀타임 페어링)
하루 2만 턴쯤 되면 "가끔 쓰는 도구"라고 부르기는 어렵습니다. 상시 가동되는 생산 라인이죠. 이제 이 생산 라인에서 제가 뭘 하고 있었는지 보겠습니다.
3. 발견 ① — 내 일은 이미 "평가"였다
최근 한 달의 프롬프트 3,918개를 작업 유형으로 분류해봤습니다(다중 라벨).
검증(952건)이 구현(1,024건)에 맞먹습니다. 대부분의 개발자는 AI가 짠 코드를 "테스트 통과했네, 머지" 하고 넘어갑니다. 제 로그에선 구현 요청 하나당 거의 하나꼴로 리뷰·검증 요청이 따라붙었어요. "평가가 곧 직무"라는 30x 글의 문장은, 제가 의식한 적도 없는 작업 분포에 먼저 와 있었습니다.
"AI 운영"이라는 새 직무가 작업의 23%를 차지합니다. 스킬 파이프라인 설계, 자율 루프, 봇 운영 — AI로 일하는 단계를 지나 AI 시스템 자체를 만들고 굴리는 일입니다. 백엔드 엔지니어가 인프라를 운영하듯, 지금은 에이전트를 운영합니다.
일이 사라진 게 아니라 층위가 올라간 겁니다. 코드를 만들던 사람에서, 코드를 만드는 시스템을 평가하고 운영하는 사람으로.
코드를 만드는 사람에서, 코드를 만드는 시스템을 평가·운영하는 사람으로 — 일은 사라지지 않고 층위가 올라간다.
재밌는 디테일 하나. 제 입력의 중앙값은 39자인데, 800자가 넘는 입력도 1,989건입니다. 결정은 "ㄱㄱ", "A로 진행" 같은 초단문으로, 새 작업 위임은 사양서급 장문으로. 이 양극화가 곧 평가자의 입력 패턴입니다. 짧은 입력은 평가고, 긴 입력은 명세입니다.
어떤 평가자인지도 측정됩니다. 30x 글이 말하는 taste의 다섯 영역에 제 데이터를 얹고 자가 채점을 해봤습니다.
/insights가 서술해준 제 인터랙션 스타일은 이랬습니다.
"폭넓은 실행을 위임하되, Claude가 검증된 증거 대신 가정으로 추론하는 순간마다 단호하게 방향을 돌리는 실시간 팩트체커로 행동한다."
30x 글에 "PR보다 그 코드를 만든 프롬프트를 보고 싶다"는 말이 나오는데, 제 위임 프롬프트가 이미 그 역할을 하고 있었습니다. 코드 리뷰가 프롬프트 리뷰로 옮겨간 거죠.
뼈아픈 쪽도 있습니다. 저는 ③품질 판단에 몰빵된 엔지니어입니다. 가장 레버리지가 크다는 ①문제 선택은 데이터에 거의 안 보여요. 티켓을 잘 처리하는 능력과 어떤 티켓이 존재해야 하는지 정하는 능력은 다른 근육인데, 후자는 로그에 안 찍히는 게 아니라 정말 안 하고 있었던 겁니다. 까보기 전엔 몰랐던 빈칸입니다.