칼날 LLM Wiki ③ — 끝난 줄 알았지? 지금은 대본 피드백을 낸다
소개 — 망한 줄 알았는데, 아니었다
지난 사례글(②편)을 나는 절망으로 끝맺었다. "비용이 너무 많이 들어서 잠시 멈춘다." 거기에 더 아픈 고백도 붙였다 — "내가 만든 분석 기준(렌즈)이 어쩌다 글쓰기 쪽으로 휘어버렸다. 어디서 잘못됐는지도 모르겠고, 좀 슬프다." 그 글만 보면 칼날 위키는 거기서 끝난 줄 아셨을 거다. 사실 나도 그런 줄 알았다.
그런데 며칠 더 들여다보니 — 다행히 멀쩡하게 잘 돌아가고 있었다.
알고 보니 이랬다. 함께 일하는 AI가 작업하다가 컴퓨터 한구석에 다른 폴더를 따로 만들어 거기서 칼을 갈고 있었고, 정작 내가 쓰던 진짜 분석 도구와는 따로 놀고 있었다. 흩어진 파일을 정리하다 그 둘을 합쳤더니 — 원래 분석 기준이 그대로 살아 있었다. 휜 건 '글쓰기 연습용' 한 자루뿐이었다. 게다가 합치고 나니 어쩌다 칼이 두 자루가 돼 있었다. 대본을 평가하는 칼과, 대본을 쓰는 칼. (망한 줄 알았는데 오히려 한 자루 더 생긴 셈이다.)
그래서 다시 이어서 하기로 했다. 본론에 들어가기 전에, 내가 새 대본을 받으면 무엇을 하는지 부터 알아야 아래가 쉽게 읽힌다.
대본 한 편이 들어오면 나는 두 가지 일을 한다.
• 일 ① — 그 대본을 평가한다. 읽고 피드백 보고서를 만든다. 만들어둔 도구(칼날 위키)를 써먹는 일이다. (→ 3장)
• 일 ② — 도구 자체를 더 날카롭게 다듬는다. 그 대본을 재료로 칼을 더 잘 들게 간다. 도구를 키우는 일이다. 여기가 다시 둘로 나뉜다. (→ 1·2장)
• 방법 1 (빠른 점검) — 싸고 넓게. 모든 대본을 한 번씩 훑으며 ⓐ지금 기준으로 평가하고 ⓑ새 작법을 줍고 ⓒ"이건 깊이 팔 가치가 있다" 싶은 대본을 골라낸다. 큰 그림을 그리는 동시에, 방법 2로 보낼 후보를 사냥하는 단계다.
• 방법 2 (거꾸로 써보기) — 비싸고 깊게. 방법 1이 골라준 '잘 쓴 대본'을 AI에게 거꾸로 다시 써보게 시키며 깊이 파고든다.
나를 멈추게 한 비용 문제의 답이 바로 이 둘로 나누기였다. 비싼 걸 아예 버리는 게 아니라, 싼 방법으로 넓게 깔고 비싼 방법은 정말 좋은 대본에만 쓰는 것. 그래서 이번 글은 — 일 ②(도구 다듬기)로 도구를 키우고, 일 ①(피드백 보고서)을 자동으로 만들게 만든 한 주의 기록이다.
1. 도구 다듬기 — 두 방법으로 나눴다 (빠른 점검 + 거꾸로 써보기)
나는 월 100달러짜리 AI 요금제(클로드 MAX)를 쓴다. 그런데 칼날 위키를 만드는 동안 AI 사용료(흔히 '토큰'이라 부른다)가 감당이 안 될 만큼 들었다.
범인을 찾아보니, 고쳐 쓰는 횟수가 아니라 '거꾸로 새로 써보기' 그 자체가 비쌌다. AI에게 3만 자짜리 대본을 통째로 새로 쓰게 하고, 그걸 또 통째로 읽혀 채점하는 일이 돈을 잡아먹은 거다. 그래서 하던 일을 두 방법으로 나눠서, 다루는 범위는 넓히되 비용은 잡기로 했다.
방법 1 — 넓게 한 번 훑기 (빠른 점검).
방법 1은 '새로 써보기'를 아예 건너뛴다. 대신 대본을 읽고 세 가지를 한다 — ①지금 기준으로 평가하고(이 결과가 곧 그 대본의 분 석이 된다), ②"내 기준에 아직 없는 좋은 작법"을 새로 줍고, ③"이건 방법 2로 깊이 파볼 만하다" 싶은 대본을 골라 표시해 둔다. 그러니까 방법 1은 그냥 작법만 찾는 게 아니라, 평가도 하고, 새 기준 후보도 모으고, 방법 2로 보낼 대상까지 사냥하는 단계다. 새로 쓰는 게 없으니 비용은 그냥 한 번 읽는 수준으로 싸다.
게다가 운이 좋았다. 마침 Nemotron이라는 AI 모델이 2주간 공짜로 풀렸다(여러 AI를 바꿔 끼우며 쓰는 Hermes라는 프로그램으로 연결해 썼다). 이 공짜 모델을 점검 전담으로 붙여서, 그동안 못 보고 쌓아둔 대본 20여 편(180회가 넘는 분량)을 비용 걱정 없이 한 번에 훑는 중이다. 복수극·정치물·멜로·로맨틱코미디·의학·법정·SF까지 장르가 쫙 깔려서, "여러 작가, 여러 장르에 공통으로 나타나는 게 진짜 기본기"라는 칼날 위키의 생각을 검증하기에 딱 맞는 자료가 쌓였다.
⚠️ 다만 방법 1이 만능은 아니다. 빠른 점검은 이름이 딱 붙는 눈에 띄는 작법은 잘 줍지만, "기법은 화려한데 이야기가 산으로 간다" 같은 깊은 결함은 못 잡는다. 그래서 방법 2가 필요하다.
방법 2 — 잘 쓴 대본만 깊게 (거꾸로 써보기).
큰 그림을 그려두고 나면, 거기서 정말 잘 쓴 대본만 골라 비싼 '거꾸로 써보기'로 깊이 판다. 방법 1에서 "여긴 더 봐야겠다"고 표시된 곳부터 차례로. 비싼 칼은 아껴 뒀다가 진짜 깊은 결함을 잡을 때만 쓰는 거다.
정리하면 — 멈출 일이 아니었다. 싼 방법으로 넓게 깔고, 비싼 방법은 좋은 대본에만 얹으면 됐다.
2. 도 구 다듬기, 또 한 가지 — 논문으로 분석의 '틀'을 넓혔다
대본만 들여다봐서는 안 보이는 빈틈이 생긴다. 그래서 이번 주엔 그동안 공부해 온 '이야기 이론' 논문에, AI가 추가로 찾아준 것까지 더해 27편을 꼼꼼히 읽고, "여기서 새 분석 기준이 나올까"를 따져봤다. (논문을 찾는 일조차 AI에게 시켰다 — "이 주제, 세상 누군가는 분명 정리해놨을 거야. 다 찾아줘"가 내 단골 부탁이다.)
이게 의외로 컸다. 그동안 칼날 위키의 분석 기준은 작품을 직접 뜯어보며 찾아낸 것뿐이라, 이론적 뒷받침이 하나도 없었다. 그런데 논문은 대본을 아무리 들여다봐도 안 보이던 것을 이론으로 짚어줬다. 대표적으로 인물이 어떻게 변해 가는가(성장·몰락 같은 변화)를 몇 가지 유형으로 나누는 관점이었다. 우리 도구는 장면 하나하나는 잘 보는데, 인물이 전체적으로 어떻게 변하는지를 보는 눈이 약했다 — 딱 그 빈자리였다. 결국 이걸 포함해 분석 기준이 46개에서 48개로 늘었다. 대본만 봐선 안 나오던 걸 이론이 메워준 거다.
⚠️ 그래도 이론이 정답은 아니다. 논문에선 그럴듯한데 진짜 대본에선 안 맞는 경우도 많다. 그래서 원칙은 하나다: 이론은 "여길 봐라"라는 힌트만 주고, 실제 대본에서 진짜로 들어맞을 때만 정식 기준으로 채택한다. 이론은 지도를 넓혀주지, 그 자리에 보물이 있다고 보장해주진 않는다.
3. 도구 써먹기 — 손잡이를 달았다 (피드백 양식, 이번 주의 핵심)
여기서부터는 일 ①, 즉 도구를 써먹는 쪽이다. 칼이 잘 든다는 걸 확인했으니, 다음은 그 분석 결과를 내가 보기 편 한 형태로 뽑아내는 일이었다. 칼이 아무리 잘 들어도 쥘 손잡이가 없으면 못 쓰니까.
여기서 ②편에서 쓴 방법을 또 썼다 — 본보기 몇 개로 방식을 가르치는 것. 내가 평소 대본에 어떻게 피드백을 다는지, 직접 두 작품에 피드백을 써서 AI에게 보여줬다. AI는 그 두 개를 보고 "이 사람은 줄거리 → 총평 → 장점 → 단점 → 장면별 순서로, 이런 말투와 깊이로 짚는구나"를 익혔고, 그걸 앞으로 따라 쓸 양식으로 굳혔다. 내 피드백 방식 자체를 도구에 심은 셈이다. (분석 기준도 이렇게 본보기로 가르쳐 만들었고, 이번엔 '결과를 적는 형식'을 같은 방식으로 가르쳤다 — 칼날 위키를 키우는 방법은 늘 이 "본보기 몇 개로 방식을 가르치기"였다.)
그리고 가장 중요한 시험을 했다. 내가 한 글자도 안 거들고, 도구 혼자서 처음 보는 대본(12부작 코미디 1화)에 피드백을 내게 했다. 내가 옆에서 거들면 "내 실력"이지 "도구 실력"이 아니니까, 일부러 손을 뗐다.
프로가 잘 쓴 완성도 높은 코미디였는데도, 도구가 빈말 칭찬만 늘어놓지 않고 진짜 약점 셋을 짚었다.
1. 결정적 장면이 우연에 기댄다 — 1화의 가장 큰 사건(주인공 체포)이 주인공의 선택이 아니라 우연이 세 번 겹쳐서 일어난다.
2. 주인공들의 '관계'가 비어 있다 — 인물은 각자 매력 있는데, 정작 주인공과 어떤 사이였는지가 안 나온다(12부작 멜로의 핵심 동력인데).
3. 큰 사건을 일으키는 계기가 가볍다 — 인물 다섯을 한자리에 모으는 장치가 너무 후딱 처리된다.
게다가 "1화라서 아직 판단할 수 없는 항목"(나중에 쌓일 조연이나 회차 간 연결 같은 것)은 알아서 판단 보류로 비워뒀다. 억지로 점수를 매기지 않고 "지금은 알 수 없다"를 구분한 거다.
이게 이번 주의 도달점이다. ②편에서 "분석 도구를 만들겠다"던 게, 이제 실제 대본을 받아 피드백 보고서를 척척 내놓는 도구로 돌아가기 시작했다.
4. 지금 성적표 — 많이 좋아졌다, 다만 아직
"다 됐다"는 아니다. ②편의 솔직함을 이어가자.
도구가 내놓은 피드백을, 같은 대본을 두고 제작진이 실제로 나눈 회의록과 한 줄씩 맞춰봤다. 항목을 잘게 쪼개 세면 절반쯤 맞혔지만, 큰 틀 — 회의에서 짚은 방향 — 으로 보면 도구가 약 70%를 잡아냈다. 처음 보는 대본을 사람 도움 없이 혼자 읽고 그만큼 짚었다는 건, 한 주 전 "멈춤"과 비교하면 큰 진전이다.
못 잡은 30%가 흥미롭다. 들여다보니 도구가 틀려서가 아니라 사람마다 생각이 갈리는 부분에 가까웠다. 대본 평가는 완전히 객관적이지 않다 — 같은 장면도 보는 사람의 취향·경험에 따라 판단이 달라진다. 도구가 못 본 그 30%는 "정답을 놓친 것"이라기보다 "사람마다 다르게 보는 자리"였고, 이런 건 사례가 쌓일수록 도구가 사람들의 판단 경향을 익혀 좁혀질 것이라 본다. (다만 이 30% 중 어디까지가 도구의 진짜 실수이고 어디부터가 원래 갈리는 영역인지 가르는 것은 다음 숙제다.)