📝 한줄 요약
강의·영상·문서 작업에 쓰는 AI Skill이 너무 많아 전체 구조를 알 수 없었던 비개발자가 Hermes Agent와 약 36시간 55분 동안 Skill Fleet를 조사했다. 863개 파일이 섞인 핵심 운영 Skill에서 실제 활성 지침 18개를 분리하고, 기존 자료 845개를 잃지 않은 채 반복 검증까지 마쳤다.
바쁘시면 이것만 읽어도 돼요:
거의 모든 강의·자료 작업을 시작할 때마다 어떤 Skill이 정본이고 누가 최종 책임자인지 확신하기 어려웠다.
처음에는 파일 수가 기능 수라고 생각했고, 이름이 비슷하면 중복이며, AI의
PASS는 실제 동작까지 확인했다는 뜻이라고 오해했다.전체 조사 결과 1,282개 Skill 파일 variant를 341개 실제 의미 기능으로 구분했다.
중심 운영 Skill은 863개 파일 중 실제 활성 지침·제어면이 18개였고, 나머지 845개는 누적 증거와 재사용 후보였다.
핵심과 증거를 분리한 뒤 18/18 반복 선택 테스트, 기존 경로 845/845 readback, 독립 검증을 통과했다.
결과 만족도는 3/5다. 유용한 기반은 생겼지만 실제 강의·여행·법률·요리 작업을 더 오래 돌려봐야 한다.
점검표·Shadow 검증 프롬프트·DEVLOG 템플릿을 재사용 키트로 나눠 비개발자의 AI 진입장벽을 낮추려 한다.
🎯 이런 분들께 도움돼요
AI 에이전트와 Skill이 늘어났지만 전체 구조를 파악하지 못한 비개발자
강의·영상·문서 자동화를 여러 주제에서 운영하는 실무자
여러 전문 AI 봇과 결과물 저장소를 함께 관리하는 운영자
😫 문제 상황: Skill은 많은데 전체가 보이지 않았다
문제는 반복 입력에 몇 분이 걸리느냐가 아니었다. 거의 모든 강의·자료 작업을 시작할 때마다 같은 불확실성이 되풀이됐다.
이번 작업에는 어떤 Skill을 불러야 할까?
이름이 비슷한 Skill은 같은 기능일까, 다른 책임일까?
여러 프로필에 같은 이름의 파일이 있으면 어느 쪽이 정본일까?
전사·정리·검증·배포·Library 등록 중 누가 어디까지 책임질까?
AI가
PASS라고 보고하면 실제 파일과 화면도 정말 맞을까?
이전에는 기존 문서와 에이전트의 설명을 믿고 개별 작업을 진행했다. 그 방법으로도 한 건의 작업은 끝낼 수 있었다. 하지만 세 가지 한계가 함께 남았다.
개별 설명은 있어도 전체 Skill 관계를 한눈에 보는 지도가 없었다.
문서와 설명이 현재 파일·hash·실제 동작을 반영하는지 증명하기 어려웠다.
작업마다 판단 기준이 달라 다음 프로젝트에서도 같은 혼란이 반복됐다.
2026년 8월 1일 오전 11시 26분, 결국 범위를 아주 크게 잡아 질문했다.
강의, 여행가이드 등 모든 종류의 동영상, 문서, 음성 등을 법률, 조세, IT, 여행, 요리 등의 주제에 대해 전사, 요약, 교정, Recap, 상세설명, 해설, 배포, 저장, 라이브러리화하는 데 필요한 모든 Skill은 무엇인가? 그리고 이 Skill들을 지휘하고 관리하고 조절하는 Skill까지 모두 무엇인가?
처음에는 목록을 받으면 끝날 줄 알았다. 실제로는 이 질문이 약 36시간 55분에 걸친 구조 조사와 검증의 출발점이 됐다.
한국 정부의 한국 경제 계획
그림 1. 파일 수와 실제 기능 수를 분리한 전체 Skill Fleet 지도. 1,282개 파일 variant가 341개 meaning node로 묶이고, preferred variant·Core·Bridge·Split·route 관계가 하나의 Control Plane에 연결된다.
🌱 처음에는 무엇을 몰랐나
처음의 오해는 세 가지였다.
첫째, Skill 파일 수가 곧 실제 기능 수라고 생각하기 쉬웠다. 그러나 여러 프로필과 archive에는 같은 의미의 Skill이 variant로 복제돼 있었다. 반대로 이름이 비슷해도 책임·입력·출력·실패 원인이 다른 Skill도 있었다.
둘째, AI가 PASS라고 쓰면 실제 동작까지 확인된 것으로 받아들이기 쉬웠다. 나중에 확인해 보니 보고서의 PASS와 브라우저 화면의 실제 동작은 다를 수 있었다.
셋째, Skill이 많아져도 AI가 알아서 정리해줄 것이라고 생각했다. 하지만 어떤 기능을 하나로 묶고, 어느 파일을 정본으로 선택하고, 무엇을 Production으로 승격할지는 별도의 운영 규칙과 증거가 필요했다.
제가 부족했던 것은 AI에게 일을 시키는 능력보다, AI가 한 일을 어떤 기준으로 믿어야 하는지 묻는 능력이었다.
🛠️ 사용한 도구
주요 도구: Hermes Agent
모델: GPT-5.6-sol
작업 환경: Slack 대화, macOS 로컬 파일, Python 기반 검증, 브라우저 readback, SHA-256 무결성 확인
운영 방식: 타디스가 다음 항로와 검증 방법을 주로 제안하고 실행했으며, 사용자는 이틀 동안 10회 이상 중간 결과를 확인하고 방향을 보정했다.
안전 원칙: Production 원본을 바로 고치지 않고 Shadow 후보에서 먼저 검증
🔧 작업 과정
첫 지도에서 끝나지 않았다
첫 조사에서는 강의·여행·문서 Recap에 직접 관련된 45개 의미 Skill과 122개 파일 variant가 정리됐다. 그러나 목록을 보는 순간 더 중요한 질문이 생겼다.
그러면 이 스킬들이 모두 쓸모가 있어? 중복되는 건 없어?
전체 범위를 다시 조사하자 1,282개 파일 variant와 341개 meaning node가 나타났다. 여기서 meaning node는 파일 이름이 아니라 실제로 하나의 책임을 수행하는 기능 단위다.
이때부터 파일을 세는 일과 기능을 세는 일을 분리했다.
파일을 센다
→ 같은 기능을 meaning node로 묶는다
→ 각 파일을 variant로 기록한다
→ meaning node마다 preferred 정본과 hash 증거를 붙인다
→ 공통 책임은 Core, 프로필·도메인 차이는 Bridge 또는 Split으로 설명한다
중복처럼 보인다고 바로 지우지 않았다. 실제 책임·입력·출력·실패 원인을 비교한 뒤에야 같은 기능인지 판단했다.
2주차 학습자료가 목록을 연결 구조로 바꿨다
첫 지도를 받은 뒤 DSD와 Giacomo Studio를 다룬 2주차 모각 자료를 함께 살펴봤다. 이 자료는 단순 참고자료가 아니라 질문의 수준을 바꾸는 계기가 됐다.
처음 질문은 “무엇이 있는가?”였다. 자료를 본 뒤에는 다음을 묻게 됐다.
누가 작업을 소유하는가?
어느 단계에서 전문 Skill로 넘기는가?
앞 단계의 산출물을 다음 단계가 어떻게 재사용하는가?
여러 작업이 갈라졌다가 QA와 Delivery에서 어디서 다시 합쳐지는가?
목록은 Taxonomy가 됐고, 관계는 Ontology가 됐으며, 전체 항로를 지휘하는 얇은 Umbrella가 필요하다는 것을 이해하게 됐다.
보조 실패: 보고서에는 PASS, 실제 화면에는 기능이 없었다
W2 후보를 일반·IT, 법률, 여행 세 도메인에서 Golden Shadow로 검증했다. 기존 상태 표시를 그대로 믿지 않고 실제 브라우저와 원본 coverage를 다시 확인했다.
그 과정에서 일반·IT 결과물의 sticky 목차와 모바일 레이아웃이 적용됐다고 돼 있었지만, 실제 화면 구조에는 필요한 wrapper와 CSS 조건이 없다는 사실을 발견했다. 보고서의 PASS가 실제 DOM의 동작을 보장하지 않았던 것이다.
기존 판정을 그대로 덮어쓰지 않았다. 실패 상태를 보존하고, 빠진 화면 구조와 모바일 폭 조건만 최소한으로 수리한 뒤 다시 검증했다. 보호 입력 10개의 hash가 실행 전후 모두 같다는 것도 확인했다.
이 사건을 통해 한 가지를 배웠다.
AI의
PASS는 결론이 아니라, 실제 파일·브라우저·hash에서 다시 읽어볼 가설이다.
중심 실패: 863개 파일 때문에 핵심 설명이 잘렸다
가장 큰 문제는 전체 강의 Recap을 지휘하는 Operations Skill에서 드러났다. fresh-profile에서는 적절히 선택됐지만, 내용을 읽는 단계에서 결과가 너무 커져 설명이 잘렸다.
패키지를 측정하자 전체 파일은 863개였다. 그러나 실제 활성 지침과 제어면은 18개뿐이었다.
분류
파일 수
의미
활성 지침·제어 면
18
AI가 실제로 읽고 따라야 하는 규칙과 도구
누적 evidence
835
과거 실행 결과·스크린샷·검증 영수증
W2.5 재사용 후보
10
직접 활성 지침은 아니지만 보존할 후보
합계
863
하나의 Skill 패키지 안에 섞여 있던 전체 파일
문제는 evidence가 쓸모없다는 것이 아니었다. 중요한 자료였지만, AI가 매번 읽어야 하는 활성 지침과 같은 공간에서 발견되면서 핵심 설명을 가리고 있었다.
해결은 삭제가 아니라 분리였다.
활성 지침 18개는 AI가 읽는 경로에 유지했다.
evidence 835개와 재사용 후보 10개는 먼저 hash로 보존했다.
기존 좌표를 사용하는 작업이 깨지지 않도록 상대경로 연결을 남겼다.