기업 AX 실험으로, 대표 업무 하나를 골라 닫힌 루프를 설계했다

한줄 요약: AI 교육에서 업무 개선으로

1주차에 AI 교육을 실제 업무 하나의 개선으로 바꾸기로 했다. 2주차에는 그 가설을 기업 업무에 대입했다.

A사의 지속가능경영팀이 매달 반복할 수 있는 일을 하나 골랐다. ESG 활동 원천자료를 사내 콘텐츠 한 편으로 바꾸는 일이다. 이 업무를 AX(AI Transformation, AI 전환) 구축 실험의 단위로 삼고, Run(실행) → Trace(기록) → Judge(평가) → Edit(수정) → Gate(검수 관문)가 다음 루프에서 더 나아지도록 설계했다.

바쁘시면 이것만 읽어도 돼요:

  • 1주차의 “교육보다 실제 업무”라는 결론을 2주차의 기업 AX 실험으로 옮겼다.

  • 대표 업무를 하나로 좁혔다: ESG 활동 원천자료 → 사내 콘텐츠 1건.

  • 루프를 한 번 돌리고 끝내지 않고, Judge(평가)의 실패 기록을 AI의 다음 수정에 반영하도록 했다.

  • 루프 전 체크리스트를 고정하고, 기준에 도달할 때까지 Run(실행) → Trace(기록) → Judge(평가) → Edit(수정) → Gate(검수 관문)를 반복하는 닫힌 루프를 설계했다.

  • 이번 주의 결과는 기업 성과가 아니라, 실제 업무에 대입할 수 있는 AX 구축 실험의 설계다.

도움이 될 대상: AI 전환과 업무 개선을 원하는 팀

  • AI 교육을 실제 업무 변화로 이어가고 싶은 팀

  • 기업 AX(AI 전환)를 거대한 플랫폼이 아니라 작은 업무로 시작하고 싶은 사람

  • ESG·홍보·사내 커뮤니케이션처럼 원천자료를 콘텐츠로 바꾸는 팀

  • AI 결과가 다음 실행에서 어떻게 나아지는지 확인하고 싶은 담당자

문제 상황: AI 교육의 한계

1주차에는 개인 AI 비서와 콘텐츠를 만들었다. 그러다 회사 안의 한 팀이 AI 교육을 요청하면서 질문이 달라졌다.

도구를 알려주면 업무가 바뀔까.

교육 시간에는 잘 따라 한다. 며칠 뒤에는 다시 예전 방식으로 돌아갈 수 있다. 교육과 업무 사이에는 설명만으로 건너기 어려운 빈칸이 있었다.

1주차의 결론은 이 문장으로 남았다.

AI 교육 요청을 실제 업무 하나를 개선하는 파일럿으로 바꾼다.

직원에게 새 기록 업무를 추가하지 않는다. 이미 일하면서 남긴 자료에서 판단과 노하우를 찾는다. 담당자는 체크리스트와 Gate(검수 관문)를 정하고, AI는 그 기준에 따라 결과를 고친다.

2주차에는 이 가설을 말로 설명하는 데서 멈추지 않기로 했다. 기업의 실제 업무 하나를 골라 AX 구축 실험의 모양으로 만들어보기로 했다.

사용한 도구: AI와 업무 루프 설계

  • AI 도구: Gajae-Code, 개인 AI 비서(카린)

  • 참고 자료: 업무 루프 설계 노트, 비식별화한 커피챗 맥락, 지속가능경영 콘텐츠 업무 초안, 문서 검증 기록

  • 작성 도구: Markdown, 브라우저용 HTML 미리보기

  • 검증 방식: source map(출처 지도), append-only Trace(기록), checklist(체크리스트) 기반 AI Judge(평가), Gate(검수 관문), held-out(비공개 검증 자료)

작업 과정: AX 실험의 단계

파일럿을 기업 AX 실험의 단위로 전환

처음부터 전사 플랫폼을 만들지 않았다. 온톨로지도 만들지 않았다. 일하는 장면 하나를 골랐다.

Open optionsauto

현재 업무 후보 중 실제로 반복되고, 원천자료를 확인할 수 있으며,
사람이 결과를 검수할 수 있는 업무 하나를 골라 AX 파일럿으로 설계해줘.

고른 기준은 네 가지였다.

  • 매달 반복되는가

  • 원천자료와 수치를 확인할 수 있는가

  • 결과물이 하나의 콘텐츠로 남는가

  • 사람이 공개 범위와 사실을 판단할 수 있는가

이 기준을 통과한 첫 대상이 지속가능경영팀의 콘텐츠 제작이었다.

대표 업무를 하나로 고정

첫 대상은 넓은 “ESG 자동화”가 아니었다.

ESG 활동 원천자료를 사내 콘텐츠 한 편으로 바꾸는 일이었다.

항목

첫 파일럿 설계

대상

A사의 지속가능경영팀

반복

매달 1회

입력

승인된 ESG 활동 원천자료·수치·기간·공식 표현

출력

사내 인트라넷 게시글 또는 사보용 원고 1건

담당

원천자료 제공자·사실 reviewer(검토자)·팀 리더

중단

출처 누락·공개 범위 초과·미해결 질문이 있으면 보류

AX 구축 실험의 산출물 결정

업무 하나를 고른 뒤, “AI가 글을 써준다”에서 멈추지 않았다. 다음번에 다시 돌릴 수 있는 작업 단위를 만들었다.

산출물

역할

workflow brief(업무 범위서)

시작·완료·입력·출력·담당·중단 조건 고정

source map(출처 지도)

콘텐츠의 각 사실과 원천자료 연결

append-only Trace(기록)

Judge scorecard(평가표)

사실성·목표 적합성·독자 이해도 평가

Edit diff(수정 비교표)

Gate log(검수 기록)

승인·보류·거부와 이유 보존

held-out report(비공개 검증 보고서)

보지 않은 자료에서도 같은 기준이 작동하는지 확인

이것이 기업 AX 구축 실험의 최소 단위다. 자동화 도구 하나가 아니라, 업무·자료·판단·기록이 이어진 한 묶음이다.

루프를 지속 가능한 구조로 설계

루프를 실제 업무에 대입하면 어떻게 다음 실행으로 이어지는지 확인하고 싶었다.

Open optionsauto

이 업무가 한 번 실행되고 끝나지 않고, 다음 사이클에서 더 좋아지는 구조로 만들어줘.

답은 먼저 통과 기준을 고정한 뒤, 다섯 단계와 세 번의 사이클로 정리했다.

Run(실행)

승인된 원천자료에서 사실 후보를 뽑고, 사내 콘텐츠 초안 한 건을 만든다. 자료에 없는 수치와 기관명은 채우지 않는다.

Trace(기록)

원천자료 버전, 사실의 위치, 사용한 지시문, 결과물 버전, Judge(평가) 결과와 Gate(검수 관문) 판단을 append-only(추가 전용)으로 남긴다. 기존 기록을 조용히 덮어쓰지 않는다.

Judge(평가)

필수 필드·출처 연결·수치 일치·공개 범위를 먼저 결정론적으로 확인한다. 독자 이해도와 메시지 적합성은 고정된 rubric(평가 기준표)으로 자문 평가한다. 결정론적 실패를 평균 점수로 덮지 않는다.

Edit(수정)

Judge(평가)가 실패한 체크 항목과 근거를 넘기면 AI가 해당 기준에 맞게 결과물과 필요한 지시문·서식을 자동 수정한다. 수정 전후와 근거를 Trace(기록)에 남긴다.

Gate(검수 관문)

출처·보안·사실·공개 조건을 결정론적으로 확인한다. AI가 수정한 뒤에도 하나라도 통과하지 못하면 해당 수정안을 거부하고 이전 버전을 보존한 채 Run(실행)부터 다시 돌린다. Gate(검수 관문)는 결정론적 검사에 맡길 수 있고, 외부 게시가 필요한 경우 사람은 최종 승인만 한다.

진화 경로 설계

한 번의 초안 성공은 AX 구축이 아니다. 다음번에 같은 일을 더 잘할 수 있어야 한다.
루프를 돌리기 전에 먼저 통과 기준을 정했다. checklist(체크리스트)는 원천자료 연결, 수치 일치, 공개 범위, 필수 항목, 독자 이해도처럼 결과가 갖춰야 할 조건을 적은 것이다. 이 기준은 평가 중에 바꾸지 않는다.

기준에 미달하면 checklist(체크리스트)를 낮추지 않는다. Gate(검수 관문)에서 보류하고, Trace(기록)에 남은 실패 원인을 바탕으로 AI가 결과물과 필요한 지시문·서식을 자동 수정한 뒤 Run(실행)부터 다시 돌린다. 체크리스트 자체와 최종 Gate 승인 권한은 사람에게 남긴다.
이 다섯 노드는 한 번씩만 거치는 순서가 아니다. Judge(평가)에서 기준 미달이 나오면 Gate(검수 관문)가 수정안을 통과시키지 않고, AI가 Edit(수정)한 뒤 Run(실행)부터 다시 시작한다. 모든 필수 기준을 통과할 때까지 이 닫힌 루프를 계속 돌린다. Cycle 0·1·2는 실행 횟수가 아니라 초기 실행·개선된 버전·다음 자료 적용을 구분하는 표기다.

사이클

하는 일

다음 루프에 남기는 것

준비 단계(루프 전)

목표·checklist(체크리스트)·Gate(검수 관문) 기준을 먼저 고정

평가 기준

Cycle 0(초기 실행)

처음 정한 기준과 지시문으로 결과물 1건을 만들고 Run(실행)→Trace(기록)→Judge(평가)→Edit(수정)→Gate(검수 관문)를 처음 실행

Cycle 1(개선 반복)

Cycle 0의 실패 기준에 맞춰 AI가 자동 수정하고, Gate(검수 관문)를 통과할 때까지 같은 입력으로 반복

Cycle 2(다음 자료 적용)

Cycle 1에서 Gate를 통과한 수정 규칙·지시문을 다음 자료에 적용하고, 기준을 통과할 때까지 같은 루프를 반복

Held-out(비공개 검증)

보지 않은 자료에 동결된 기준을 적용

확장·반복·보류·폐기 판단

진화의 규칙도 정했다.

  • 체크리스트는 평가 중 고정하고, AI는 실패한 기준에 따라 결과물·지시문·서식을 수정한다.

  • 사람은 체크리스트 변경과 최종 Gate 통과 여부를 승인하며, AI 수정 문장을 직접 고치지 않는다.

  • 거부된 결과와 이유는 보존하되 자동으로 재사용하지 않는다.

  • 새 루프의 입력·도구·결과·판단은 다시 Trace(기록)한다.

  • held-out(비공개 검증 자료)에서 기준이 무너지면 확장하지 않는다.

루프는 스스로 진화하지 않는다. 기록과 판단이 다음 실행에 연결될 때 진화한다.

설계의 빈틈 점검

기업 업무나 GEPA·SkillOpt·VPRM을 실제로 실행한 것이 아니다. 제출 전 문서 하나를 예시 자료로 삼아, 설계한 checklist(체크리스트)·Trace(기록)·Edit(수정)·Gate(검수 관문)가 어떤 실패를 포착해야 하는지 대입해 보았다.

Open optionsauto

핵심 경험이 너무 압축됐어. 원천자료를 기준으로 빠진 경험을 찾아서 다시 구성해줘.

이 예시가 보여준 것은 보기 좋은 문서가 핵심 경험을 줄일 수 있다는 점이었다. Judge(평가)가 형식만 보면 통과할 수 있는 실패 유형이다.

원천자료와 대조하는 항목을 checklist(체크리스트)에 넣어야 했다. 누락된 경험을 복원하는 Edit(수정) 규칙과 Gate(검수 관문) 조건도 이 예시로 구체화했다.

개인 문서 예시는 기업 성과가 아니라, 3주차 실제 기술 실험 전에 설계안을 점검하기 위한 보조 사례다.

결과: AX 실험의 성과

Before vs After

항목

Before

After

1주차 결론

AI 교육을 실제 업무로 바꿔야 한다

기업 AX 실험의 대표 업무를 선택했다

업무 범위

팀의 업무를 넓게 상상

ESG 원천자료에서 사내 콘텐츠 1건으로 고정

루프

실행·기록·수정의 개념

체크리스트를 먼저 고정하고 Cycle 0·1·2와 held-out으로 통과 여부를 확인

결과물

AI가 만든 초안

다음 행동

더 많은 도구 설명

승인된 자료로 첫 사이클을 실행할 조건 확인

이번 주에 실제로 한 일

  • 1주차 결론을 기업 AX 파일럿의 선택 기준으로 바꿨다.

  • 지속가능경영팀의 대표 업무를 ESG 활동 원천자료 → 사내 콘텐츠 1건으로 골랐다.

  • 업무 범위·입력·출력·역할·중단 조건을 정했다.

  • Run(실행) → Trace(기록) → Judge(평가) → Edit(수정) → Gate(검수 관문) 루프를 업무에 맞게 설계했다.

  • 루프 전에 통과 기준과 Gate(검수 관문) 체크리스트를 고정하고, 기준 미달 시 다시 실행하는 구조를 설계했다.

  • Cycle 0·1·2와 held-out(비공개 검증 자료)을 이용한 진화 경로를 만들었다.

  • 개인 문서 예시로 설계의 누락 가능성을 점검했다.

아직 하지 않은 일

  • 실제 기업 원천자료로 Cycle 0(초기 실행)을 실행하지 않았다.

  • GEPA·SkillOpt·VPRM을 실제 파일럿에 적용하지 않았다.

  • 사내 콘텐츠를 실제로 게시하지 않았다.

  • 시간 단축·오류 감소·재사용률을 측정하지 않았다.

  • 기업 시스템이나 자동화 도구를 배포하지 않았다.

이번 주에 만든 것은 결과 보고서가 아니다. 기업의 업무 하나를 AX 구축 실험으로 바꾸는 설계다.

AI 활용 팁: 실험에서 배운 점

효과적이었던 전략

  1. 교육보다 먼저 대표 업무를 고르기

    • 업무가 정해지면 필요한 도구와 자료의 범위도 작아진다.

  2. 실험의 산출물을 초안 하나로 끝내지 않기

    • 출처·판정·수정·Gate가 함께 남아야 다음 루프가 가능하다.

진화 규칙을 체크리스트와 Gate에 묶기

Open optionsauto

모든 AI 피드백을 checklist(체크리스트)에 그대로 누적하지 않고, 고정된 기준을 통과한 수정 규칙만 다음 실행에 넣는다.
  1. 실제 업무 전에 작은 실패를 허용하기

    • 문서 리허설에서 과도한 압축을 발견했기 때문에 기업 파일럿의 검수 기준을 구체화할 수 있었다.

이렇게 하면 안 돼요

  1. AI 교육을 업무 변화의 증거로 착각하지 않는다.

  2. 대표 업무를 여러 개 골라 한 번에 자동화하지 않는다.

  3. Run(실행) 한 번을 AX 구축 완료라고 부르지 않는다.

  4. Trace(기록) 없는 수정안을 다음 루프에 자동 반영하지 않는다.

  5. 실제 실행 전 설계를 기업 성과처럼 쓰지 않는다.

다른 업무에 적용하기: 반복 가능한 구조

이 구조는 원천자료와 반복 결과물이 있는 업무에 옮길 수 있다.

  • 회의 기록 → 의사결정 메모

  • 고객 인터뷰 → 제품 개선안

  • 현장 활동 기록 → 월간 운영 소식

  • 반복 문의 → 내부 안내문

공통된 순서는 같다. 업무 하나를 고르고, 체크리스트를 먼저 정하고, AI가 Judge(평가) 결과를 바탕으로 결과물을 수정하고, 기준에 미달하면 다시 실행한다. 통과한 수정 규칙만 다음 루프에 넣는다.

앞으로의 계획: 3주차 실행 준비

2주차에는 1주차의 요구사항을 실제 기술에 맡기기 위한 실행계획으로 구체화했다. GEPA·SkillOpt·VPRM은 아직 적용하지 않았다. 3주차에는 비식별 샘플로 아래 후보를 실제로 시험한다. 세 기술을 모두 도입한다는 뜻이 아니라, 같은 대표 업무에 어느 방식이 맞는지 비교하는 단계다.

루프 노드

이 사례에서 하는 일

GEPA 방식

SkillOpt 방식

VPRM 방식

Run(실행)

AI가 사내 게시글 초안을 만듦

에이전트가 업무 수행

여러 프롬프트·스킬 후보를 실행

초안·툴콜·추론을 실행

Trace(기록)

원자료·출처·지시문·결과 버전을 남김

실행 Trace를 LLM이 읽음

여러 실행 라운드의 점수를 기록

결과물·툴콜·추론을 모두 기록

Judge(평가)

체크리스트로 사실성·출처·공개 범위 등을 평가

LLM-as-Judge가 Trace를 평가

실행 점수와 held-out(비공개 검증) 점수를 비교

원자료·규칙과 결정론적으로 대조

Edit(수정)

AI가 실패 기준에 맞춰 초안·지시문·서식을 고침

프롬프트·스킬을 다시 씀

더 좋은 SKILL.md·서식을 선택·업데이트

잘못된 결과물·행동·추론을 직접 수정

Gate(검수 관문)

기준 미달이면 수정안을 거부하고 다시 실행

새 스킬 채택 여부 결정

낮은 점수·held-out 실패안을 폐기

규칙 위반·수치 불일치 결과를 거부

  1. 지속가능경영팀의 실제 자료 범위와 보안 권한을 확인한다.

  2. 루프 전에 결과 기준과 Gate(검수 관문) 체크리스트를 고정한다.

  3. 사실 reviewer(검토자)·보안 중단 권한자·공개 승인자를 나눈다.

  4. 사람은 트리거만 걸고, 고정한 체크리스트를 기준으로 AI의 Cycle 0(초기 실행)을 시작한다.

  5. 기준에 미달하면 실패 원인을 반영해 Cycle 1(개선 반복)을 돌린다.

  6. Cycle 1에서 통과한 변경만 Cycle 2(다음 자료 적용)와 held-out(비공개 검증 자료)에 적용한다. 다음 자료에서도 기준 미달이면 같은 루프를 계속 반복한다.

  7. 3주차에 비식별 샘플로 GEPA·SkillOpt·VPRM 후보를 실제 실행하고, 통과율·수정 횟수·비용·held-out(비공개 검증) 결과를 비교한다.

재사용 가능한 프롬프트: 업무 개선을 위한 도구

프롬프트 1: 대표 업무 고르기

이 팀의 업무 후보 중 반복 빈도가 높고, 원천자료를 확인할 수 있으며, 사람이 결과를 검수할 수 있는 업무 하나를 골라줘. 입력·출력·담당자·검수 기준·중단 조건을 표로 정리하고, 실제 사실과 제안은 구분해 표시해줘.

[팀의 업무 후보]와 [사용 가능한 자료 범위]를 붙여 넣으세요.

프롬프트 2: 진화하는 루프 설계하기

먼저 결과 기준과 Gate(검수 관문) 체크리스트를 정하고, 그 기준에 도달하지 못하면 AI가 Edit(수정)한 뒤 Run(실행)부터 다시 돌리는 구조로 설계해줘. Cycle 0(초기 실행), Cycle 1(개선 반복), Cycle 2(다음 자료 적용), held-out(비공개 검증 자료)의 입력·출력·측정값·실패 조치를 각각 정리해줘. Gate를 통과한 변경만 다음 사이클에 반영하도록 해줘.

[대표 업무]와 [업무 범위]를 붙여 넣으세요.

프롬프트 3: Trace(기록)를 다음 루프에 반영하기

아래 Trace(기록)와 Judge(평가) 결과를 읽고, 실패한 체크 항목에 따라 결과물·지시문·서식의 수정안을 AI가 자동으로 만들고 다시 실행해줘. checklist(체크리스트) 자체는 바꾸지 말고, Gate(검수 관문)를 통과한 변경만 다음 사이클에 반영해줘.

[Trace(기록)]와 [Judge(평가) 결과·Gate(검수 관문) 기록]을 붙여 넣으세요.

2
1개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.