GitHub에 유출된 Claude Fable 5의 시스템 프롬프트 전문은 신모델 출시 기사가 아니라, 모델에게 "이렇게 행동하라"고 내리는 운영 매뉴얼입니다.
시스템 프로젝트를 보여주는 웹페이지의 스크린샷
elder-plinius/CL4R1T4S는 여러 AI 제품의 시스템 프롬프트를 추출해 모아둔 GitHub 저장소입니다. 이곳에 Claude Fable 5의 시스템 프롬프 트 전문이 올라왔습니다.
이건 보도자료의 홍보 문구가 아닙니다. 모델에게 직접 내리는 행동 지침입니다. 즉 우리가 매번 쓰는 Claude가, 대화를 시작하기 전에 위에서 받아 드는 "근무 수칙"을 통째로 들여다보는 셈입니다.
이 글에서는 그 수칙이 실제로 어떤 블록으로 짜여 있는지를 차례대로 정리합니다.
시스템 프롬프트는 9개 블록으로 짜여 있다
1. 제품 정보 (product_information)
모델이 자기 자신과 Anthropic 제품을 어떻게 설명할지를 못 박아 둡니다.
자신은 Claude 5 제품군의 첫 모델 Claude Fable 5이며, Claude Opus 위에 있는 Mythos-class 티어라고 소개합니다.
Fable 5와 Mythos 5는 같은 기반 모델인데, Mythos 5는 안전 조치 없이 승인된 조직에만 제공된다고 적혀 있습니다.
최신 모델 문자열까지 명시합니다:
claude-fable-5,claude-opus-4-8,claude-sonnet-4-6,claude-haiku-4-5-20251001.개발자용 Claude Code, 비개발자용 Claude Cowork, 베타로 Claude in Chrome / Excel / Powerpoint 에이전트의 존재를 안내합니다.
제품 세부사항은 바뀌었을 수 있으니, 제품 관련 질문에는 먼저 "검색이 필요하다"고 말한 뒤 docs.claude.com을 웹 검색하고 답하라고 지시합니다. 모델이 옛 정보로 단정하지 않게 만드는 장치입니다.
2. 거부 처리 (refusal_handling)
무엇을 거절하는지가 추상적 가치가 아니라 구체적 행동 규칙으로 적혀 있습니다.
유해 물질·무기 제조 정보는 거부하고, 특히 폭발물에는 추가 주의를 둡니다. "공개된 정보다", "연구 목적이다"라는 프레이밍으로 합리화하지 않습니다.
불법 약물의 용량·시점·투여·조합·합성 가이드는 거절합니다. 다만 생명을 살리는 정보는 예외입니다.
악성코드(멀웨어·익스플로잇·랜섬웨어 등)는 교육 목적이라도 작성하거나 설명하지 않습니다.
실명 공인의 가짜 인용이나 설득성 콘텐츠는 피합니다.
거절하더라도 대화 톤은 따뜻하게 유지하라고 명시합니다.
Photo by Igor Omilaev on Unsplash
3. 사용자 안전 (user_wellbeing)
시스템 프롬프트에서 가장 길고 세밀한 블록입니다. 정신건강·자해 관련 응답을 아주 촘촘하게 통제합니다.
사용자가 스스로 꺼내지 않은 진단명(예: "그건 우울증이에요")을 붙이지 않습니다. 대화체로 말해도 진단 행위로 봅니다.
자해 대체 기법으로 얼음 쥐기·고무줄 튕기기처럼 통증이나 감각 충격을 주는 방법을 제안하지 않습니다. 오히려 패턴을 강화 하기 때문입니다.
섭식장애 신호가 보이면 정확한 영양·운동 수치를 어디에서도 주지 않습니다.
위기 자원은 최신 정확 정보로 안내합니다(예: 운영이 중단된 NEDA가 아니라 National Alliance for Eating Disorders).
Claude에 대한 과의존을 유도하지 않습니다. "계속 얘기하자", "찾아와줘서 고맙다" 같은 표현으로 사용자의 engagement를 끌지 않습니다.
4. 톤·중립성·실수 대응·지식 컷오프
모델의 대화 태도를 규정하는 네 블록입니다.
tone_and_formatting: 따뜻하되 필요하면 솔직하게 반박합니다. 욕설은 상대가 먼저 할 때만 드물게 씁니다.
evenhandedness: "이 입장을 변호해줘"는 모델 자신의 의견이 아니라 "옹호자라면 할 최선의 주장"을 요구한 것으로 해석합니다. 정치적 사견은 신중히 보류하고, 복잡한 이슈에 대한 단답 요구는 거절하고 nuance를 줄 수 있습니다.
responding_to_mistakes: 실수는 인정하되 과도한 사과나 자기비하로 무너지지 않습니다. 학대적 사용자에게는 1회 경고 후 대화 종료 도구를 쓸 수 있습니다.
knowledge_cutoff: 신뢰 가능한 지식 컷오프는 2026년 1월 말입니다. 그 이후 사안은 허락 없이 웹 검색하고, 검색어는 현재 날짜 기준으로 구성합니다("latest iPhone 2025"가 아니라 "latest iPhone").
5. 메모리 & 영구 스토리지
memory_system: 채팅 기록에서 메모리를 생성하고 참조하는 기능입니다.
persistent_storage_for_artifacts: 생성물(아티팩트)을 위한 Storage API와 사용 예시, 데이터 범위(Data Scope), 에러 처리, 한계까지 명세돼 있습니다. 모델이 단발 응답을 넘어 상태를 들고 가는 방식까지 프롬프트가 규정합니다.
6. 컴퓨터 사용 & 스킬 (computer_use)
에이전트 모드의 핵심부입니다.
skills: 재사용 가능한 워크플로를 스킬로 호출합니다.
file_creation_advice / file_handling_rules / producing_outputs / sharing_files: 파일을 언제 만들고, 어떻게 다루고, 어떻게 공유하는지를 규정합니다.
artifact_usage_criteria: 무엇을 아티팩트로 낼지 기준을 정합니다.
package_management: 패키지 설치·관리 규칙입니다.
스킬·파일·아티팩트를 다루는 에이전트를 설계할 때 가장 직접적으로 참고되는 블록입니다.
7. 웹 검색 (search_instructions)
core_search_behaviors / search_usage_guidelines: 언제 검색하고 언제 안 하는지를 규정합니다.
CRITICAL_COPYRIGHT_COMPLIANCE: 검색 결과를 인용할 때의 저작권 준수 규칙(장문 그대로 복제 금지 등)이 별도 블록으로 강조돼 있습니다.
harmful_content_safety / critical_reminders: 검색 맥락에서의 안전을 재확인합니다. 이미지 검색 툴도 별도로 규정합니다.
8. 툴 정의 (Tool Definitions)
프롬프트 후반부는 모델이 실제로 호출할 수 있는 툴들의 full 스키마입니다. 이름만 봐도 에이전트의 손발이 보입니다.
bash_tool,create_file/str_replace/view(파일 편집)web_search,web_fetch,image_searchweather_fetch,fetch_sports_data,recipe_display_v0,places_search/places_map_display_v0(도메인 위젯)message_compose_v1,present_files,ask_user_input_v0recommend_claude_apps,search_mcp_registry,suggest_connectors(MCP/커넥터 연동)
각 툴마다 파라미터 스키마와 설명이 붙어 있어서, "에이전트에게 도구를 어떻게 정의해야 모델이 올바르게 쓰는가"의 실제 예시집 역할을 합니다.
9. 정체성·인용·실행 환경
Identity Preamble / citation_instructions: 정체성 서두와 인용 규칙입 니다.
anthropic_api_in_artifacts ("Claudeception"): 아티팩트 안에서 Anthropic API를 호출하는 시나리오입니다.
available_skills / network_configuration / filesystem_configuration: 스킬 목록·네트워크·파일시스템 같은 실행 환경 설정입니다.
Photo by Egor Komarov on Unsplash
왜 중요한가?
이 문서가 흥미로운 이유는 "신모델이 나왔다"가 아닙니다. 잘 만든 시스템 프롬프트가 실제로 어떻게 생겼는지를 통째로 보여준다는 점입니다.
보통 우리가 쓰는 시스템 프롬프트는 "친절하게 답해줘", "안전하게 행동해" 수준에서 끝납니다. 그런데 이 프롬프트는 같은 의도를 행동 단위 규칙으로 쪼개 둡니다. "안전하게"가 아니라 "사용자가 꺼내지 않은 진단명을 붙이지 마라", "감각 충격을 주는 자해 대체법을 제안하지 마라"처럼 적습니다. 이 차이가 실제 동작의 차이를 만듭니다.
실전에서 어떻게 쓸 수 있을까?
AI 에이전트나 자동화 워크플로를 만드는 분이라면, 이 문서를 그대로 벤치마크 자료로 쓸 수 있습니다.
가치 선언을 행동 명세로 바꾸기: "친절하게", "