소개
1주차는 데이터 수집과 환경 세팅입니다. 저는 바이오·제약 데이터를 20년 넘게 분석해 왔으니, 이 스터디의 1주차는 제가 이미 하고 있는 일이라고 생각했습니다.
그런데 강의 중반에 나온 한 문장에서 멈췄습니다.
기본적으로 CLAUDE.md나 AGENTS.md에 전역으로 설정을 해 주시는 걸 권장 드려요. "데이터 분석할 때 판다스 대신 폴라스를 우선 쓴다"라는 문구를 넣으면, 나중에 분석할 때 에이전트가 알아서 폴라스를 가져다가 분석을 해요.
저는 규칙 파일을 열심히 관리하는 편입니다. CLAUDE.md 하나에 rules/ 아래 9개를 두고 몇 년째 다듬고 있습니다. 그래서 확인하고 싶었습니다. 내 규칙 파일에 데이터 분석 규칙은 몇 개나 있을까.
0개였습니다.
진행 방법
어떤 도구를 사용했고, 어떻게 활용하셨나요?
사용 도구: Claude Code, Python 3, grep
Step 1. 내 규칙 파일을 주제별로 세기
규칙 파일 10개의 항목을 주제별로 셌습니다.
규칙 파일
항목 수
문체 (writing-style.md)
64개
환경 (environment.md)
19개
전역 (CLAUDE.md)
10개
작업 규율 (work-discipline.md)
9개
인용 (references.md)
6개
HTML 출력 (html-output.md)
6개
그림 (figures.md)
5개
스크립트 안전 (scripting-safety.md)
4개
제목, 주제 관련성
0개
합계
123개
문체가 64개로 전체의 절반이 넘습니다.
Step 2. 데이터 분석 규칙을 찾기
polars, duckdb, pandas, 데이터 분석, 대용량으로 규칙 파일 전체를 훑었습니다.
한 줄이 걸렸습니다.
CLAUDE.md:6 경력 20년 이상의 bioinformatician, 바이오·제약 데이터 분석 전문가.
제 소개 문장이었습니다. 도구를 지정한 항목이 아닙니다.
항목
값
규칙 항목 총계
123개
그중 어떤 라이브러리로 분석할지 정한 항목
0개
Step 3. 그럼 실제로는 무엇을 쓰고 있나
규칙이 없으면 습관대로 갑니다. 제 프로젝트 여섯 곳의 파이썬 파일에서 어떤 라이브러리를 import하는지 셌습니다.
LIBS = {'pandas': r'^\s*(import pandas|from pandas)',
'polars': r'^\s*(import polars|from polars)',
'duckdb': r'^\s*(import duckdb|from duckdb)'}
라이브러리
import한 파일
numpy
200개 (46%)
pandas
127개 (29%)
polars
0개
duckdb
0개
검사한 파이썬 파일은 434개입니다. pandas 127 대 polars 0입니다.
Step 4. 쓸 수는 있는 상태인가
혹시 설치는 해 두고 안 쓴 것인지 확인했습니다.
도구
상태
pandas
2.2.3 설치됨
polars
미설치
duckdb
미설치
uv
미설치
강의에서 권한 세 가지가 전부 없습니다. 안 쓴 것이 아니라 쓸 수 없는 상태였습니다.
Step 5. 이게 문제인지 확인
폴라스를 안 쓴다고 다 문제는 아닙니다. 강의가 든 이유는 대용량에서 메모리가 터진다는 것이었습니다.
분석하다 보면 메모리가 터져서 작업이 안 되고 PC가 뻗는 경우가 생길 거예요. 저도 맥북 프로를 쓰고 있지만 판다스로 작업했다가 그런 문제가 있어서 폴라스로 싹 다 바꿨고요.
제가 다루는 데이터를 봤습니다. 단일세포 분석과 오믹스 데이터가 있는 autobiox 폴더가 15GB입니다. 마크다운은 626개지만 용량 대부분은 데이터입니다.
대용량이 남의 이야기가 아닙니다.
결과와 배운 점
측정 결과
항목
값
규칙 항목 총계
123개
그중 문체 규칙
64개 (52%)
그중 데이터 분석 도구 규칙
0개
검사한 파이썬 파일
434개
pandas import
127개 (29%)
polars import
0개
duckdb import
0개
polars, duckdb, uv 설치 여부
셋 다 미설치
주 데이터 폴더 용량
15GB
배운 점
규칙을 쌓은 곳과 일이 일어나는 곳이 달랐습니다. 문체 규칙 64개는 제가 글을 쓸 때마다 불편을 느껴 하나씩 추가한 것입니다. 그런데 데이터 분석은 20년을 해 왔는데 규칙이 0개입니다. 오래 해서 손에 익은 일일수록 규칙으로 옮기지 않습니다. 규칙은 새로 배우는 곳에 쌓이고, 잘한다고 생각하는 곳은 비어 있었습니다.
에이전트는 규칙이 없으면 제 습관을 따라갑니다. 제 코드베이스에 pandas가 127개 있으니 에이전트도 pandas로 씁니다. 강의가 "전역에 한 줄 넣으면 알아서 폴라스를 쓴다"고 한 것은, 뒤집으면 안 넣으면 영원히 판다스라는 뜻입니다.
미설치가 미사용보다 앞선 문제입니다. 폴라스를 0번 쓴 이유를 "필요를 못 느꼈다"로 설명할 뻔했는데, 확인해 보니 설치 자체가 안 돼 있었습니다. 쓸지 말지를 판단한 적이 없었던 것입니다. 이건 K스킬 스터디에서도 같은 구조로 나왔습니다. 가져다 두기만 하고 쓸 준비를 안 해 두면 판단할 기회조차 오지 않습니다.
개발자가 아닌 스터디장의 설명이 더 잘 와닿았습니다. 스터디장이 "러스트 기반에 어쩌고 하면서 일단 빠릅니다"라고 하고 넘어갔습니다. 내부 구조 설명 대신 본인 맥북에서 메모리가 터졌고 그래서 싹 바꿨다는 이야기가 근거였습니다. 제 15GB 폴더를 떠올리게 한 것은 뒤쪽이었습니다.
시행착오
규칙 파일에서
데이터 분석을 검색해CLAUDE.md가 걸리길래 "있긴 하다"로 넘어갈 뻔했습니다. 줄을 열어 보니 제 직업을 소개한 문장이었습니다. 검색어가 걸렸다는 것과 그 규칙이 있다는 것은 다릅니다.처음에는 파일 개수만 세고 비율을 안 냈습니다. pandas 127개가 많아 보였는데, 434개 중 29%라고 놓고 보니 나머지 71%는 데이터 처리를 안 하는 파일이라는 것도 함께 보였습니다.
앞으로의 계획
CLAUDE.md에 데이터 분석 규칙을 신설하겠습니다. 문체 64개 옆에 0개인 채로 두는 것이 이상합니다. 첫 항목은 강의에서 권한 그대로 "대용량 데이터는 판다스 대신 폴라스를 우선 쓴다"입니다.규칙을 넣기 전에 uv, polars, duckdb를 먼저 설치합니다. 순서가 반대면 규칙만 있고 실행이 안 됩니다.
다음 분석부터 폴라스로 한 번 돌려 보고 판다스와 비교할 계획입니다. 강의의 근거가 메모리이니 제 15GB 데이터에서 실제로 차이가 나는지가 확인 대상입니다. 차이가 없으면 규칙에서 뺍니다.
2주차 부동산 실습은 공공데이터포털 API 키 신청부터 해야 합니다. 승인에 시간이 걸릴 수 있어 오늘 넣어 둡니다.
도움 받은 글 (옵션)
23기 데이터 대시보드 1주차 강의 (푸디_): 규칙 파일에 폴라스 우선을 전역 지정하라는 안내, uv와 DuckDB, Polars를 쓰는 이유, 공공데이터포털·KB통계·FinanceDataReader의 수집 경로, API 키를 채팅창이 아닌 터미널에서 다루라는 주의