AI(딥러닝, random forest 등)과 기존 계량경제학을 활용한 박사후 학술논문 1년 4편 시리즈 설계
소개
저는 2026년 2월에 부동산학 박사학위를 취득후, AI를 학술연구에 본격적으로 접목하는 작업을 시작했습니다. 박사논문은 "거시경제환경 및 주택 소비심리가 주택매매가에 미치는 영향 분석 — 서울시 아파트 실거래가 중심으로"라는 주제 로, GARCH·TGARCH·DCC-GARCH 등 전통 계량경제 모형을 활용했습니다.
학위 취득 후 가장 큰 고민은 "박사논문에서 구축한 자산(데이터, 변수, 이론적 틀)을 어떻게 후속 연구로 확장할 것인가"였습니다. 매번 새로운 데이터를 구축하면 1편당 소요시간이 너무 길어집니다.
특히 다음 세 가지를 동시에 달성하고 싶었습니다.
첫째, 기존 계량경제 분석의 선형성·정규성 가정의 한계를 AI 기법으로 보완하는 학술적 정체성을 확립하는 것.
둘째, KCI급 학술지에 1년 내 4편을 게재할 수 있는 현실적 일정을 설계하는 것.
셋째, 4편이 따로 노는 논문이 아니라 하나의 시리즈로 인식되도록 일관성을 확보하는 것.
Claude와의 대화를 통해 이 세 가지를 모두 만족하는 시리즈 로드맵을 설계했습니다.
진행 방법
사용 도구: GPT4.5 deep Research, Claude (claude.ai)
활용 방식: Claude를 "부동산학 저명한 교수"이자 "학술논문 지도교수" 역할로 설정하고, 박사논문의 변수·기간·이론을 그대로 공유한 뒤 단계적으로 시리즈를 설계해 나갔습니다.
전체 진행 흐름
1단계로 사전에 작성해 둔 "부동산 시장분석을 위한 AI 연구 로드맵" 문서(XGBoost, LSTM, BERT 등 방법 지형도가 정리된 자료)를 Claude에 업로드하고, 첫 학술논문 한 편의 뼈대를 요청했습니다.
2단계로 Claude가 박사논문 자산 재활용도를 기준으로 4개 선택지(A: XGBoost+SHAP, B: XGBoost vs GARCH 비교, C: 뉴스 텍스트 심리지수, D: LSTM/TFT)를 제시했고, 저는 A안 + KCI + 3개월 일정을 선택했습니다.
3단계에서 Claude는 단일 논문 뼈대를 학술 문체로 상세하게 작성해주었습니다. 그런데 이 시점에서 저는 더 큰 그림이 필요하다는 점을 깨달았고, 1년 4편 시리즈로 확장해달라고 요청했습니다.
핵심 프롬프트 전문
난 AI를 통한 통계분석을 통한 기존계량통계분석의 부족한 점을 보완하고,
서로의 예측력이 어떤게 더 높은지 등등을 논문에 실고 싶어.
변수는 단순화 했으면 좋겠고 1년내 4개의 논문을 쓰려고 해.
그에 맞는 주제를 연속적으로 제시해주고 논문의 뼈대, 방향, 등등
세부적으로 제시해줘. 넌 부동산학의 저명한 교수야.이 프롬프트의 핵심은 네 가지를 한 번에 명시한 것입니다. ① 학술적 정체성(AI로 계량 보완 + 예측력 비교), ② 제약조건(변수 단순화), ③ 정량 목표(1년 4편), ④ 역할 설정(부동산학 교수).
Claude가 설계한 시리즈 구조
공통 변수 세트를 5개로 고정했습니다.
구분
변수
출처
종속변수
서울시 아파트 매매가격지수
한국부동산원 R-ONE
거시 1
주택담보대출금리
한국은행 ECOS
거시 2
M2(광의통화)
한국은행 ECOS
거시 3
CPI
한국은행 ECOS
심리
주택매매시장 소비심리지수(HSI)
국토연구원
이 5개 변수와 2013년 1월~2024년 12월(월별 144개월) 표본을 4편 모두에서 공유하는 마스터패널로 잠가두는 전략입니다.
4편 시리즈 설계 결과
[1편] 횡단적 비선형성 → [2편] 시계열 예측력
XGBoost vs OLS LSTM vs ARIMA·VAR
↓ ↓
[3편] 변동성·국면 보완 ← [4편] 통합 비교·앙상블
Random Forest + 4개 모형 종합
박사논문 GARCH 재해석 + 정책적 함의1편(2026.08 투고)은 XGBoost+SHAP으로 비선형 기여도 분해, 2편(2026.11 투고)은 LSTM vs ARIMA·VAR 예측력 비교, 3편(2027.02 투고)은 Random Forest로 박사논문 GARCH 결과 재검증, 4편(2027.05 투고)은 6개 모형 종합 비교와 앙상블 적용입니다.
각 편마다 박사논문과 연계성(1편 70%, 2편 60%, 3편 80%, 4편 50%)와 시리즈 내 자기인용 구조(2편→1편, 4편→1·2·3편)를 명시적으로 설계했습니다.
배운 점
첫째, AI에게 역할을 명확히 부여하는 것이 결과의 질을 좌우합니다. "부동산학 저명한 교수"라는 한 줄을 추가하기 전과 후의 답변 깊이가 확연히 달랐습니다. 단순 정보 요약이 아니라 학술적 정체성·자기인용 전략·심사위원 설득 논리까지 짚어주는 수준이 되었습니다.
둘째, 단일 산출물보다 시리즈 구조로 요청하는 것이 훨씬 강력합니다. 처음에는 논문 한 편의 뼈대만 받았지만, 1년 4편 시리즈로 확장하니 마스터패널 공유·표 양식 통일·자기인용 누적 같은 운영 원칙까지 함께 설계되었습니다. 박사후 연구자에게는 단발 논문보다 시리즈 전략이 훨씬 가치 있다는 점을 체감했습니다.
셋째, 제약조건을 명시할수록 답변이 실용적입니다. "변수는 단순화", "1년 내 4편", "3개월 내 투고" 같은 정량적·정성적 제약을 명시하니, Claude가 5개 변수 고정·역산 일정표·역할 분담까지 구체적으로 제시했습니다.
나만의 꿀팁
박사논문 정보를 메모리에 미리 저장해두면, 매번 박사논문 주제를 설명할 필요가 없습니다. 저는 박사논문 제목·변수·방법론·기간을 Claude 메모리에 등록해두었고, 새 대화에서도 박사논문 맥락이 자동으로 반영되어 작업 효율이 크게 올라갔습니다.
또한 Claude가 중간에 선택지(ask_user_input) 형태로 질문을 던질 때, 답을 단답형이 아니라 "A안 + KCI + 3개월 (이유: 박사논문 자산 재활용도가 가장 높고, 후속 시리즈 확장성이 좋아 보임)"처럼 짧게라도 이유를 덧붙이니 다음 답변의 정밀도가 더 높아졌습니다.
시행착오
첫 번째 시행착오는 처음에 단일 논문 한 편만 요청한 것이었습니다. 그 결과로 받은 뼈대도 훌륭했지만, 박사후 첫 1년이라는 시간 자원을 어떻게 배분할지에 대한 큰 그림은 없었습니다. 시리즈로 확장 요청한 뒤에야 전략적 자산 배분이 가능해졌습니다.
두 번째는 박사논문과의 차별성 확보였습니다. 변수와 표본을 그대로 쓰면 자기표절 우려가 있는데, Claude가 "박사논문 GARCH 결과는 3편에 집중 인용하고 1·2·4편에서는 1~2회로 제한" 같은 구체적 운영 원칙을 제시해 해결되었습니다.
도움이 필요한 부분
XGBoost, LSTM 등 실제 모형 구현 단계에서 EViews 13(박사논문에 사용)이 아닌 Python 환경으로 전환해야 합니다. AI 협업으로 코드 작성은 가능하지만, 부동산 시계열 데이터에서 발생하는 시간누수·공간누수 문제를 어떻게 방지하는지에 대한 노하우는 아직 부족합니다. 비슷한 경험을 하신 분의 조언을 구하고 있습니다.
앞으로의 계획
2026년 5~7월에 1편(XGBoost+SHAP) 작성·투고를 목표로 작업 중입니다. 동시에 마스터패널을 한 번에 정제해 잠가두고, 2~4편에서 동일하게 재사용할 예정입니다. 시리즈가 완성되면 AI-계량 통합 부동산 분석 프레임워크라는 일관된 학술적 정체성을 확립할 수 있을 것으로 기대합니다.
도움 받은 글
사전에 정리한 "부동산 시장분석을 위한 AI 연구 로드맵" 내부 문서를 Claude에 함께 업로드한 것이 가장 큰 도움이 되었습니다. XGBoost·LSTM·BERT·TFT 등 방법론 지형도와 국내외 응용연구 사례가 정리되어 있어, Claude가 빠르게 맥락을 파악하고 구체적인 선택지를 제시할 수 있었습니다.