소개
안녕하세요! 이번에 국제물류와 AI 융합 연구를 진행 중인 대학원생입니다. 제 연구는 100% 공개된 공공 데이터(거시경제 지표, 운임 지수 등)를 활용하여 시계열 분석을 진행하는 것을 목표로 하고 있습니다. 방대한 선행연구를 빠르게 분석하고, 데이터 전처리 코드를 자동화하기 위해 AI를 연구의 '세컨드 브레인'으로 삼아 초기 기초 공사를 진행해 보았습니다. 이번 글에서는 제가 연구 초기 단계에서 AI 도구들 을 어떻게 연결하여 활용했는지 공유합니다.
진행 방법
어떤 도구를 사용했고, 어떻게 활용하셨나요? 저는 논문 작성의 파이프라인을 나누어 NotebookLM, Cursor IDE, Claude를 조합하여 사용했습니다. AI가 제멋대로 작동하지 않도록 각 도구에 명확한 역할을 부여하는 '하네스 엔지니어링' 방식을 적용했습니다.
NotebookLM (선행연구 탐색 및 연구 공백 도출) 관련 선행연구 PDF 10여 편을 업로드하고, 연구의 차별점을 찾기 위해 아래와 같은 프롬프트를 사용했습니다.
[선행연구 분석 프롬프트]
업로드된 논문들을 분석해서 다음 양식에 맞춰 표로 정리해 줘.
연구자 및 연도
종속변수 및 독립변수
활용한 분석 방법론 (예: VAR, VECM, 회귀분석, 머신러닝 등)
핵심 결과
(중요) 기존 연구들의 한계점과 본 연구(공공조달 물류비 관점)가 기여할 수 있는 연구 공백(Research Gap) 3가지 도출
Cursor IDE & Claude 3.5 Sonnet (데이터 병합 및 기초 분석 코드 작성) 공공데이터포털과 IMF 등에서 다운로드한 CSV 파일들을 병합하고, 기초적인 상관관계 분석을 수행하는 파이썬 코드를 자동 생성했습니다.
[데이터 전처리 프롬프트]
첨부된 두 개의 CSV 파일(
macro_data.csv,logistics_data.csv)을 'Date' 열을 기준으로 병합하고, 주요 거시경제 지표와 물류비 간의 상관관계를 보여주는 히트맵 시각화 파이썬 코드 를 작성해 줘.
Python
import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns
# 공공데이터 및 거시지표 데이터 로드
macro_data = pd.read_csv('macro_data.csv')
logistics_data = pd.read_csv('logistics_data.csv')
# 데이터 병합 (Date 기준)
merged_data = pd.merge(macro_data, logistics_data, on='Date', how='inner')
# 상관관계 분석
corr = merged_data.corr()
# 시각화 (히트맵)
plt.figure(figsize=(10, 8))
sns.heatmap(corr, annot=True, cmap='coolwarm', fmt='.2f')
plt.title('Macro Indicators vs Logistics Costs Correlation')
plt.show()
결과와 배운 점
배운 점과 나만의 꿀팁: AI에게 한 번에 논문 전체를 요청하지 않고, '선행연구 요약' -> '데이터 전처리' -> '분석 코드 작성' 등 단계별로 쪼개어 지시하는 것(하네스 엔지니어링)이 훨씬 정확하고 고품질의 결과를 낸다는 것을 배웠습니다.
과정 중에 겪은 시행착오: NotebookLM이 가끔 선행연구의 변수를 혼동하는 환각(Hallucination) 현상이 있었습니다. AI가 정리해 준 결과물이라도 핵심적인 연구 방법론이나 결론은 반드시 원문 PDF를 열어 교차 검증해야 함을 깨달았습니다.
도움이 필요한 부분: 향후 Cursor IDE를 활용해 VAR, LSTM 같은 고급 시계열 분석 모델을 돌려보려고 합니다. 시계열 모델의 하이퍼파라미터 튜닝을 AI에게 지시할 때 효과적인 프롬프트 노하우가 있다면 조언 부탁드립니다!
앞으로의 계획: 전처리가 끝난 공공데이터를 바탕으로 본 분석을 완료하고, Claude Project 기능을 활용해 학회지 양식에 맞춰 논문 초고를 다듬어 투고할 계획입니다.
도움 받은 글 (옵션)
22기 AI논문 1주차 스터디 영상