여자가 컴퓨터 화면 앞의 책상에 앉아 있습니다.
“강의나 세미나에서 캡처한 이미지들의 내용을 나중에 다시 찾고 분석할 수 있다면, 매일의 학습이 더 의미 있게 쌓이지 않을까?”
라는 궁금증이 이번 프로젝트의 시작이었습니다.
이 생각은 2회차 Obsidian 오프라인 모임에서 더 구체화되었습니다.
옆자리에서 함께 참여한 선생님께서, 이미지 자료를 나중에 분석하거나 요약해 활용하고 싶다고 말씀하셨거든요.
처음에는 “이미지 를 매번 AI로 분석”하는 방식을 고민했으나, 불필요한 리소스가 많이 들겠다고 판단했습니다.
그러다 “이미지를 저장하는 그 순간 텍스트를 미리 추출해둘까?” 하는 발상을 떠올렸고,
이를 구현하기 위해 Obsidian, CLOVA OCR, OpenAI를 결합한 시스템을 만들게 되었어요.
01. 소개
왜 이미지 OCR 자동화인가?
캡처한 이미지 속 내용을 시간이 지난 뒤에 다시 찾으려면, “특정 키워드”가 필요합니다.
그러나 이미지 상태에서는 검색이 어렵고, AI로 매번 해석하려면 비용과 시간이 큽니다.
저장 순간에 OCR(글자 추출) + GPT(문단·섹션 정리) 작업을 마쳐두면, 나중에 Smart Composer(GPT 검색) 등으로 바로 검색할 수 있습니다.
무엇보다 “이미지 + 추출 텍스트”가 함께 있으면, 맥락을 이해하고 재활용하기 쉬워집니다.
02. 진행 방법
어떤 도구를 썼나?
🔹 Local Images Plus (Obsidian 플러그인)
이미지를 MD5로 최적화하고, 노트와 동일 경로(
_resources/…)에서 관리해주는 플러그인입니다.노트를 삭제하면 해당 이미지도 함께 정리해주어, 노트·이미지 매핑이 자연스럽게 해결됩니다.
용량이 큰 이미지도 Obsidian Vault 내에서 깔끔히 관리 가능하죠.
덕분에 저에게 필요한:
이미지 업로드 →
Node.js가 OCR+GPT 처리 →
결과를 노트에 자동 삽입
이 흐름이 “_MD5”로 만들어지는 시점을 매번 잡아낼 수 있어, 자동화가 훨씬 쉬워졌습니다.
🔹 CLOVA OCR (API)
네이버 클라우드의 OCR 서비스
1달에 100회 무료라는 점.
(x,y) 좌표까지 제공해 “섹션/리스트” 구분에 도움
한국어 웹 사이트의 스크린 샷
한국어 텍스트가있는 Google 검색 페이지의 스크린 샷
{
"fields": [
{
"valueType": "ALL",
"boundingPoly": {
"vertices": [
{
"x": 65.0,
"y": 31.0
},
{
"x": 228.0,
"y": 31.0
},
{
"x": 228.0,
"y": 70.0
},
{
"x": 65.0,
"y": 70.0
}
]
},
"inferText": "피드백으로",
"inferConfidence": 1.0,
"type": "NORMAL",
"lineBreak": false
},
...
]
}
🔹 OpenAI (API)
OCR 텍스트(좌표 포함)를 문단·섹션·리스트로 정리
한 줄 요약, 새 파일명(확장자 제외), 태그(폴더 경로) 생성
한 번의 프롬프트로 JSON만 반환해 파싱을 간단하게
🔹 Node.js
Watch Folder에서
_MD5이미지를 감시CLOVA OCR 호출
OpenAI로 마크다운+요약+태그를 받아서
Obsidian 노트에 숨김(
%% ... %%) 블록으로 내용 삽입
https://github.com/bytrustu/ocr-obsidian-auto