매일 아침 "과일 산업 뉴스"만 걸러주는 스킬

매일 아침 "과일 산업 뉴스"만 걸러주는 스킬을 만들어봤습니다

왜 만들었나

매일 아침 네이버 뉴스에서 과일 관련 기사를 찾아보는 게 은근히 번거로웠습니다. 검색해보면 진짜 필요한 정보(도매가, 작황, 유통 이슈)보다 마트 할인 행사나 무관한 기사가 훨씬 많이 섞여 나오거든요. 그래서 "그냥 매일 아침 이거 하나 돌리면 끝나는 스킬"을 만들어보기로 했습니다.

처음 생각은 단순했는데

처음엔 "네이버 뉴스 API로 검색해서 요약해주면 되겠지" 정도로 생각했습니다. 근데 실제로 API를 직접 호출해보니 생각보다 문제가 많았어요.

  • "과일"로만 검색하면 전체 127만 건이 나오는데, 최신순 상위 8개 중 6개가 에어컨 AS 예약, 이란 경제 위기, 군부대 급식 비리 같은 완전 무관한 기사였습니다. 그냥 "과일"이라는 단어가 어디 한 줄 섞여 있던 것뿐이었죠.

  • "과일 수입"처럼 흔한 단어 조합으로 검색하면 결과가 또 완전히 다르게 튑니다 (여행 후기, 비료 얘기까지 섞여 나옴).

  • 같은 기사가 언론사만 바꿔서 3~4번씩 재게재되는 경우도 많아서, 중복 제거를 안 하면 브리핑이 온통 같은 얘기로 도배됩니다.

이런 걸 미리 발견한 게 도움이 많이 됐습니다. "이럴 것 같다"가 아니라 실제로 검색을 돌려보고 안 되는 걸 확인한 다음에 설계를 짰거든요.

설계는 계속 뒤집혔습니다

처음 만든 계획을 리뷰 받으면서 꽤 많이 갈아엎었습니다. 예를 들면:

  • "오늘의 신호 3건" 고정이 아니라 0~3건으로. 뉴스가 별로 없는 날도 억지로 3개를 채우면, 그런 날이 반복될수록 신뢰가 떨어지겠더라고요. 없으면 "없다"고 말하는 게 맞다는 쪽으로 바꿨습니다.

  • 매체 신뢰도와 정보 신뢰도를 분리. 전문지가 쓴 기사라고 그 안의 모든 문장이 다 정확한 건 아니었습니다. 같은 기사 안에서도 "통계 수치"는 믿을 만하고, "관계자 한 명의 주장"은 따로 취급해야 하더군요.

  • 기사가 아니라 "사건"을 기억하게. 같은 사건이 며칠에 걸쳐 재보도될 때, 그때마다 "새 소식"으로 착각하면 안 되니까요. 어제 다룬 얘기가 오늘 새 숫자 없이 그대로 반복되면 브리핑에서 빼는 구조를 넣었습니다.

만들다 보니 새로 생긴 기능도 있어요

원래는 "업계 관점"만 생각했는데, 만들면서 "소비자 관점에서 재밌는 소재도 따로 모으면 좋겠다"는 니즈가 생겼습니다. 재밌었던 건 — 업계 기준으로 걸러서 버리던 기사들이 오히려 마케팅 소재로는 원석이었다는 점이에요. "백화점 과일 할인 행사" 같은 건 업계 신호로는 시시하지만, 소비자 콘텐츠 소재로는 꽤 쓸 만하거든요. 그래서 아예 필터를 "삭제"가 아니라 "다른 쪽으로 보내는" 구조로 바꿨습니다.

실제로 돌려보니

오늘 처음 실행해봤는데, 재밌는 게 하나 걸렸습니다. "폭염 때문에 추석 과일값이 비상"이라는 언론 보도가 여러 건 나왔는데, 바로 다음 날 정부가 "피해의 99%가 경남 한 지역에 몰려있고, 사과·배는 전국 비중이 5~11%뿐이라 영향은 제한적"이라는 공식 반박자료를 낸 걸 발견했습니다. 원문까지 확인해서 두 주장을 같이 정리해뒀는데, 이런 "언론 프레임 vs 공식 데이터" 충돌을 잡아내는 게 이 스킬을 만든 진짜 이유였다는 생각이 들었습니다.

느낀 점

혼자 설계를 짤 때는 "이 정도면 됐다" 싶은 지점이 실제로는 허점투성이인 경우가 많았습니다. 특히 겉보기엔 멀쩡한데 알고보면 이상한 부분들(예: 같은 사건에 매번 다른 이름표를 붙이면 "기억"이 무용지물이 되는 것)은 혼자서는 놓치기 쉬웠어요. 이번엔 설계 단계에서 미리 검증해보고, 실제 데이터로 확인해보는 과정을 여러 번 거친 덕분에 처음 실행에서도 꽤 쓸 만한 결과가 나왔습니다.

2
2개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.