소개
금번 실습 과제는 뉴스 기사 Web Scraping 후에 구글 독스에 저장하는 것입니다. (1주차 목표) 그 이후는 해당 자료를 이용하여 Web Page Upload 또는 다양한 Messanger에 사용 할수도 있습니다
오랫동안 공부하고 준비한 것들이 향후 어떻게 풀어 나가야 겠다는 생각이 좀 더 선명해 지고 있습니다. Business를 시작하더라고 어떻게 내가 하는 일을 알리고 고객들을 유입 시켜야 하는데 그 첫 단추로 그들이 원하는 정보를 가볍게 제공하는 것 부터 시작해야 겠다고 생각했고 지금 배우는 것들이 첫번째 단계인듯 합니다
진행 방법
전체 Process는 아래와 같이 뉴스 기사 전체 HTML을 받은 이후 그 중 Top News 10개에 대한 Title 과 Link를 받아 제목과 내용을 Set로 요약하여 Google Docs에 저장하는 것입니다.
어두운 화면의 설정 스크린샷
1단계 : 전체 기사를 받아 온다
2단계 : 전체 기사에서 Title 과 Link를 받는데 Seletor로 정확한 위치를 찾아 내는 부분이 매우 중요함
이번 경우는 div id = #skin9 으로 처리하였다 { "html": "{{1.data}}", "selector": "#skin-9" }
다양한 프로그램이 포함된 컴퓨터 화면의 스크린샷
참고 : 그러나 다른 Web Site 는 class로 받아야하는 경우가 있으며 이는 추가 연구 예정임
내가 추가로 정리하고 싶은 부분은 바로 화장품 신문 Beautynuri 이며
다음번엔 해당 Top News의 Selector를 찾아내어 정리해 보고자 함
3단계 : Iterator - 10개 묶음으로 받은 링크를 따로 갈라 주는 역할
위의 왼쪽 화면이 10개 기사의 제목과 링크를 정리한 내용임
4단계 : Delay Tools. : "Rate Limit Error" 오류 해결 목적 (다른 사람에게는 없지만 나에게만 나타남)
- 원인 : OpenAI API의 분당 토큰 사용량 제한(Rate Limit)을 초과
- 해결 방안 : 가장 간단한 방법으로 분당 토큰 사용량을 줄이기 위해 Delay Tool (7초 지연)을 사용함
위의 Itetator 뒤에 7초 지연 장치를 추가 함
- 오류 이미지