GEO를 공부하며 웹페이지가 검색엔진과 AI에 발견되는 구조를 이해했습니다
소개
이번 스터디에서는 웹페이지가 검색엔진과 AI 시스템에 어떻게 발견되고, 접근되고, 이해되는지를 한 흐름으로 공부했습니다.
처음에는 SEO와 GEO를 검색 결과에 노출시키는 기술 정도로 생각했지만, 공부를 진행하면서 조금 다르게 이해하게 되었습니다.
검색이나 AI 답변에 활용되기 위해 서는 먼저 페이지가 발견되어야 하고, 크롤러가 접근할 수 있어야 하며, HTML과 구조화 데이터를 통해 페이지의 내용과 의미가 제대로 전달되어야 했습니다.
이번 공부의 핵심 흐름은 다음과 같았습니다.
발견:
sitemap.xml접근:
robots.txt구조: HTML
의미: 구조화 데이터
최종 단계: 검색 및 AI 시스템의 노출 후보
한 문장으로 정리하면 다음과 같습니다.
HTML은 문서의 뼈대이고, 구조화 데이터는 의미 설명서이며, robots.txt는 크롤러 출입 안내이고, sitemap.xml은 중요 URL 목록이다.
진행 방법
1. HTML 마크업의 역할 이해하기
HTML은 웹페이지의 콘텐츠와 구조를 브라우저와 검색엔진이 해석할 수 있도록 표시하는 기본 언어입니다.
예를 들어 다음과 같은 코드가 있다면,
<p class="product-description">레몬민트 블렌딩티입니다.</p><p>는 문단이라는 구조를 나타내고, class는 해당 요소에 추가 정보를 부여합니다.
이번 공부를 통해 HTML, CSS, JavaScript의 역할도 구분할 수 있었습니다.
HTML: 내용과 구조
CSS: 색상, 크기, 배치, 반응형 디자인
JavaScript: 클릭, 팝업, 계산, 데이터 요청 등의 동작
HTML만으로도 제목과 문단의 구조를 전달할 수 있지만, 상품명, 가격, 재고 상태처럼 더 구체적인 의미를 검색엔진과 AI에 설명하려면 구조화 데이터가 필요했습니다.
2. 구조화 데이터의 의미 이해하기
사람은 상품 페이지를 보면 제품명, 가격, 재고 상태를 화면 배치만으로도 쉽게 이해합니다.
하지만 기계는 화면에 표시된 숫자가 상품 가격인지 배송비인지 바로 판단하기 어려울 수 있습니다.
구조화 데이터는 이런 모호함을 줄이기 위해 페이지의 대상과 속성 관계를 명시하는 방식입니다.
예를 들어 사람이 보는 정보가 다음과 같다면,
클리어톤
19,800 원
재고 있음
기계에는 다음과 같은 의미로 설명할 수 있습니다.
대상: Product
이름: 클리어톤
가격: 19800
통화: KRW
재고 상태: InStock
이번에 특히 중요하게 배운 점은 Schema.org와 JSON-LD가 서로 경쟁하는 기술이 아니라는 것이었습니다.
Schema.org: Product, name, price와 같은 공통 어휘 체계
JSON-LD, Microdata, RDFa: 그 어휘를 웹페이지에 기록하는 표현 방식
즉, Schema.org라는 사전을 JSON-LD 형식으로 작성할 수도 있고, Microdata나 RDFa 방식으로 작성할 수도 있습니다.
3. JSON-LD, Microdata, RDFa 비교하기
구조화 데이터를 표현하는 방식은 크게 세 가지로 정리할 수 있었습니다.
JSON-LD
JSON-LD는 화면용 HTML과 기계용 데이터를 분리해 <script> 블록 안에 작성합니다.
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "Product",
"name": "클리어톤",
"description": "레몬민트 블렌딩티",
"brand": {
"@type": "Brand",
"name": "클리어톤"
},
"offers": {
"@type": "Offer",
"priceCurrency": "KRW",
"price": "26900",
"availability": "https://schema.org/InStock"
}
}
</script>기존 HTML 디자인을 거의 건드리지 않고 추가할 수 있고, 수정과 관리가 편하다는 장점이 있습니다.
Microdata
Microdata는 기존 HTML 태그 안에 itemscope, itemtype, itemprop 속성을 직접 추가하는 방식입니다.
화면에 보이는 내용과 데이터가 밀접하게 연결되지만, 구조가 복잡해질수록 HTML이 길어질 수 있습니다.
RDFa
RDFa는 vocab, typeof, property 등의 속성을 HTML에 직접 추가하는 방식입니다.
개체 간의 복잡한 관계를 유연하게 표현하는 데 강점이 있지만, 일반적인 쇼핑몰에서는 상대적으로 관리가 어려울 수 있습니다.
실무적으로는 새롭게 구조화 데이터를 추가할 때 JSON-LD를 먼저 검토하는 것이 효율적이라는 점을 배웠습니다.
다만 이미 Microdata나 RDFa가 정상적으로 작동하고 있다면, 형식만을 이유로 반드시 교체할 필요는 없습니다.
4. 검색엔진의 처리 흐름 이해하기
검색엔진이 페이지를 처리하는 과정은 다음과 같이 정리할 수 있었습니다.
URL을 발견한다.
해당 URL에 접근할 수 있는지 확인한다.
페이지를 렌더링하고 내용을 이해한다.
구조화 데이터를 통해 의미와 관계를 해석한다.
색인과 노출 여부를 판단한다.
이 과정에서 각각의 기술은 서로 다른 역할을 합니다.
내부 링크, 외부 링크, sitemap.xml: URL 발견
robots.txt, 서버 응답: 크롤링 접근
HTML, JavaScript, 본문: 페이지 구조와 내용
구조화 데이터: 제품, 가격, 작성자 등의 의미
품질, 중복, 신 뢰성, 관련성: 색인과 노출 판단
좋은 콘텐츠가 있더라도 크롤러가 페이지를 발견하거나 접근하지 못하면 검색과 AI 시스템이 내용을 활용하기 어렵다는 점을 이해하게 되었습니다.
5. robots.txt의 역할 이해하기
robots.txt는 검색엔진 크롤러에게 사이트의 어떤 경로에 접근할 수 있는지 안내하는 파일입니다.
예시는 다음과 같습니다.
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Sitemap: https://www.example.com/sitemap.xml각 지시어의 의미는 다음과 같습니다.
User-agent: 규칙을 적용할 크롤러Allow: 크롤링을 허용할 경로Disallow: 크롤링하지 말아 달라고 안내할 경로Sitemap: 사이트맵의 위치
중요한 점은 robots.txt가 보안 장치가 아니라는 것입니다.
악성 크롤러는 robots.txt를 무시할 수 있고, Disallow 경로는 파일을 열어보면 누구나 확인할 수 있습니다.
따라서 민감한 페이지는 로그인, 권한, 비밀번호 등 서버의 접근 통제로 보호해야 합니다.
또한 robots.txt와 noindex는 목적이 다릅니다.
robots.txt: 크롤링 접근 제어
noindex: 검색 색인 제외
로그인 및 권한 통제: 실제 접근 제한
페이지에 noindex를 설정해도 robots.txt로 크롤링을 먼저 막으면 검색엔진이 noindex 태그를 읽지 못할 수 있기 때문에 두 설정을 목적에 맞게 구분해야 합니다.
6. sitemap.xml의 역할 이해하기
sitemap.xml은 검색엔진에 사이트의 중요 URL을 알려주는 XML 형식의 사이트 지도입니다.
예시는 다음과 같습니다.
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://www.example.com/</loc>
<lastmod>2026-08-01</lastmod>
</url>
<url>
<loc>https://www.example.com/products/cleartone</loc>
<lastmod>2026-07-28</lastmod>
</url>
</urlset>사이트맵에는 검색 노출을 원하는 대표 URL을 포함하는 것이 좋습니다.
포함을 검토할 수 있는 페이지는 다음과 같습니다.
홈페이지
상품 상세페이지
카테고리 페이지
브랜드 소개
공개 FAQ
유용한 콘텐츠 글
반대로 다음 페이지는 일반적으로 제외를 검토합니다.
관리자 페이지
장바구니
결제 과정
회원 개인 페이지
테스트 및 오류 페이지
중복 URL
noindex 대상 페이지
다만 사이트맵에 URL을 넣었다고 해서 검색 색인이나 상위 노출이 자동으로 보장되는 것은 아닙니다.
사이트맵은 검색엔진에 “이 페이지들을 확인해 주세요”라고 알려주는 목록이지, 검색 결과에 노출되는 것을 보장하는 합격증은 아닙니다.
7. robots.txt, sitemap.xml, noindex의 관계 정리하기
이번 공부를 통해 세 가지 요소가 서로를 대체하는 기술이 아니라는 점을 알게 되었습니다.
robots.txt: 크롤러가 어디에 접근할 수 있는가
sitemap.xml: 어떤 중요 URL이 존재하는가
noindex: 해당 페이지를 검색 색인에 넣을 것인가
특히 다음과 같은 설정은 피해야 합니다.
Disallow: /products/cleartone<loc>https://example.com/products/cleartone</loc>사이트맵에서는 중요하다고 제출하면서 robots.txt에서는 접근을 막으면, 검색엔진에 서로 모순된 신호를 주게 됩니다.
사이트맵이 robots.txt의 차단 설정을 무시하게 만들지는 못합니다.
8. 카페24 자사몰에 사이트맵 적용하기
스터디에서는 카페24 자사몰에서 사이트맵을 활성화하고 검색 도구에 제출하는 실무 과정도 정리했습니다.
카페24에서 사이트맵을 활성화하는 순서는 다음과 같습니다.
카페24 쇼핑몰 관리자에 로그인합니다.
쇼핑몰 설정 > 기본 설정 > 쇼핑몰 정보 > 검색 엔진 최적화(SEO)로 이동합니다.고급 설정을 엽니다.
사이트맵 및 RSS 피드에서 사이트맵 사용을
사용함으로 설정합니다.저장 후 사이트맵 파일 생성을 기다립니다.
경로 복사버튼으로 실제 사이트맵 URL을 확인합니다.
사이트맵이 생성되면 브라우저에서 직접 열어 XML이 정상적으로 표시되는지 확인해야 합니다. 사이트맵 주소는 https://www.cleartoneofficial.com/sitemap.xml 이런식으로 생성됩니다.
그다음 Google Search Console과 NAVER Search Advisor에서 사이트 소유권을 확인하고 사이트맵을 제출할 수 있습니다.
제출 후에는 다음 항목을 확인해야 합니다.
사이 트맵 상태
마지막으로 읽은 날짜
발견된 페이지 수
처리 오류
도메인 일치 여부
사이트맵에 포함된 실제 URL
카페24 기본 사이트맵은 진열되고 판매되는 상품을 중심으로 구성될 수 있기 때문에 브랜드 소개, 원료 설명, FAQ 같은 별도 콘텐츠 페이지가 포함되어 있는지는 XML을 직접 확인해야 합니다.
결과와 배운 점
이번 공부를 통해 SEO와 GEO를 단순히 노출 순위를 높이는 기술로만 보면 안 된다는 것을 배웠습니다.
검색엔진과 AI 시스템에 활용되기 위해서는 다음 과정이 함께 갖춰져야 합니다.
sitemap.xml과 링크를 통해 URL이 발견되어야 합니다.
robots.txt와 서버 설정이 접근을 허용해야 합니다.
HTML을 통해 페이지 구조와 본문을 읽을 수 있어야 합니다.
구조화 데이터를 통해 제품, 가격, 브랜드 등의 의미가 명확해야 합니다.
콘텐츠의 품질, 신뢰성, 독창성, 관련성이 뒷받침되어야 합니다.
특히 구조화 데이터만 추가한다고 검색 상위 노출이나 AI 답변 인용이 보장되는 것은 아니라는 점이 중요했습니다.
기술 설정은 검색엔진과 AI가 페이지를 읽을 수 있는 기반을 만드는 과정이고, 실제 노출을 위해서는 좋은 원문 콘텐츠와 사용자 가치가 함께 필요합니다.
앞으로 클리어톤 자사몰에는 다음 순서로 적용해 볼 계획입니다.
sitemap.xml 활성화 및 제출
robots.txt와 noindex 설정 점검
제목, H1, 본문, canonical, 모바일 표시 확인
Product, Organization, Article 등의 JSON-LD 검토
브랜드 소개, 제품 차이, 원료 설명, 섭취 방법, FAQ 콘텐츠 보완
Search Console과 NAVER Search Advisor를 통한 수집 및 색인 상태 확인
이번 스터디를 통해 웹페이지는 단순히 화면에 잘 보이도록 만드는 것에서 끝나는 것이 아니라, 검색엔진과 AI가 발견하고 접근하고 이해할 수 있도록 설계해야 한다는 점을 배웠습니다.
최종적으로 이번 공부를 한 문장으로 정리하면 다음과 같습니다.
sitemap.xml이 중요 URL의 존재를 알리고, robots.txt가 크롤러의 접근 범위를 안내하며, HTML이 페이지 구조를 제공하고, Schema.org 구조화 데이터가 내용의 의미와 관계를 명확하게 설명한다.
도움 받은 글
GEO 노출전략 스터디