제품 카탈로그가 PDF인 제조기업, SearchGPT 추천 목록에서 사라지는 구조적 이유
2026년 07월 31일
#생성형 엔진 최적화
#GEO 마케팅
#SearchGPT 상위 노출
#구글 AI 오버뷰 최적화
#B2B 마케팅 대행사

요약

  • 2026년 B2B 바이어의 60% 이상이 SearchGPT·Perplexity 같은 AI 검색으로 공급업체를 찾지만, PDF·이미지 카탈로그는 LLM 크롤러가 읽지 못해 추천 목록에서 통째로 누락됩니다.
  • 문제의 핵심은 키워드 부족이 아니라 데이터 구조의 부재입니다. AI는 비정형 파일을 '기계적 암흑지대'로 인식합니다.
  • 500만 원 이하 예산으로도 카탈로그를 HTML 테이블·JSON-LD 스키마·청크 단위 본문으로 재가공하면 AI 인덱싱 가시성을 실질적으로 높일 수 있습니다.
  • 이 글은 진단형 구조로 설계되어 있습니다. 증상 확인 → 원인 분해 → 우선순위별 처방 순서로 읽으면 즉시 실행 계획을 세울 수 있습니다.

증상 확인: 우리 회사가 AI 추천 목록에 없는지 먼저 확인하세요

SearchGPT나 Perplexity에 이렇게 입력해 보세요.

*"CE 인증과 ASTM F899 규격을 준수하는 한국의 정밀 스테인리스 벨로우즈 제조업체를 추천해줘."

경쟁사 이름은 나오는데 우리 회사가 없다면, 기술력이 부족한 게 아닙니다. AI가 우리 제품 데이터를 읽지 못하고 있는 것입니다.

이 상황이 왜 심각한지 수치로 보면 이렇습니다. AI 답변 내에 직접 인용된 브랜드의 오가닉 웹사이트 유입은 평균 35% 증가한 반면, AI Overview가 활성화된 검색에서 일반 검색 결과 1위 링크의 클릭률은 58~61% 급락했습니다. 노출 경쟁의 판이 완전히 바뀐 것입니다.


원인 분해: PDF 카탈로그가 AI에게 '보이지 않는' 이유

LLM 크롤러는 텍스트 벡터만 읽습니다

AI 검색 엔진은 사용자 질문과 웹페이지 데이터 사이의 코사인 유사도를 계산해 답변 재료를 고릅니다. 이 계산의 전제는 '텍스트가 추출 가능한 상태'입니다.

문제는 대부분의 강소 제조기업 홈페이지 구조입니다.

  • 제품 상세페이지: 디자인 이미지 한 장으로 구성
  • 스펙 정보: 다운로드 링크로 연결된 PDF 파일 안에만 존재
  • 인증 정보: 이미지 스캔본 형태로 업로드

이 상태에서는 GPTBot이나 Perplexity 크롤러가 페이지를 방문해도 의미 있는 텍스트를 추출하지 못합니다. 수치, 허용 오차, 인증 규격, 원재료 같은 핵심 정보가 기계 입장에서는 존재하지 않는 것과 같습니다.

비정형 데이터의 세 가지 유형과 위험도

유형 예시 AI 인덱싱 위험도
이미지형 상세페이지 JPG/PNG 한 장짜리 제품 소개 매우 높음
스캔 PDF 카탈로그 텍스트 레이어 없는 PDF 높음
줄글 나열형 본문 단락 구분 없이 이어진 사양 설명 중간

줄글도 위험합니다. AI는 페이지를 300~500자 단위 청크로 잘라 벡터화하는데, 구조 없이 이어진 텍스트는 청킹 과정에서 핵심 사양이 엉뚱한 단락에 섞여버립니다.


진단 절차: 내 홈페이지 카탈로그의 AI 가독성 자가 점검

아래 네 가지를 직접 확인해 보세요. 하나라도 해당하면 GEO 재가공이 필요합니다.

① 크롬 개발자 도구로 텍스트 추출 테스트 제품 상세페이지에서 Ctrl+U로 소스 보기를 열어 실제 수치(예: "316L", "250°C", "15 bar")가 HTML 텍스트로 존재하는지 확인합니다. 이미지 태그(img src=...)만 보인다면 AI는 그 정보를 읽지 못합니다.

② Google Search Console 크롤링 오류 확인 색인이 안 된 페이지 목록을 보면 카탈로그 페이지가 포함되어 있는 경우가 많습니다. GPTBot도 구글 봇과 유사한 방식으로 접근하므로 이 신호는 GEO에도 유효합니다.

③ 구조화 데이터 유무 확인 Google의 Rich Results Test(search.google.com/test/rich-results)에 제품 URL을 입력합니다. Product 스키마가 없다면 AI 크롤러는 엔티티 속성을 즉각 파악하지 못합니다.

④ 인증 정보의 텍스트 존재 여부 "CE", "ISO 9001", "RoHS" 같은 인증 규격이 이미지 파일 안에만 있고 HTML 본문에 없다면, 바이어가 인증 기준으로 검색할 때 완전히 배제됩니다.


우선순위별 처방: 500만 원 이하 예산 배분 실무 프레임워크

1순위: 비정형 카탈로그 텍스트화 및 HTML 테이블 전환 (예산: 약 100만 원)

가장 먼저, 가장 중요한 제품 20~30종의 사양을 HTML 본문 안으로 꺼내야 합니다.

실행 방법:

  • Adobe Acrobat 또는 무료 OCR 툴로 PDF에서 텍스트 추출
  • 제품별 독립 URL 페이지 생성 (여러 제품을 한 페이지에 나열하지 않음)
  • 수치·규격·원재료를 줄글이 아닌 HTML 테이블 형식으로 게시

왜 테이블인가? 정보를 잘 정리된 표 형태로 제공한 콘텐츠는 줄글 콘텐츠에 비해 AI에게 인용될 확률이 2.5배 높다는 연구 결과가 있습니다. 테이블은 행-열 구조 자체가 속성-값 관계를 명시하기 때문에 LLM이 엔티티를 파악하기 훨씬 쉽습니다.

Before / After 비교:

  • Before: "업계 최고의 초정밀 기술로 만든 최상의 내열 밸브입니다."
  • After: "영하 50°C~영상 250°C 환경에서 최대 15 bar 가스 압력을 견디는 반도체 공정용 벨로우즈 밸브 (CE 인증, ASTM F899 준수)"

AI는 주관적 수식어를 불신합니다. 사실, 수치, 인증 데이터로만 채워야 합니다.

2순위: JSON-LD Product 스키마 마크업 적용 (예산: 약 150만 원)

스키마 마크업은 AI 크롤러가 자연어 처리를 하기도 전에 페이지 엔티티를 즉각 파악하게 해주는 코드입니다. 워드프레스 플러그인이나 개발사 외주로 핵심 제품에 아래 구조를 적용합니다.

{
  "@context": "https://schema.org/",
  "@type": "Product",
  "name": "정밀 스테인리스 벨로우즈 밸브 SV-300",
  "material": "Stainless Steel 316L",
  "mpn": "SV-300-SS",
  "description": "CE 인증 및 ASTM F899 규격 준수, 고진공 반도체 공정용"
}

certification, material, mpn 속성은 B2B 바이어가 AI에게 던지는 질문 패턴과 직접 매핑됩니다. 이 필드가 채워져 있으면 "CE 인증 한국 제조사" 같은 쿼리에서 매칭 확률이 크게 올라갑니다.

3순위: RAG 친화적 청크 단위 본문 구성 (예산: 내부 인력 공수)

AI 검색 엔진은 페이지 전체를 읽는 게 아니라 300~500자 단위로 잘라 벡터화합니다. 이 청킹 과정에서 정보가 유실되지 않으려면 본문 구조 자체를 청크 단위로 설계해야 합니다.

실행 원칙:

  • 소제목(H2, H3)마다 그 단락에서 다루는 핵심 속성을 명시
  • 단락 첫 문장에서 핵심 정보를 두괄식으로 제시
  • 마케팅 수식어 없이 객관적 정의로 시작

예시: "SV-300은 고진공 환경용 벨로우즈 밸브입니다. 작동 온도 범위는 -50°C~250°C이며, 최대 허용 압력은 15 bar입니다."

이렇게 구성하면 AI가 해당 청크만 잘라내도 완결된 팩트가 됩니다.

4순위: 저비용 오프페이지 멘션 캠페인 (예산: 약 150만 원)

AI 엔진은 자사 주장보다 제3의 권위 있는 소스에서 언급된 내용을 더 신뢰합니다. 링크 없는 단순 브랜드 멘션만으로도 AI 인덱스 내 브랜드 지위가 올라갑니다.

실행 방법:

  • Kompass, 국내외 정부 제조업체 풀, 산업 디렉토리에 기업 정보와 제품군 사양 등록
  • 저예산 언론 보도 배포 (제품 인증 취득, 수출 실적 등 팩트 중심)
  • 업종별 협회 홈페이지 회원사 소개란 활용

피해야 할 두 가지 흔한 실수

실수 1: FAQ만 잔뜩 추가하기

GEO 최적화라고 하면 FAQ 섹션을 늘리는 방법을 먼저 떠올리는 경우가 많습니다. 그런데 Zhang et al.(2026) 연구에 따르면 단순 FAQ 중심 포맷 전환은 기계 인용 확률을 오히려 5.74% 감소시켰습니다. 제조 분야 RAG에서는 "명확한 정의 + 수치 테이블" 포맷이 훨씬 효율적입니다.

실수 2: 기술적 SEO를 무시하기

GEO는 기술적 SEO 위에서 작동합니다. 크롤러 접근이 차단되어 있거나 LCP(최대 콘텐츠풀 페인트) 속도가 느리면 구조화 데이터를 아무리 잘 심어도 AI가 페이지를 제대로 읽지 못합니다. 스키마 작업 전에 robots.txt에서 GPTBot 차단 여부를 반드시 확인하세요.


자주 묻는 질문 (FAQ)

Q1. 홈페이지 리뉴얼 없이 카탈로그 구조화만 해도 효과가 있나요?

네, 가능합니다. 전체 리뉴얼보다 핵심 제품 페이지의 텍스트 구조화와 스키마 마크업이 GEO 관점에서 훨씬 우선순위가 높습니다. 리뉴얼은 오히려 URL 구조 변경으로 기존 인덱싱을 초기화할 위험이 있습니다.

Q2. JSON-LD 스키마는 직접 작업할 수 있나요?

워드프레스 환경이라면 Rank Math나 Schema Pro 플러그인으로 코딩 없이 적용 가능합니다. 커스텀 빌드 사이트라면 개발사에 핵심 제품 20~30종 한정으로 외주를 맡기는 것이 현실적입니다.

Q3. 효과가 나타나기까지 얼마나 걸리나요?

GPTBot이나 Perplexity 크롤러는 구글보다 크롤링 주기가 짧은 편입니다. 구조화 작업 완료 후 통상 4~8주 내에 AI 검색 결과 내 노출 변화를 체감할 수 있습니다. 단, 오프페이지 멘션은 누적 효과이므로 3개월 이상의 시야가 필요합니다.

Q4. 영문 페이지도 따로 만들어야 하나요?

해외 바이어를 타깃으로 한다면 필수입니다. SearchGPT는 영문 쿼리에 영문 소스를 우선 인용합니다. 핵심 제품 10종에 대해 영문 스펙 페이지와 영문 JSON-LD를 별도로 구성하는 것을 권장합니다.

Q5. 인증 이미지 파일은 어떻게 처리해야 하나요?

이미지 파일은 그대로 두되, 반드시 HTML 본문에 인증 명칭·번호·유효기간을 텍스트로 병기해야 합니다. 이미지의 alt 텍스트에도 "CE 인증서 EN 13480-3" 형식으로 구체적인 규격명을 기재하세요.


마치며

기술력이 있어도 AI가 읽지 못하면 존재하지 않는 것과 같습니다. 2026년의 B2B 검색 경쟁은 키워드 싸움이 아니라 데이터 구조의 싸움입니다.

500만 원 이하 예산으로 시작할 수 있는 가장 확실한 첫 걸음은, 지금 당장 핵심 제품 5종의 상세페이지 소스를 열어 수치 데이터가 텍스트로 존재하는지 확인하는 것입니다.

ADALL(에이달)은 제조 B2B 기업의 비정형 카탈로그를 AI 친화적 LLM 인덱싱 구조로 재가공하는 GEO 실무 프로젝트를 진행하고 있습니다. 어디서부터 손을 대야 할지 막막하다면, 현재 홈페이지의 AI 가독성 진단부터 시작해 보세요.

📞 02-2664-8631 | 📧 master@adall.co.kr

프로젝트 문의는 부담 없이 연락 주세요. 현황 파악 후 우선순위에 맞는 실행 방향을 함께 설계해 드립니다.

무료 컨설팅 받아보고 싶다면?

무료 컨설팅 신청하기