{
  "id": "e662413c-8e62-4bd9-8467-b8c6f82282a2",
  "url": "https://searchkorea.kr/datasets/geo-lab-fetch-audit-20260914",
  "version": 7,
  "publishedAt": "2026-09-13T17:26:17.320Z",
  "modifiedAt": "2026-09-29T01:45:48.555Z",
  "reviewer": "로컬 편집부",
  "changeNote": "2026-09-29 운영자 요청에 따른 Codex 자체 편집: 단단한중문을 제외한 원고의 독자 질문·사례·설명·결론을 재작성하고 중복 글을 통합했습니다. 공식 자료와 계산을 대조했으며 독립 인적 검수·새 고객 성과·제품 실행을 주장하지 않습니다.",
  "document": {
    "readerIntents": [],
    "readerTools": [],
    "kind": "dataset",
    "slug": "geo-lab-fetch-audit-20260914",
    "title": "조사 부록: 인용 후보 URL의 수집 성공과 누락",
    "summary": "고정 CSV의 행과 fetch 상태를 재집계한 자료입니다. 기업의 AI 인용률이나 고객 성과가 아닙니다.",
    "body": "이 자료의 출발점은 공개 저장소에서 특정 커밋으로 고정한 CSV입니다. 한 행은 원자료의 수집 관측 단위이며 고유 질문이나 고객을 뜻하지 않습니다. 같은 주소나 관련 관측이 여러 행에 존재할 수 있으므로 행 수를 조사 대상 기업 수로 바꿔 읽을 수 없습니다.\n\n표의 fetch_ok는 원자료에 기록된 수집 상태입니다. 성공 행은 페이지를 가져온 범주이고, 실패 행은 내용을 충분히 읽지 못한 범주입니다. 수집이 실패한 이유를 개별 확인하지 않은 상태에서 접근 차단이나 품질 부족으로 단정할 수 없습니다.\n\n성공 행 비율은 같은 집단의 성공 행을 전체 행으로 나눈 값입니다. 이는 원문을 분석할 때 어느 정도 자료가 빠졌는지 보여줍니다. AI가 해당 기업을 추천한 비율, 출처가 정확했던 비율, 고객에게 문의가 온 비율과는 다른 지표입니다.\n\n원자료의 플랫폼 표기는 수집 당시의 분류로 유지했습니다. 이 부록을 현재 플랫폼 순위로 쓰지 마세요. 과거의 별도 인용 기록 기사는 이 방법 설명에 통합했고, 고정 원자료와 집계값은 그대로 보존했습니다.",
    "disclosure": "",
    "authorName": "서치코리아 편집부",
    "authorType": "Organization",
    "verificationSummary": "원행·산식·기존 출처를 보존하며 독자용 소개와 해석 순서를 재편집했습니다. 새로운 제품 실행이나 현장 실측을 추가하지 않았습니다.",
    "publicFiles": [],
    "searchAliases": [],
    "usage": "플랫폼별 전체·성공·비성공 행을 함께 읽으세요. 성공 행만으로 분석하면 누락된 문서의 성격을 놓칠 수 있습니다. 원자료 커밋과 재집계 경로는 아래 방법에 남겼습니다.",
    "sourceIds": [
      "5ed5ed9a-3824-4075-bc16-0f6e0bf6d6a3"
    ],
    "columns": [
      "원자료 platform",
      "전체 행",
      "fetch_ok=True",
      "fetch_ok=False",
      "성공 행 비율(%)"
    ],
    "rows": [
      [
        "chatgpt",
        4494,
        3323,
        1171,
        73.94
      ],
      [
        "google",
        8476,
        6385,
        2091,
        75.33
      ],
      [
        "perplexity",
        10775,
        8443,
        2332,
        78.36
      ]
    ],
    "columnDefinitions": [
      {
        "name": "원자료 platform",
        "type": "string",
        "unit": "",
        "description": "원 저자가 저장한 플랫폼 표기. 현재 제품 전체를 대표하지 않음.",
        "missingValues": []
      },
      {
        "name": "전체 행",
        "type": "integer",
        "unit": "행",
        "description": "고정 CSV를 플랫폼별로 분류한 원자료 행 수.",
        "missingValues": []
      },
      {
        "name": "fetch_ok=True",
        "type": "integer",
        "unit": "행",
        "description": "같은 platform 표기에서 fetch_ok가 문자열 True인 원자료 행 수. AI 인용 성공 횟수가 아니다.",
        "missingValues": []
      },
      {
        "name": "fetch_ok=False",
        "type": "integer",
        "unit": "행",
        "description": "같은 platform 표기에서 fetch_ok가 문자열 False인 원자료 행 수. 재열람한 고정 파일에는 True·False 외의 값이 없음을 확인했다.",
        "missingValues": []
      },
      {
        "name": "성공 행 비율(%)",
        "type": "number",
        "unit": "%",
        "description": "같은 표기의 fetch_ok=True 행 수 / 전체 행 수 × 100, 소수 둘째 자리 반올림.",
        "missingValues": []
      }
    ],
    "license": "CC-BY-4.0",
    "licenseUrl": "https://creativecommons.org/licenses/by/4.0/",
    "rightsStatement": "서치코리아가 계산한 집계표와 해설을 CC BY 4.0으로 제공한다. 원자료 출처: GEO Citation Lab contributors, GEO Citation Lab, https://github.com/yaojingang/geo-citation-lab. 원자료의 원문 행·제3자 저작물의 권리는 별개이며 이 표에 포함하지 않았다.",
    "method": "고정 커밋 25dd7e66324e4acd005ef146d38f57d87b6977df의 CSV를 읽었다. SHA-256=d67ca08531cbc72347d02fda186e8aa5650866930b13c08acfc26888959dca67. 모든 행을 platform별로 분류하고 fetch_ok가 문자열 True인 행을 셌다. 성공 행 비율=성공/전체×100, 소수 둘째 자리 반올림. 아래 기간은 원 실험 기간이 아니라 이 재집계일이다.",
    "reproductionPath": "/research/audit-dataset.py",
    "periodStart": "2026-09-13T17:26:12.183Z",
    "periodEnd": "2026-09-13T17:26:12.183Z",
    "limitations": "원 질문·수집 실험은 재현하지 않았다. 행 수는 독립 질문 수가 아니며 성공 비율은 AI 인용률·정확도·고객 성과가 아니다."
  },
  "relationships": {
    "about": []
  }
}