doc-scraper: LLM을 위한 로컬 문서 컨텍스트를 구축하는 Go 크롤러
doc-scraper는 Sriram PR에 의해 개발된 도구로, 기술 웹사이트 문서를 수집하고 AI 지원 워크플로우에 맞게 준비합니다. 이 앱은 문서 사이트를 크롤링하여 모델 컨텍스트로 사용하기에 최적화된 읽기 쉬운 콘텐츠를 추출하며, 개발자와 AI 연구자를 대상으로 합니다. 깨끗하고 검색 가능한 출력과 로컬 지식 저장소를 강조하여 편집기 기반의 도우미가 프롬프트 구성 중에 시끄러운 웹 페이지를 불러오지 않고도 관련 참조 자료에 접근할 수 있도록 합니다.
사이트 HTML을 모델 컨텍스트에 적합한 구조화된 Markdown으로 변환합니다
이 도구는 문서 HTML을 구조화된 Markdown으로 변환하는 Go 기반 크롤러로, 탐색 바, 바닥글 및 기타 비내용 크롬을 제거합니다. 변환 과정에서 제목과 인라인 코드를 보존하며 텍스트 노이즈를 줄여, 탐색 컨텍스트를 유지하는 깔끔한 제목과 링크를 통해 다운스트림 모델 워크플로우에서 더 쉽게 검색하고 참조할 수 있는 압축된 코퍼스 파일을 생성합니다.
검색 가능성과 변경 감지가 에이전트에게 신뢰할 수 있는 코퍼스를 만듭니다
이 앱은 오프라인 BM25 검색을 SQLite FTS5를 통해 구현하여 인터넷 접근 없이 크롤링된 코퍼스에 대해 로컬 쿼리를 가능하게 합니다. BadgerDB와 SQLite를 통한 상태 지속성은 재개 가능한 작업과 히스토리 인덱스를 지원합니다. 콘텐츠 인식 차이 메커니즘은 단순히 타임스탬프에 의존하는 대신 실제 페이지 변경을 식별하여 불필요한 다운로드를 줄이고 로컬 코퍼스가 실질적인 편집에 집중하도록 유지합니다.
입력 패턴과 크롤링 한계가 성공을 정의합니다
doc-scraper는 Docusaurus, MkDocs, Sphinx, GitBook 및 ReadTheDocs와 같은 문서 프레임워크를 자동으로 감지하고, 익숙하지 않은 사이트에서는 가독성 기반 추출기를 사용합니다. 크롤링은 공유 리소스 관리 및 내장된 속도 제한과 함께 병렬로 실행되며, 크롤러는 로봇.txt를 준수하여 예의 바르게 유지합니다. 이러한 경계는 과도한 네트워크 부하를 피하면서 개발자 관련 콘텐츠를 추출하는 것을 우선시합니다.
로컬 MCP 호스팅은 편집자 중심 AI 워크플로우 및 개인 정보 요구에 적합합니다
서버 모드에서 실행될 때, 이 앱은 로컬 AI 에이전트가 편집기 내에서 문서를 읽고 검색할 수 있도록 모델 컨텍스트 프로토콜 서버로 작동합니다. 로컬 오프라인 지식 기반 설계는 Claude Desktop, Claude Code 및 Cursor와 같은 에이전트가 검색 가능한 문서를 사용할 수 있도록 하여 원격 검색에 대한 의존성을 줄입니다. 이 도구는 다른 크롤러가 어려움을 겪는 사이트에서 깔끔한 출력을 생성하는 것으로 Go 및 AI 개발자 커뮤니티에서 주목받고 있습니다.
로컬 컨텍스트를 구축하고 호스팅할 수 있는 기술적으로 숙련된 개발자에게 가장 적합합니다.
doc-scraper는 검증 가능한 로컬 호스팅 문서가 모델 컨텍스트로 필요한 개발자와 연구자에게 실용적인 옵션입니다. 이 도구는 Go(버전 1.25 이상)로 소스에서 빌드해야 하므로 기술적으로 능숙한 사용자를 선호합니다. Go 프로젝트를 컴파일할 수 없는 팀은 설정 오버헤드를 예상해야 합니다. 사용자는 권위 있는 모델 입력으로 사용하기 전에 스크랩된 구문을 검사해야 합니다.