doc-scraper : Go crawler qui construit un contexte de documentation local pour les LLMs
doc-scraper, par Sriram PR, collecte la documentation technique des sites Web et la prépare pour des flux de travail assistés par IA. L'application explore les sites de documentation et extrait du contenu lisible optimisé pour être utilisé comme contexte de modèle, ciblant les développeurs et les chercheurs en IA. Elle met l'accent sur une sortie propre et consultable et un magasin de connaissances local afin que les assistants basés sur un éditeur puissent accéder à des documents de référence pertinents sans extraire des pages Web bruyantes lors de la construction de l'invite.
Convertit le HTML du site en Markdown structuré adapté au contexte du modèle
L'outil est un crawler basé sur Go qui convertit le HTML de la documentation en Markdown structuré, supprimant les barres de navigation, les pieds de page et d'autres éléments non liés au contenu. La conversion préserve les titres et le code en ligne tout en réduisant le bruit textuel, produisant des fichiers de corpus compacts qui conservent le contexte de navigation via des titres et des liens propres pour une récupération et une référence plus faciles par les flux de travail des modèles en aval.
La recherche et la détection des changements rendent le corpus fiable pour les agents
L'application intègre une recherche hors ligne BM25 mise en œuvre via SQLite FTS5, permettant des requêtes locales sur le corpus crawlé sans accès Internet. La persistance de l'état avec BadgerDB et SQLite prend en charge les opérations reprenables et un index d'historique. Un mécanisme de diff conscient du contenu identifie les changements réels de page au lieu de se fier uniquement aux horodatages, ce qui réduit les téléchargements redondants et maintient le corpus local concentré sur des modifications substantielles.
Les modèles d'entrée et les limites de crawl définissent où il réussit
doc-scraper détecte automatiquement les frameworks de documentation tels que Docusaurus, MkDocs, Sphinx, GitBook et ReadTheDocs, et utilise un extracteur basé sur la lisibilité sur des sites inconnus. Le crawling s'exécute en parallèle avec une gestion des ressources partagées et une limitation de taux intégrée, et le crawler respecte robots.txt pour rester poli. Ces limites priorisent l'extraction de contenu pertinent pour les développeurs tout en évitant une charge réseau excessive.
L'hébergement local MCP s'adapte aux flux de travail AI centrés sur l'éditeur et aux besoins de confidentialité
Lorsqu'il est exécuté en mode serveur, l'application agit comme un serveur Model Context Protocol afin que les agents AI locaux puissent lire et rechercher de la documentation à l'intérieur des éditeurs. La conception de la base de connaissances locale et hors ligne maintient la documentation consultable disponible pour des agents comme Claude Desktop, Claude Code et Cursor, réduisant la dépendance à la récupération distante. L'outil est reconnu dans les communautés de développeurs Go et AI pour produire une sortie propre sur des sites avec lesquels d'autres scrapers ont des difficultés.
Le mieux adapté aux développeurs techniquement compétents qui peuvent construire et héberger un contexte local
doc-scraper est une option pratique pour les développeurs et les chercheurs qui ont besoin de documentation vérifiable, hébergée localement comme contexte modèle. Comme l'outil nécessite une construction à partir de la source avec Go (version 1.25 ou ultérieure), il favorise les utilisateurs techniquement capables ; les équipes qui ne peuvent pas compiler des projets Go devraient s'attendre à des frais de configuration. Les utilisateurs doivent inspecter les passages extraits avant de les utiliser comme entrées de modèle autorisées.





