Télécharger pour MCP

Regarder une publicité pour télécharger gratuitement

Avis Softonic

doc-scraper : Go crawler qui construit un contexte de documentation local pour les LLMs

doc-scraper, par Sriram PR, collecte la documentation technique des sites Web et la prépare pour des flux de travail assistés par IA. L'application explore les sites de documentation et extrait du contenu lisible optimisé pour être utilisé comme contexte de modèle, ciblant les développeurs et les chercheurs en IA. Elle met l'accent sur une sortie propre et consultable et un magasin de connaissances local afin que les assistants basés sur un éditeur puissent accéder à des documents de référence pertinents sans extraire des pages Web bruyantes lors de la construction de l'invite.

Convertit le HTML du site en Markdown structuré adapté au contexte du modèle

L'outil est un crawler basé sur Go qui convertit le HTML de la documentation en Markdown structuré, supprimant les barres de navigation, les pieds de page et d'autres éléments non liés au contenu. La conversion préserve les titres et le code en ligne tout en réduisant le bruit textuel, produisant des fichiers de corpus compacts qui conservent le contexte de navigation via des titres et des liens propres pour une récupération et une référence plus faciles par les flux de travail des modèles en aval.

La recherche et la détection des changements rendent le corpus fiable pour les agents

L'application intègre une recherche hors ligne BM25 mise en œuvre via SQLite FTS5, permettant des requêtes locales sur le corpus crawlé sans accès Internet. La persistance de l'état avec BadgerDB et SQLite prend en charge les opérations reprenables et un index d'historique. Un mécanisme de diff conscient du contenu identifie les changements réels de page au lieu de se fier uniquement aux horodatages, ce qui réduit les téléchargements redondants et maintient le corpus local concentré sur des modifications substantielles.

Les modèles d'entrée et les limites de crawl définissent où il réussit

doc-scraper détecte automatiquement les frameworks de documentation tels que Docusaurus, MkDocs, Sphinx, GitBook et ReadTheDocs, et utilise un extracteur basé sur la lisibilité sur des sites inconnus. Le crawling s'exécute en parallèle avec une gestion des ressources partagées et une limitation de taux intégrée, et le crawler respecte robots.txt pour rester poli. Ces limites priorisent l'extraction de contenu pertinent pour les développeurs tout en évitant une charge réseau excessive.

L'hébergement local MCP s'adapte aux flux de travail AI centrés sur l'éditeur et aux besoins de confidentialité

Lorsqu'il est exécuté en mode serveur, l'application agit comme un serveur Model Context Protocol afin que les agents AI locaux puissent lire et rechercher de la documentation à l'intérieur des éditeurs. La conception de la base de connaissances locale et hors ligne maintient la documentation consultable disponible pour des agents comme Claude Desktop, Claude Code et Cursor, réduisant la dépendance à la récupération distante. L'outil est reconnu dans les communautés de développeurs Go et AI pour produire une sortie propre sur des sites avec lesquels d'autres scrapers ont des difficultés.

Le mieux adapté aux développeurs techniquement compétents qui peuvent construire et héberger un contexte local

doc-scraper est une option pratique pour les développeurs et les chercheurs qui ont besoin de documentation vérifiable, hébergée localement comme contexte modèle. Comme l'outil nécessite une construction à partir de la source avec Go (version 1.25 ou ultérieure), il favorise les utilisateurs techniquement capables ; les équipes qui ne peuvent pas compiler des projets Go devraient s'attendre à des frais de configuration. Les utilisateurs doivent inspecter les passages extraits avant de les utiliser comme entrées de modèle autorisées.

  • Les plus

    • Convertit la documentation HTML en Markdown propre et structuré pour le contexte du modèle
    • La recherche BM25 hors ligne via SQLite FTS5 permet des requêtes locales sans internet
    • Le crawling incrémentiel et le diff sensible au contenu réduisent les récupérations de pages redondantes
    • Agit en tant que serveur de protocole de contexte de modèle pour l'intégration de l'éditeur
  • Les moins

    • Nécessite une compilation à partir de la source avec Go 1.25 ou ultérieur
    • Le fallback basé sur la lisibilité peut manquer des métadonnées structurées sur des sites non standards
    • La politesse et la limitation de taux peuvent prolonger les temps de crawl de grands corpus
 0/1

Détails

  • Éditeur

  • Licence

    Gratuit

  • Version

    v2.9.2

  • Date de mise à jour

  • Plate-forme

    MCP

  • Langues

    Anglais

Programme disponible dans d’autres langues


Télécharger pour MCP

Regarder une publicité pour télécharger gratuitement


Avis utilisateurs sur doc-scraper

Avez-vous essayé doc-scraper? Soyez le premier à donner votre avis!

Ajouter un avis

Articles les plus récents

Les lois sur l’utilisation des logiciels varient d’un pays à l’autre. Nous n’encourageons ni ne tolérons l’utilisation de ce programme non conforme à la loi.
Connecté à Softonic en tant que