Guides / Pratique
Automatiser l'édition de PDF avec des agents IA et WebMCP
Mis à jour le 2026-08-27 · équipe pdfmend
De nombreuses solutions d'automatisation envoient le PDF à un service distant. pdfmend suit une autre voie : l'éditeur s'exécute dans le navigateur et ses interfaces d'automatisation appellent la même logique locale que les commandes visibles. Une personne peut utiliser l'interface, un agent de type Playwright peut appeler une API versionnée et un agent de navigateur compatible peut découvrir des outils WebMCP. Le document n'a toujours pas besoin d'un service d'envoi pdfmend.
pdfmend est donc prêt pour les agents dans un sens précis et vérifiable. Le site publie des fichiers de découverte lisibles par machine, des sélecteurs stables, des actions structurées et des codes d'erreur explicites. Cela ne signifie pas que chaque assistant IA peut piloter toutes les fonctions, ni que WebMCP est disponible dans tous les navigateurs.
Ce que signifie être prêt pour les agents
Un site adapté aux agents doit leur permettre de découvrir les fonctions, de comprendre les entrées, de savoir si l'éditeur est prêt et de recevoir un résultat ou une erreur structurée. pdfmend propose quatre couches :
- Interface accessible. Les commandes sémantiques, les libellés ARIA et les identifiants de test stables permettent de piloter la même interface qu'une personne.
- API de navigateur versionnée.
window.pdfmend.v1fournit des actions structurées aux automatisations de confiance utilisant Playwright, Puppeteer, Stagehand ou un outil comparable. - Outils WebMCP. Lorsqu'un navigateur ou un pont compatible fournit
document.modelContext, pdfmend enregistre des outils typés dont les résultats contiennent uniquement des métadonnées. - Documentation machine.
llms.txt,llms-full.txt,agents.jsonet le manifeste Agent Skills décrivent le produit, ses interfaces et son contrat de confidentialité.
Ces couches sont indépendantes. Un exécuteur actuel peut utiliser l'API de la fenêtre sans attendre WebMCP natif, tandis qu'un client WebMCP expérimental peut employer le sous-ensemble plus prudent.
Choisir la bonne interface
Utilisez l'interface visible lorsque le flux dépend d'une commande absente du contrat programmatique ou lorsqu'une personne doit vérifier chaque étape. La section Automation de llms.txt décrit les signaux d'état, les rôles et les sélecteurs stables.
Utilisez window.pdfmend.v1 dans une automatisation de confiance qui doit ouvrir des octets PDF, lire la géométrie des pages, ajouter du texte ou des images, réorganiser les pages, annuler des opérations et recevoir une copie exportée. Cette API accepte et renvoie du base64 : l'environnement qui contrôle le navigateur doit donc être digne de confiance. pdfmend ne transmet pas ces valeurs, mais le code appelant décide de leur destination.
Utilisez WebMCP lorsque l'agent doit passer par un contrat volontairement restreint. La façade WebMCP n'accepte aucun octet du document et n'en renvoie jamais. Elle peut décrire les capacités et l'état, créer un document vierge, ajouter du texte, déclencher un téléchargement local ou enregistrer une copie dans la bibliothèque du navigateur.
Découvrir le contrat avant d'agir
Commencez par https://pdfmend.app/agents.json. Ce fichier indique l'URL de l'éditeur, l'API versionnée, les noms des outils WebMCP et les règles de confidentialité. https://pdfmend.app/llms.txt contient la référence concise, llms-full.txt ajoute les guides publics et /.well-known/agent-skills/index.json publie une compétence dont l'empreinte est vérifiable.
Sur la page d'accueil, un client WebMCP compatible peut appeler pdfmend_get_capabilities et pdfmend_get_version. Dans l'éditeur, l'API de la fenêtre annonce version: 1 et les outils propres à l'éditeur n'existent que pendant le montage de cette surface.
Les champs ready, busy, documentOpen, dirty et signatureGate décrivent un état réel. L'agent doit attendre que l'éditeur soit prêt, éviter les modifications simultanées et traiter les avertissements de signature ou de session modifiée.
Automatiser un PDF en toute sécurité
- Ouvrez l'éditeur dans un contexte contrôlé par l'utilisateur ou par un exécuteur local de confiance.
- Attendez que l'API existe et que
getState()indiqueready. Ne vous fiez pas à une temporisation fixe ni à la seule apparence de la page. - Choisissez
window.pdfmend.v1si les octets doivent entrer dans le contexte d'automatisation ou en sortir, WebMCP pour ses actions limitées aux métadonnées, et l'interface stable pour les autres fonctions. - Lisez l'état avant toute modification. Les pages commencent à un et les coordonnées sont exprimées en points PDF depuis le coin inférieur gauche de la page non tournée.
- Appliquez les actions puis gérez des codes tels que
SESSION_BUSY,SESSION_DIRTY,SIGNATURE_GATEouPDF_PAGE_NOT_FOUND. - Exportez consciemment. L'API de la fenêtre peut renvoyer du base64 à l'exécuteur de confiance. WebMCP lance un téléchargement local et ne renvoie que le nom et la taille du fichier.
- Vérifiez le résultat avant de le partager. L'automatisation ne transforme pas les fonctions expérimentales en caviardage certifié.
Outils WebMCP disponibles
La page d'accueil enregistre pdfmend_get_capabilities et pdfmend_get_version. L'éditeur enregistre pdfmend_get_state, pdfmend_open_blank, pdfmend_add_text, pdfmend_export_download et pdfmend_save_to_library. Tous les résultats sont petits et contiennent des métadonnées, jamais les octets du PDF.
WebMCP est un projet évolutif d'un groupe communautaire du W3C, pas une API universellement déployée. pdfmend détecte document.modelContext et conserve une compatibilité avec l'ancienne surface du navigateur. Aucun polyfill n'est chargé. Sans API native ni pont, les outils WebMCP ne sont simplement pas enregistrés ; le site et window.pdfmend.v1 continuent de fonctionner.
Limites de confidentialité et de capacité
La promesse reste celle du guide d'édition locale : pdfmend ne possède aucun endpoint qui reçoit le contenu du document. Les actions visibles et programmatiques s'exécutent dans le navigateur. Une mesure d'usage sans cookie et sans contenu peut être envoyée, mais les octets et le texte du PDF ne sont jamais des champs analytiques.
Les deux façades ont des modèles de confiance différents. L'API de la fenêtre peut déplacer du base64 entre la page et un exécuteur de confiance. WebMCP exclut les octets dans les deux sens afin de les tenir hors d'un modèle distant. Aucune des deux n'est une API générale de traitement à distance.
Les API actuelles ne couvrent pas non plus toutes les fonctions de la barre d'outils. WebMCP ne peut pas importer un PDF existant et ne propose ni OCR ni remplacement massif. Les grands documents en base64 consomment beaucoup de mémoire. Utilisez l'interface ou les sélecteurs stables lorsqu'une tâche prise en charge ne dispose pas encore d'une action structurée.
Essayez maintenant — l'éditeur s'exécute entièrement dans votre navigateur. Sans envoi, sans compte, sans filigrane.
Ouvrir l'éditeur gratuitFAQ
pdfmend est-il un serveur MCP ?
Pas au sens d'un serveur distant classique. pdfmend implémente le projet WebMCP dans ses pages et publie des informations de découverte. Les outils appellent une logique locale au navigateur ; aucun serveur ne reçoit ni ne modifie le PDF.
Un agent peut-il ouvrir mon PDF existant avec WebMCP ?
Non. Le contrat WebMCP limité aux métadonnées n'accepte aucun octet. Un exécuteur de confiance peut utiliser window.pdfmend.v1, ou un agent peut piloter le sélecteur de fichiers visible avec l'autorisation de l'utilisateur.
L'automatisation envoie-t-elle le document ?
Le code de pdfmend ne l'envoie pas. WebMCP exclut entièrement les octets. L'API de la fenêtre remet du base64 à l'exécuteur ; vous devez donc faire confiance à cet exécuteur et à son code pour ne pas le transmettre.
Quelle interface est stable ?
L'API est explicitement versionnée sous window.pdfmend.v1, avec une sémantique et des erreurs testées. WebMCP suit un projet en évolution et est détecté par fonctionnalité ; son intégration au navigateur peut donc changer.