Anleitungen / How-to
PDF-Bearbeitung mit KI-Agenten und WebMCP automatisieren
Aktualisiert am 2026-08-27 · pdfmend-Team
Viele Automatisierungslösungen senden ein PDF an einen entfernten Dienst. pdfmend verfolgt einen anderen Ansatz: Der Editor läuft im Browser und seine Automatisierungsschnittstellen verwenden dieselbe lokale Bearbeitungslogik wie die sichtbaren Bedienelemente. Menschen können die Oberfläche verwenden, ein Playwright-Agent kann eine versionierte API aufrufen und ein kompatibler Browser-Agent kann WebMCP-Werkzeuge entdecken. Das Dokument benötigt weiterhin keinen Upload-Endpunkt von pdfmend.
Damit ist pdfmend in einem konkreten, überprüfbaren Sinn agentenbereit. Die Website veröffentlicht maschinenlesbare Discovery-Dateien, stabile Selektoren, strukturierte Aktionen und eindeutige Fehlercodes. Das bedeutet nicht, dass jeder KI-Assistent jede Funktion steuern kann oder WebMCP in jedem Browser verfügbar ist.
Was agentenbereit bei pdfmend bedeutet
Eine agentenbereite Website muss Funktionen auffindbar machen, Eingaben beschreiben, den Bereitschaftszustand zeigen und strukturierte Ergebnisse oder Fehler liefern. pdfmend bietet vier Ebenen:
- Zugängliche Browser-Oberfläche. Semantische Bedienelemente, ARIA-Texte und stabile Test-IDs erlauben Agenten, dieselbe Oberfläche wie Menschen zu bedienen.
- Versionierte Browser-API.
window.pdfmend.v1stellt vertrauenswürdiger Automatisierung mit Playwright, Puppeteer, Stagehand oder ähnlichen Werkzeugen strukturierte Editor-Aktionen bereit. - WebMCP-Werkzeuge. Wenn ein kompatibler Browser oder eine Bridge
document.modelContextbereitstellt, registriert pdfmend typisierte Werkzeuge mit reinen Metadaten-Ergebnissen. - Maschinenlesbare Dokumentation.
llms.txt,llms-full.txt,agents.jsonund das Agent-Skills-Manifest beschreiben Produkt, Schnittstellen und Datenschutzgrenzen.
Diese Ebenen können unabhängig voneinander verwendet werden. Ein heutiger Runner kann die Window-API nutzen, ohne auf natives WebMCP zu warten; ein experimenteller WebMCP-Client kann den engeren Werkzeugsatz verwenden.
Die passende Schnittstelle wählen
Verwenden Sie die sichtbare Oberfläche, wenn ein Ablauf eine Funktion benötigt, die nicht Teil des programmatischen Vertrags ist, oder wenn jeder Schritt von einem Menschen geprüft werden soll. Der Abschnitt Automation in llms.txt beschreibt Bereitschaftssignale, Rollen und stabile Selektoren.
Verwenden Sie window.pdfmend.v1 für vertrauenswürdige Browser-Automatisierung, die PDF-Bytes öffnen, Seitengeometrie lesen, Text oder Bilder hinzufügen, Seiten organisieren, Änderungen rückgängig machen und eine exportierte Kopie empfangen muss. Diese API akzeptiert und liefert base64. Deshalb muss die steuernde Umgebung vertrauenswürdig sein. pdfmend überträgt diese Werte nicht; der aufrufende Code entscheidet jedoch, was anschließend mit ihnen geschieht.
Verwenden Sie WebMCP, wenn der Browser-Agent über einen bewusst engen Vertrag arbeiten soll. Die WebMCP-Fassade nimmt keine Dokument-Bytes an und gibt sie auch nicht zurück. Sie kann Fähigkeiten und Zustand melden, ein leeres Dokument erstellen, Text hinzufügen, einen lokalen Download auslösen oder eine Kopie in der lokalen Browser-Bibliothek speichern.
Den Vertrag vor der Aktion entdecken
Beginnen Sie mit https://pdfmend.app/agents.json. Die Datei nennt die Editor-URL, den versionierten Window-Handle, die WebMCP-Werkzeuge und die Datenschutzbedingungen. https://pdfmend.app/llms.txt enthält die kompakte Referenz, llms-full.txt ergänzt die öffentlichen Anleitungen und /.well-known/agent-skills/index.json verweist auf einen per Prüfsumme gebundenen Agent Skill.
Auf der Startseite kann ein kompatibler WebMCP-Client pdfmend_get_capabilities und pdfmend_get_version aufrufen. Im Editor meldet die Window-API version: 1; die Editor-Werkzeuge sind nur registriert, solange die Editor-Oberfläche eingebunden ist.
ready, busy, documentOpen, dirty und signatureGate sind echter Zustand. Ein Agent sollte auf Bereitschaft warten, parallele Änderungen vermeiden und Signatur- oder Dirty-Session-Warnungen behandeln.
Ein PDF sicher automatisieren
- Öffnen Sie den Editor in einem vom Benutzer oder von einem vertrauenswürdigen lokalen Runner kontrollierten Browser-Kontext.
- Warten Sie, bis die API vorhanden ist und
getState()den Wertreadymeldet. Verlassen Sie sich nicht auf eine feste Pause oder nur auf die sichtbare Darstellung. - Nutzen Sie
window.pdfmend.v1, wenn Dokument-Bytes den Automatisierungskontext betreten oder verlassen müssen, WebMCP für reine Metadaten-Aktionen und stabile UI-Elemente für übrige Funktionen. - Lesen Sie vor jeder Änderung den Zustand. Seiten sind ab eins nummeriert; Koordinaten sind PDF-Punkte ab der unteren linken Ecke der ungedrehten Seite.
- Führen Sie Aktionen aus und behandeln Sie Codes wie
SESSION_BUSY,SESSION_DIRTY,SIGNATURE_GATEoderPDF_PAGE_NOT_FOUND. - Exportieren Sie bewusst. Die Window-API kann base64 an den vertrauenswürdigen Runner zurückgeben. WebMCP löst einen lokalen Download aus und liefert nur Dateiname und Bytelänge.
- Prüfen Sie das Ergebnis vor der Weitergabe. Automatisierung macht aus experimentellen Funktionen keine zertifizierte Schwärzung.
Verfügbare WebMCP-Werkzeuge
Die Startseite registriert pdfmend_get_capabilities und pdfmend_get_version. Der Editor registriert pdfmend_get_state, pdfmend_open_blank, pdfmend_add_text, pdfmend_export_download und pdfmend_save_to_library. Alle Ergebnisse sind klein und enthalten Metadaten, niemals PDF-Bytes.
WebMCP ist ein sich entwickelnder Entwurf einer W3C Community Group und keine universell verfügbare Browser-API. pdfmend erkennt document.modelContext und unterstützt zusätzlich die frühere Navigator-Oberfläche. Es wird kein Polyfill geladen. Ohne native API oder Bridge werden die WebMCP-Werkzeuge einfach nicht registriert; die Website und window.pdfmend.v1 funktionieren weiterhin.
Datenschutz- und Funktionsgrenzen
Das Versprechen entspricht dem Leitfaden zur lokalen Bearbeitung: pdfmend besitzt keinen Endpunkt, der Dokumentinhalte empfängt. Sichtbare und programmatische Aktionen laufen im Browser. Inhaltsfreie, cookielose Nutzungsmessung kann gesendet werden, PDF-Bytes und -Text sind aber keine Analysefelder.
Die beiden Fassaden haben unterschiedliche Vertrauensmodelle. Die Window-API kann base64 zwischen Seite und vertrauenswürdigem Runner bewegen. WebMCP schließt Bytes in beide Richtungen aus, damit sie nicht in die Antwort an ein entferntes Modell gelangen. Keine der Schnittstellen ist eine allgemeine Remote-PDF-API.
Die aktuellen APIs decken außerdem nicht jede Toolbar-Funktion ab. WebMCP importiert kein vorhandenes PDF und bietet weder OCR noch massenweisen Textersatz. Große base64-Dokumente benötigen viel Arbeitsspeicher. Verwenden Sie die Oberfläche oder stabile Selektoren, wenn eine unterstützte Aufgabe noch kein strukturiertes Verb hat.
Probieren Sie es jetzt aus — der Editor läuft vollständig in Ihrem Browser. Kein Upload, kein Konto, kein Wasserzeichen.
Kostenlosen Editor öffnenFAQ
Ist pdfmend ein MCP-Server?
Nicht im Sinn eines klassischen entfernten Servers. pdfmend implementiert den WebMCP-Entwurf in seinen Webseiten und veröffentlicht Agent-Discovery. Die Werkzeuge rufen browserlokale Logik auf; kein Server empfängt oder bearbeitet das PDF.
Kann ein Agent mein vorhandenes PDF über WebMCP öffnen?
Nein. Der reine Metadaten-Vertrag nimmt keine Dokument-Bytes an. Ein vertrauenswürdiger Runner kann window.pdfmend.v1 verwenden oder mit Erlaubnis des Benutzers die sichtbare Dateiauswahl bedienen.
Lädt die Automatisierung das Dokument hoch?
Der pdfmend-Code lädt es nicht hoch. WebMCP schließt Bytes vollständig aus. Die Window-API übergibt base64 an den Runner; Sie müssen diesem Runner und seinem Code vertrauen, dass die Daten nicht übertragen werden.
Welche Schnittstelle ist stabil?
Die Browser-API ist ausdrücklich als window.pdfmend.v1 versioniert; ihre Semantik und Fehlercodes werden als Vertrag getestet. WebMCP folgt einem Entwurf und wird per Feature-Erkennung aktiviert, daher kann sich die Browser-Integration weiterentwickeln.