1 Punkte von belhyun 5 시간 전 | Noch keine Kommentare. | Auf WhatsApp teilen

Hallo.

Vor Kurzem habe ich eine Chrome-Erweiterung entwickelt, die im Browser ausgeführte Aufgaben automatisch in Benutzerhandbücher (SOPs) umwandelt.

Anders als bei herkömmlichen Bildschirmaufzeichnungen werden Klick- und Eingabeereignisse zusammen mit dem DOM-Kontext erfasst und in für Menschen leicht verständliche Arbeitsschritte rekonstruiert.

Die aktuelle Pipeline sieht wie folgt aus.

Browser Recording → DOM Context Extraction → Solar Pro 3 → AI Validation → Word / PDF / Markdown

Der schwierigste Teil bei der Umsetzung war die Frage: „Bis wohin betrachtet man etwas als einen einzelnen Schritt?“

Wenn man Browserereignisse unverändert aufzeichnet, wird es zu kleinteilig; führt man umgekehrt zu viel zusammen, geht die wichtige Benutzerabsicht verloren. Derzeit werden Ereignisse anhand von DOM-Änderungen, Eingabestatus, Seitenwechseln usw. zusammengeführt. Anschließend erzeugt Solar Pro 3 für jeden Schritt eine natürlichsprachliche Beschreibung, und eine AI prüft nochmals die Reihenfolge und ob etwas fehlt. So ist es aktuell umgesetzt.

Derzeit ist die Phase bis zur Dokumenterstellung implementiert. Als Nächstes experimentiere ich damit, das erzeugte Handbuch als strukturierten Task-Plan zu nutzen. Das Ziel ist nicht einfach nur ein Dokument, sondern ein ausführbarer Workflow, mit dem ein AI Agent die Aufgabe verstehen und anleiten oder wiederkehrende Browseraufgaben reproduzieren kann.

Interaction Segmentation und Task Planning werden noch weiter verbessert. Ich würde gern Feedback von Menschen hören, die dazu passende Forschung oder Implementierungserfahrung haben.

Noch keine Kommentare.

Noch keine Kommentare.