- Ein Projekt, das testet, ob Web-Browsing allein mit den Vision-Funktionen von GPT-4V möglich ist, und einem multimodalen Modell eine Schnittstelle zur Interaktion mit dem Web bereitstellt
- Behandelt das Problem, dass das Modell ohne den Browser-DOM als Text nur schwer erkennen kann, worauf es klicken soll
- Verwendet die Chrome-Erweiterung Vimium, um das Web ausschließlich per Tastatur zu navigieren, und erprobt so, wie das Modell mit dem Web interagiert
- Der Ablauf besteht aus der Installation der Python-Abhängigkeiten, dem lokalen Download von Vimium, dem manuellen Laden der Erweiterung beim Start von Playwright und dem Ausführen von
python main.py - Mit
python main.py --voicekann der Voice Mode gestartet werden, sodass man das Ziel per Sprachbefehl vorgibt und Browser-Aktionen in Echtzeit ausgeführt werden - Derzeit unterstützt die Vision API weder den JSON-Modus noch Function Calling, sodass man auf einen primitiveren Prompt-Ansatz angewiesen ist
- Bei niedriger Auflösung erkennt das Modell mitunter gar nichts; mit höher aufgelösten Bildern lässt sich das verbessern, allerdings werden dafür mehr Tokens benötigt
1 Kommentare
Hacker-News-Kommentare
Es ist wirklich erstaunlich, dass so etwas jetzt möglich ist: https://github.com/ishan0102/vimGPT/blob/682b5e539541cd6d710...
Der Prompt steuert den Browser nach dem Muster: „Wähle zum Erreichen des Nutzerziels eine Aktion aus
navigate,type,click,done, markiere das Klickziel über die gelbe Zeichenfolge und gib nur JSON zurück.“Bei der Arbeit gibt es ziemlich viele Leute, die zwischen Legacy-Programmen nur manuell Daten kopieren. Im Behördenumfeld ist die technische Schuld so groß, dass man keinen Weg findet, die Systeme miteinander zu verbinden
Wenn so ein Tool irgendwann eine Schicht werden könnte, die auf diesen Problemen aufsetzt, wäre das vielversprechend. Aus Sicht der Rechenressourcen ist es allerdings eine seltsame Lösung
Ich wollte wissen, wie sie das vorher gemacht hatten, also brachten sie mich zu einem Computer hinten im Büro. Auf dem Desktop-Hintergrund waren zwei Rechtecke mit MS EXCEL und INTERNET EXPLORER beschriftet. Die zuständige Person öffnete die beiden Apps, platzierte die Fenster exakt in diesen Rechtecken und ließ dann einen Autoklicker laufen, wie ihn RuneScape-Cheater benutzen würden, um Werte aus Excel in Webformulare zu kopieren. Großartig
Benutzername, Passwort, E-Mail-Adresse, echte Adresse, Kreditkarteninformationen — alles gehört dazu, und es gibt Erweiterungen, die beim Ausfüllen helfen sollen, aber nichts funktioniert zuverlässig und dauerhaft. Selbst dass Benutzername und Passwort konsistent ausgefüllt werden, ist kaum zu erwarten. Das ist beim Surfen eine noch größere Nervensäge als Werbung, und es ist erstaunlich, dass das mit oder ohne LLM immer noch nicht gelöst ist. Für Software, die das vollständig löst, würde ich ein Monatsabo bezahlen
Bisher waren solche Produkte ziemlich fragil, aber die jüngste Explosion der AI-Technologie scheint ein großer Rückenwind für diesen Bereich zu sein
Selbst wenn man so etwas wie ChatGPT integriert, müsste jemand mit Ahnung es prüfen, und es würde mich nicht wundern, wenn deren erster Rat wäre: „Verwenden Sie dort lieber kein ChatGPT.“
vimscheint unbeabsichtigt ein großartiger verkörperter Körper für ChatGPT zu sein. Mit Textstreams kann man praktisch alles machen, und im Internet gibt es bereits Unmengen an vimscriptIch habe ein ähnliches Experiment begonnen, also kann sich das gern ansehen, wer in dieselbe Richtung denkt: https://github.com/LachlanGray/vim-agent
Ich bin der Ersteller. Fragt gern, wenn ihr etwas wissen wollt, und Beiträge sind willkommen. Im README habe ich ein paar mögliche nächste Schritte hinterlassen
Auf die eine oder andere Weise verwandelt sich das öffentlich zugängliche World Wide Web gerade in einen eigenen dynamischen API-Overlay-Server
Ich habe mit GPT-4 Vision eine ähnliche Idee ausprobiert, bei der über Screenshots und Aktionen gebrowst wird, bin aber beim Überlagern von Informationen auf dem Screenshot gescheitert und habe am Ende den Accessibility-Tree aus Playwright geholt und zusammen mit dem Text gesendet
Dann kennt das Modell die interagierbaren Optionen, und in meinem Fall funktionierte das besser. Der Ersteller ist hier und hat auch eine Liste mit Ideen für die Zukunft, also könnte man das dort vielleicht ergänzen, wenn das okay ist
Ich habe in den letzten Wochen mit der ChatGPT-Oberfläche daran herumgespielt. Ein paar Tipps
Ich habe das CSS geändert, um Verläufe und abgerundete Ecken zu entfernen, und fetter weißer Text auf Rot war am konsistentesten. Es ist gut, die Schriftgröße zu erhöhen, und wenn sich zwei Labels überlappen, sie gegenseitig wegzuschieben und einen Pfeil hinzuzufügen, der auf das Element zeigt. Für die API war es besser, sowohl ein annotiertes als auch ein nicht annotiertes Bild zu senden
Man könnte einen Autopiloten für den Browser bauen
Wenn das in großem Maßstab ausgerollt wird, dürfte es extrem schwer werden, Bot-Traffic künftig noch zu unterscheiden. Kurzfristig scheint allerdings das Problem zu sein, dass das kaum billig oder zu vertretbaren Kosten machbar ist
Welche Auswirkungen könnten solche Tools auf Web-Tracking oder Internetwerbung insgesamt haben? Wenn ein Agent stattdessen das Web durchsuchen und genau das holen kann, wonach man sucht, ohne Werbung oder Pop-ups zu sehen und dabei auch noch Tracking zu vermeiden, wäre das ein großartiger Adblocker
Vielleicht könnte das SEO nutzlos machen und die Qualität des Internets verbessern. Andererseits frage ich mich, ob es als Nebenwirkung dazu kommen könnte, dass Werbung irgendwie in die dadurch gelieferten Inhalte „eingemischt“ wird
Viele Unternehmen in den Niederlanden zahlen Gehälter so aus. 1) Man bekommt vom Buchhalter die Gehaltsabrechnungen, 2) man startet für jeden Mitarbeiter manuell eine Banküberweisung über genau den Betrag aus der jeweiligen Abrechnung, und 3) man startet auch die Banküberweisung der einbehaltenen Lohnsteuer an die Steuerbehörde manuell
Das ist völlig nutzlose Handarbeit, und es gibt keinen Grund, warum das ein manueller Prozess sein sollte. Trotzdem ist Automatisierung fast unmöglich. Buchhaltungsportale haben keine API, oder falls doch, lassen sie einen die Daten als PDF herunterladen, oder die API kostet ziemlich viel. Banken haben ebenfalls keine API oder verlangen für ein Entwicklerkonto, als würde man eine öffentliche App veröffentlichen, obwohl man eigentlich nur interne Abläufe automatisieren will. Deshalb ist die einfachste Art, Gehälter und Steuern zu zahlen, immer noch, jemanden einzustellen, der das manuell erledigt. Ich würde einer AI nicht vertrauen, tatsächlich Banküberweisungen auszulösen, aber vielleicht könnte sie die Transaktionen vorbereiten und ein Mensch müsste nur noch die Freigabe zum Absenden erteilen
Ist das dem Konzept von Adept sehr ähnlich? Nur scheint das Produkt noch nicht fertig zu sein: https://www.adept.ai/
Adept scheint unterwegs die Richtung geändert zu haben, aber das ursprüngliche Konzept war diesem hier sehr ähnlich