1 Punkte von GN⁺ 2024-05-13 | 1 Kommentare | Auf WhatsApp teilen

Chrome-Erweiterung „Wikipedia Citation Needed“

  • Während des Webbrowsings kann eine bestimmte Textpassage markiert werden, um die entsprechende Aussage zu überprüfen.
  • Mithilfe der ChatGPT API werden in Wikipedia passende Artikel gesucht und daraus Zitate herangezogen.
  • Es werden Informationen dazu bereitgestellt, ob die ausgewählte Aussage durch Wikipedia gestützt wird, zusammen mit Qualitätssignalen des Artikels wie dem Datum der letzten Bearbeitung und der Anzahl der Referenzen. So erhalten Nutzer mehr Kontext zu den Informationen, die sie bekommen, einschließlich der Informationen aus Wikipedia.

Bitte um Nutzerfeedback

  • Diese Funktion ist ein experimentelles Feature, das generative KI verwendet, und man ist sich bewusst, dass dabei gelegentlich Fehler auftreten können.
  • Um die Qualität der Ergebnisse zu verstehen und zu verbessern, wird darum gebeten, entdeckte Probleme über den Feedback-Link in der Erweiterung zu melden.
  • Auch allgemeines Feedback und Ideen dazu, wie Wikipedia beim alltäglichen Webbrowsing nützlich eingesetzt werden kann, sind willkommen.

Informationen für Entwickler

  • Diese Erweiterung wurde vom Future Audiences Team der Wikimedia Foundation entwickelt, einer gemeinnützigen Organisation, die Wikipedia und Schwesterprojekte unterstützt.

Meinung von GN⁺

  • Diese Erweiterung kann Nutzern dabei helfen, die Vertrauenswürdigkeit von Informationen zu bewerten, denen sie im Web begegnen. Allerdings können auch Qualität und Genauigkeit der Wikipedia-Artikel selbst Grenzen haben, weshalb sie sich kaum als absoluter Maßstab eignen.
  • Die Nutzung großer Sprachmodelle wie ChatGPT zur Automatisierung von Zusammenfassung und Verifikation kann den Nutzungskomfort erhöhen, birgt aber zugleich das Risiko, falsche Informationen zu erzeugen. Daher scheinen kontinuierliches Monitoring und fortlaufende Verbesserungen notwendig.
  • Wenn zusätzlich zu Wikipedia weitere verlässliche, von Fachleuten geprüfte Informationsquellen genutzt würden, könnten Genauigkeit und Vollständigkeit der Verifikation erhöht werden. Langfristig ließe sich auch der Aufbau einer dezentralen, Blockchain-basierten Wissensbasis in Betracht ziehen.

1 Kommentare

 
GN⁺ 2024-05-13
Meinungen auf Hacker News
  • Eine experimentelle LLM-basierte RAG-Anwendung, die Behauptungen im Internet mit Wikipedia abgleicht.
    Weitere Details gibt es unter https://meta.wikimedia.org/wiki/Future_Audiences/Experiment:....
    Hinweis: Ich war an dieser Arbeit beteiligt.

    • Falls weitere Entwickler gesucht werden, die Ideen oder Code beisteuern, würde ich gern in Kontakt treten.
      In den letzten sechs Monaten habe ich etwa acht Browser-Erweiterungen gebaut; die meisten haben Tausende Nutzer, eine kam auf 500.000 Nutzer.
      Derzeit arbeite ich an einer LLM-basierten Design-Assistenz-Erweiterung und bin unter „hello[at]papillonsoftware[dot]dev“ erreichbar.
    • Dieses Tool scheint nicht zu prüfen, ob der Artikel selbst eine Quelle für die jeweilige Behauptung zitiert.
      Vielleicht heißt es deshalb Citation Needed. Tatsächlich zitiert es ja nichts.
    • Ich würde gern wissen, ob es Material zu technischen Details oder zum Design gibt.
    • Ich würde gern wissen, ob eine Safari-Erweiterung geplant ist.
  • Ich frage mich, ob auch Zitate halluziniert werden können oder ob ein Ansatz wie deterministic quoting[1] verwendet wird.
    Hinweis: Ich bin der Autor dieser Arbeit.
    [1] https://mattyyeung.github.io/deterministic-quoting

    • Wirklich cool. Ich frage mich, ob das die Grundlage für Suche in natürlicher Sprache sein könnte.
      Ich würde gern wissen, ob man beim Betrachten von Dokumenten statt nach Keywords oder regulären Ausdrücken auf Englisch nach komplexeren Konzepten suchen könnte.
      Falls nicht, würde mich auch interessieren, welche zusätzliche Arbeit nötig wäre, um dieses Niveau zu erreichen.
    • Die Zitate selbst können nicht halluziniert werden, aber hier verwenden wir einen anderen Ansatz.
      Die Arbeit zu deterministic quoting sieht trotzdem interessant aus.
  • Es gibt keine Firefox-Erweiterung.

    • Falls die Wikimedia Foundation nicht dafür bezahlt wurde, dieses Projekt auf Basis eines aggressiven embrace & extend-Browsers zu entwickeln, sollte sie prüfen, ob ihr da Geld entgeht.
      Solche Projekte helfen dabei, konkurrierende Browser zu schwächen.
    • Dann kann ich es wohl nicht nutzen.
  • Gute Idee. Irgendwann wäre es schön, wenn ein LLM auch Wikipedia-Artikel selbst auf Fakten prüfen und markieren würde.

    • Dann würde ein LLM am Ende doch die Wikipedia-Artikel, auf denen es ursprünglich trainiert wurde, mit denselben Wikipedia-Artikeln abgleichen, oder?
  • Das Wikimedia-Git-Repository dieser Erweiterung ist hier:
    https://gitlab.wikimedia.org/repos/future-audiences/citation...
    Außerdem sind die Build-Hinweise im README unvollständig, und Hot Reload scheint auch nicht zu funktionieren. Für einen funktionierenden Build kann man npm run build-dev verwenden.
    Es ist nicht klar, was daran hindert, daraus auch eine Firefox-Erweiterung zu machen. Vielleicht sind es Unterschiede bei der sidebar/sidepanel API, aber ich habe mich damit nicht intensiv beschäftigt.

  • Wenn man hier einen suchbasierten Dokumentgenerator anschließt, hat man einen Dokumentgenerator und einen Dokumentprüfer und kann damit direkt eine Billion Seiten erzeugen.
    Das ließe sich wohl auch als Trainingscontent für LLMs nutzen, und Menschen könnten es ebenfalls verwenden.

  • Ich frage mich, ob das nur in Chrome funktioniert. In Arc habe ich es nicht zum Laufen bekommen.

  • @wikimedia: Bitte eine Firefox-Version.

  • Es heißt zwar „Chrome-Erweiterung zum Finden von Zitaten in Wikipedia“, aber in der Wissenschaft sind Wikipedia-Zitate im Allgemeinen tabu.
    Einer der Gründe ist die geringe Verlässlichkeit, und Autoren können Quellen zitieren, die sie selbst bearbeiten können.
    Wichtiger ist aber, dass Wikipedia zwar nützlich sein kann, um Primärquellen zu finden, selbst jedoch eine Sekundärquelle ist.

    • Diese Begründung wirkt ehrlich gesagt etwas aus der Zeit gefallen.
      Inzwischen ist groß angelegter Wissenschaftsbetrug tatsächlich ans Licht gekommen, und es gab kaum Korrekturen, um das zu beheben.
      Wikipedia dagegen ist mit Missbrauch ziemlich gut umgegangen, und die Nutzung von Wikipedia-Links ist weniger eine Bedrohung für die Wissenschaft, als wissenschaftlicher Betrug eine größere Bedrohung für Wikipedia ist.
    • Der Punkt ist, Informationen innerhalb von Wikipedia zu finden, und diese Informationen haben in der Regel Zitate zu anderen Quellen.
      Wenn man mit Google sucht, findet man viele Wiederholungen derselben Informationen, aber die meisten Websites zitieren keine Quellen.
    • Das scheint nicht anders zu sein als früher.
      Auch vor Wikipedia hat man keine Sekundärquellen zitiert, aber man hat sie definitiv genutzt, um in ein Thema einzusteigen und relevante Quellen zu finden.
    • Es gibt viele Gründe, warum Wikipedia in der Wissenschaft meistens nicht zitierfähig ist, aber „Autoren können Quellen zitieren, die sie bearbeiten dürfen“ gehört nicht dazu.
      Wissenschaftler zitieren ständig ihre eigenen Arbeiten oder andere Quellen, über die sie redaktionelle Kontrolle haben.
    • Wikipedia versteht sich selbst lieber als Tertiärquelle.
      Referenzen sollen eher auf Sekundärquellen als auf Primärquellen verweisen.
      „Wikipedia articles should be based on reliable, published secondary sources, and to a lesser extent, on tertiary sources and primary sources. Secondary or tertiary sources are needed to establish the topic's notability and avoid novel interpretations of primary sources.“
      https://en.wikipedia.org/wiki/Wikipedia:No_original_research
  • Als ich es nach sich selbst gefragt habe, kam Folgendes zurück:

    "Citation Needed is an experimental feature developed in 2024"

    • The provided passages do not contain any information about a feature called 'Citation Needed' being developed in 2024.
    • Wikipedia
    • Discouragement in education
    • not be relied
      Ich habe es zwar nicht für den eigentlichen Zweck verwendet, aber es war ziemlich lustig.