1 Punkte von GN⁺ 2023-06-29 | 1 Kommentare | Auf WhatsApp teilen
  • Bei einer Anhörung des Wissenschaftsausschusses des US-Repräsentantenhauses betonte Hugging-Face-CEO Clement Delangue, dass Open Science und Open-Source-KI stark mit den Werten und Interessen der USA übereinstimmen
  • Delangue sieht in Open-Source-Tools aus den USA wie PyTorch, Tensorflow, Keras, transformers und diffusers eine zentrale Grundlage für den Fortschritt der KI und die führende Position der USA
  • Die Aussage erfolgte zwei Wochen, nachdem Senatoren nach dem LLaMA-Leak von Meta Fragen zu möglichem Missbrauch wie Spam, Betrug, Malware, Datenschutzverletzungen und Belästigung gestellt hatten
  • Er erklärte, dass ethische Offenheit der Zivilgesellschaft, Non-Profit-Organisationen, der Wissenschaft und politischen Entscheidungsträgern die Fähigkeit gebe, große Privatunternehmen zu kontrollieren, und Black-Box-Systeme reduziere
  • Hugging Face will Offenheit und Sicherheitsmechanismen verbinden, indem es Modellkarten, Zugangsbeschränkungen, gestaffelte Releases, Community-Moderation sowie Opt-in- und Opt-out-Datensätze kombiniert

Plädoyer für Open-Source-KI bei einer Anhörung im US-Repräsentantenhaus

  • Hugging-Face-CEO Clement Delangue sagte bei der öffentlichen Anhörung des Wissenschaftsausschusses des US-Repräsentantenhauses Artificial Intelligence: Advancing Innovation Towards the National Interest aus
  • An derselben Anhörung nahmen auch RAND-Corporation-CEO Jason Matheny, Lux-Capital-General-Partner Shahin Farshchi, Harvard-University-Fellow für Responsible AI Rumman Chowdhury sowie Dewey Murdick, Executive Director des Center for Security and Emerging Technology der Georgetown University, teil
  • Delangue ist der Ansicht, dass die jüngsten Fortschritte in der KI auf Open Science und Open Source beruhen
    • PyTorch, Tensorflow, Keras, transformers und diffusers wurden als in den USA entwickelte Open-Source-Technologien genannt
    • Er sagte, ohne diese Technologien wären die USA möglicherweise kein führendes KI-Land geworden

Ethische Offenheit inmitten der LLaMA-Kontroverse

  • Delangues Aussage erfolgte zwei Wochen, nachdem Senatoren Mark Zuckerberg zum LLaMA-Leak des Open-Source-LLM von Meta befragt hatten
    • Das betreffende Schreiben äußerte die Sorge, dass LLaMA für Spam, Betrug, Malware, Datenschutzverletzungen, Belästigung und andere Fehlverhalten oder Schäden eingesetzt werden könnte
    • Durch die Verbreitung von LLaMA ist die Leistungsfähigkeit von KI-Modellen, auf die die breite Öffentlichkeit zugreifen kann, deutlich gestiegen; zugleich wuchsen die Sorgen über Fehl- oder Missbrauch
  • Hugging Face ist ein Startup mit Sitz in New York, erhielt im vergangenen Jahr eine Bewertung von 2 Milliarden US-Dollar und hat sich als Hub für Open-Source-Code und -Modelle etabliert
    • Im April brachte Delangue bei einem Open-Source-Tech-Meetup im Exploratorium in San Francisco mehr als 5.000 Menschen zusammen
  • Delangue sagte, Open Science und Open Source förderten zehntausende Startups, die KI einsetzen
  • Ethische Offenheit verschafft Zivilgesellschaft, Non-Profit-Organisationen, Wissenschaft und politischen Entscheidungsträgern die nötigen Mittel, um die Macht großer Privatunternehmen zu kontrollieren
    • Sie verhindert Black-Box-Systeme und erhöht die Rechenschaftspflicht von Unternehmen
    • Sie kann helfen, Bias zu mindern, Desinformation zu reduzieren, Urheberrechte zu stärken und Stakeholder einschließlich Künstlern und Content Creators zu vergüten
  • Der Ansatz von Hugging Face verbindet institutionelle Richtlinien, technische Schutzmechanismen und Community-Anreize
    • Dazu gehören Dokumentation und Modellkarten, einschließlich der von Dr. Margaret Mitchell etablierten model cards
    • Zugangsbeschränkungen für Artefakte und gestaffelte Releases werden als technische Schutzmechanismen eingesetzt
    • Community-Moderation sowie Opt-in- und Opt-out-Datensätze gehören ebenfalls zur Anreizstruktur
  • In den vergangenen Monaten hat sich die Debatte um Open-Source-KI weiter zugespitzt, da zahlreiche Large-Language-Model-Releases erschienen und Startups, Gruppen und die Wissenschaft gegen die Bewegung hin zu geschlossenen und proprietären LLMs protestierten

1 Kommentare

 
GN⁺ 2023-06-29
Hacker-News-Kommentare
  • Das ist die perfekte Miniaturausgabe davon, wie das System funktioniert. Dieser Mann hat recht, aber er kam zu spät, hatte zu wenig Geld und bekam nicht genug Aufmerksamkeit
    Sam Altman dagegen ist das Gesicht eines Consumer-Produkts mit einem großartigen Marketingteam und sogar Lobbyisten, hat Milliarden von Microsoft bekommen und hat auch ein Produkt, das jeder kostenlos ausprobieren kann
    Man geht zuerst hinein und trägt die Erzählung von den AI-Risiken vor, überzeugt die Abgeordneten davon, dass die neueste Technologie gefährlich ist. OpenAI wird bald fast als Synonym für den neuesten Stand der Technik wahrgenommen, also folgt man dem Branchenführer, ohne wirklich darauf zu achten, wohin er steuert, und so sind wir hier gelandet
    Ich wünschte, Open-Source-Software wäre vor Gericht fair vertreten, aber Ideen können ihre Kosten nicht selbst tragen, und die Stimme des Geldes ist zu laut

    • Altman ist nicht zum Kongress gegangen, um ihn davon zu überzeugen, dass „moderne AI gefährlich ist“, sondern Blumenthal hat ihn eingeladen, um einen medienwirksamen Vorwand zu schaffen
      Der Kongress fühlt sich belastet, weil er Social Media einfach hat laufen lassen, und ist geradezu begierig darauf, AI zu regulieren. In der Anhörung gab es keinen wirklichen Widerspruch, die Absichten von Staat und Industrie passen vollkommen zusammen. Dem zentralisierten Kontrollmodell wird der rote Teppich ausgerollt, und Regulierung soll den Wettbewerb beseitigen
    • Die Interessen der Regierung werden eher mit denen von OpenAI übereinstimmen, und es könnte aus ihrer Sicht sogar töricht sein, Open-Source-/lokale Modelle nicht zu beseitigen
      Was lokal läuft, umgeht Netzwerkgrenzen, an denen abgehört und überwacht werden kann. Wer Google fragt, hinterlässt Spuren, Suchverläufe können per Vorladung beschafft werden, ebenso wie Ausleihdaten öffentlicher Bibliotheken. Ein Gatekeeper wie OpenAI kann diese Rolle übernehmen und Maut kassieren
      Wenn man dieselbe Recherche mit etwas wie Vicuna-13B-ggml macht, kann niemand mitschnüffeln, was man tut. Für Menschen, die für sich sein wollen, klingt das gut, aber für diejenigen, die böswilligere Nutzer aufhalten wollen, hat das beängstigende Implikationen
      Leider sind Kompromisse in solchen Fragen fast unmöglich. Das Beste wäre wohl so etwas wie das jüngste Gesetz in den Niederlanden, das dem Staat erlaubt, bei hinreichendem Grund in private Geräte einzudringen, aber dazu wird es wohl nicht kommen. Die einzige Alternative, die der Regierung in die Hände spielt, wäre, lokale Modelle und ihre Open-Source-Entwicklung selbst zu verbieten
    • In der öffentlichen Wahrnehmung ist es auch furchtbar, dass OpenAI wegen seines Namens fälschlich mit Open Source verbunden wird. Dadurch wirken zwei gegensätzliche Ansätze für die Öffentlichkeit vermischt
    • Glaubst du wirklich, dass es schon zu spät ist? Sind wir nicht noch ganz am Anfang?
    • Ein Grund für Optimismus ist, dass Lobbyisten, die AI schließen wollen, es mit einem Kongress zu tun haben, der derzeit nicht besonders handlungsfähig ist, und dass der Status quo in dieser Frage darin besteht, nichts zu tun
      Um den Widerstand des Status quo zu überwinden, braucht es breite öffentliche Unterstützung, und die gibt es nicht, und sie mit Geld zu kaufen wäre sehr teuer
  • Open Source ist ein unverzichtbarer Bestandteil beim Aufbau einer gesunden digitalen Gesellschaft, die den Werten näherkommt, die wir hochhalten
    AI ist wichtig, aber in diesem gesamten Wandel am Ende nur ein kleiner Teil. Man sollte sich daran erinnern, dass auch Bitcoin, das die Grundlagen des Wirtschaftslebens erschüttern will, Open Source ist
    Der evolutionäre Prozess, Open-Source-Fähigkeiten auf gesellschaftlicher Ebene zu verankern, ist weder automatisch noch eindeutig gut. Das obige Krypto-Beispiel zeigt das
    Es gibt noch viele Technologien, Institutionen und Verhaltensweisen, die wir uns erst vorstellen, entwickeln, testen und verbreiten müssen. Das ist eine gute Aufgabe für die digitalen „Gesellschafts“-Ingenieure der Gegenwart und Zukunft, die jetzt die Ärmel hochkrempeln müssen
    Mir fällt kaum ein anderes Universum als die Dystopie ein. Falls jemals eine monopolistische Vision vorgestellt wurde, die mit individueller Handlungsfähigkeit, Freiheit und demokratischer Kontrolle moralisch vereinbar ist und zugleich intellektuell ehrlich mit ihren eigenen Anreizen umgeht, würde ich das aufrichtig gern wissen

  • Der CEO von Hugging Face hat das gut gemacht. Ich habe Freunden und Familie einen fünfminütigen YouTube-Link geteilt, der die Vorteile offener Modelle und von Open Source sehr gut erklärt hat

    • Kannst du den Link zum Video geben?
  • In diesem Fall scheint es ein Beispiel zu sein, bei dem der Unterschied zwischen Open Source und freier Software ziemlich wichtig wird

    • Ich wünschte wirklich, man würde bei LLMs aufhören, Modelle mit durchgesickertem Quellcode oder Gewichten als „Open Source“ zu bezeichnen
      Dasselbe gilt für Modelle, die zwar absichtlich veröffentlicht wurden, deren Lizenz die „nichtkommerzielle Nutzung“ einschränkt oder kommerzielle Nutzung nur dann erlaubt, wenn man nicht mit dem veröffentlichenden Unternehmen „konkurriert“
    • Auch ohne sich zu sehr an Semantik aufzuhängen, ist hier der freie Austausch von Ideen, Algorithmen und etwas Code entscheidend
      Der Fortschritt in diesem Bereich hat sich in den letzten 20 Jahren dank dieses Austauschs enorm beschleunigt. Unternehmen teilen viele Details, statt die Ergebnisse festzuhalten und ihre geheime Würze zu schützen, und sie validieren, indem sie die Ergebnisse anderer reproduzieren und verbessern
      OpenAI hat ChatGPT gebaut, Meta hat Llama entwickelt, und Google macht Bard. Llama ist in gewissem Maß in die Open-Source-Community gelangt, und die Leute nutzen es jetzt, verbessern es und benchmarken es gegen ihre eigenen Modelle
    • Open Source ist immer wichtig. Ohne Open Source ist es schwer, eine gute Developer-Pipeline aufzubauen. Andere Ingenieursdisziplinen sollten auf Ähnliches hinarbeiten. Das heißt natürlich nicht, dass es keine proprietäre Software geben kann
      Zumindest bei der Bildgenerierung scheint es jetzt so zu sein, dass offene Modelle durch Crowdsourcing des Trainings deutlich bessere Ergebnisse liefern
    • Ehrlich gesagt empfinde ich es eher umgekehrt. Je mehr Open-Source-Software, desto besser, aber selbst wenn LLMs Open Source werden, wird das meiner Ansicht nach das größte Risiko von LLMs nicht wesentlich verringern
  • Es ist seltsam, Hugging Face auf diese Weise in den Nachrichten zu sehen. Ich erinnere mich, dass ich ungefähr im Sommer 2019 einen Patch beigesteuert habe, als das Projekt etwa 4.000 Sterne hatte, und ich hielt es damals schon für ziemlich populär

    • Stell dir mal vor, wie es in fünf Jahren aussieht ;)
  • Was ist eigentlich das Endziel von Hugging Face? Geht es darum, das GitHub für AI zu werden?

    • Das ist der CEO von Hugging Face. Wenn Open Science und Open Source dabei helfen können, eine gute Demokratisierung von AI zu unterstützen, dann hoffe ich, dass es so wird. Hältst du das für nützlich?
    • Die Oberfläche sieht zu etwa 90 % wie GitHub aus, also scheint das ziemlich offensichtlich zu sein
      Sie versuchen auch, in Richtung AI-Modelltraining und das Ausführen von Inferenz zu expandieren. Aber bei den Inferenzkosten wirken sie im Vergleich zu GPU-Anbietern wie CoreWeave sehr wenig wettbewerbsfähig
    • Was auch immer daraus wird, ich hoffe wirklich, wirklich, wirklich, wirklich, dass es nicht in die Hände von Microsoft, Google oder Ähnlichen fällt. Natürlich wird genau das am Ende passieren, und dann folgt die Enshittification
    • Ist es das nicht schon?
    • Dass es von AWS übernommen wird?
  • Mir gefällt, dass er in Social Media noch ziemlich gut ansprechbar ist

  • Warum mischt sich der Kongress überhaupt in Dinge wie Software, Open Source und AI ein?

  • Ich würde gern wissen, ob du dir das Bittensor-Projekt angesehen hast und was du davon hältst. Ist es etwas, dessen Integration man erwägen sollte?
    Ich denke, es könnte Projekten wie diesem und der Open-Source-AI-Bewegung helfen

  • Stehen die meisten Modelle auf Hugging Face nicht unter seltsamen RAIL-Lizenzen statt unter Open Source?

    • Zumindest auf GitHub stehen die meisten ihrer Projekte unter MIT- oder Apache-2.0-Lizenzen. Habe ich etwas übersehen?