1 Punkte von GN⁺ 2024-01-29 | 1 Kommentare | Auf WhatsApp teilen
  • Ab der Desktop-Browser-Version v1.62 von Brave wird das Standard-LLM des datenschutzorientierten KI-Browser-Assistenten Leo auf Mixtral 8x7B umgestellt
  • Mixtral 8x7B ist ein Open-Source-LLM, das Mistral AI im Dezember vorgestellt hat, und wurde wegen seiner Geschwindigkeit, Leistung und seines offenen Modellcharakters in Leo integriert, passend zur Produktausrichtung von Brave
  • Brave erklärt, dass Mixtral 8x7B laut dem LMSYS Chatbot Arena Leaderboard vor ChatGPT 3.5, Claude Instant und Llama 2 liegt und beim BBQ benchmark Verbesserungen bei der Reduzierung von Halluzinationen und Bias zeigt
  • Sowohl das kostenlose Leo als auch Premium für 15 US-Dollar pro Monat bieten Mixtral 8x7B standardmäßig an, allerdings hat die Gratisversion strengere Nutzungslimits, während Premium höhere Limits bietet
  • Leo verarbeitet Anfragen anonym über einen Reverse Proxy, speichert keine Gespräche und verwendet sie nicht für das Modelltraining; nutzbar ist Leo ohne separate App über die Adressleiste oder die Seitenleiste

Das Standardmodell von Leo wurde auf Mixtral 8x7B umgestellt

  • Brave hat mit dem Update auf Desktop-Browser v1.62 das Standard-LLM von Leo durch Mixtral 8x7B ersetzt
  • Leo ist der von Brave angebotene datenschutzorientierte KI-Browser-Assistent, der KI-Funktionen direkt im Browser verfügbar macht
  • Das Update umfasst neben dem Modellwechsel auch ein klareres Onboarding, Kontextsteuerung, Eingabe- und Antwortformate sowie allgemeine UI-Verbesserungen

Warum Mixtral 8x7B gewählt wurde

  • Mixtral 8x7B ist ein Open-Source-LLM, das Mistral AI im Dezember vorgestellt hat, und wird wegen seiner Geschwindigkeit und Leistung in der Entwickler-Community schnell häufiger eingesetzt
  • Laut dem LMSYS Chatbot Arena Leaderboard zeigt es bessere Leistung als ChatGPT 3.5, Claude Instant und Llama 2
  • Laut dem BBQ benchmark gibt es auch Verbesserungen bei der Reduzierung von Halluzinationen und Bias
  • Zu den wichtigsten Funktionen gehören:
    • Verarbeitung von größerem Kontext
    • Interaktionen auf Englisch, Französisch, Deutsch, Italienisch und Spanisch
    • Codegenerierung

Nutzung von Mixtral innerhalb der Brave-Produkte

  • Brave verwendet Mixtral bereits für Code LLM, die Funktion von Brave Search für programmierbezogene Anfragen
  • Die Leistung von Mixtral und sein Open-Source-Charakter passen zu Braves Ausrichtung auf offene Modelle und die Unterstützung der Open-Source-Community
  • Brave-CTO und Mitgründer Brian Bondy erklärte, dass Leo bereits von Zehntausenden kostenlosen Nutzern und zahlenden Abonnenten verwendet wird und man mit der Einbindung von Mixtral eine noch breitere Akzeptanz erwartet
  • Mistral-AI-CEO Arthur Mensch bewertete positiv, dass Mixtral in Brave Search CodeLLM und Brave Leo eingesetzt wird

Kostenlose und Premium-Modelloptionen

  • Leo bietet je nach Bedarf und Budget mehrere Modelle zur Auswahl
  • Mixtral 8x7B wird sowohl in der kostenlosen Version als auch in Premium als Standard-LLM angeboten
  • Beide Tarife unterstützen außerdem Claude Instant von Anthropic und Llama 2 13B von Meta
  • Für das kostenlose Leo gelten folgende Nutzungsbedingungen:
    • Für Mixtral 8x7B und Claude Instant gelten strengere Nutzungslimits
    • Llama 2 13B hat ein höheres Nutzungslimit
    • Wird das Nutzungslimit von Mixtral erreicht, kann man zur früheren Leo-Erfahrung mit Llama 2 zurückkehren und die KI weiter nutzen
  • Leo Premium kostet 15 US-Dollar pro Monat und bietet Mixtral 8x7B, Claude Instant und Llama 2 13B mit höheren Nutzungslimits

Datenschutzansatz

  • Die Chats von Leo sind auf Privatsphäre, Anonymität und Sicherheit ausgelegt
  • Chats werden nicht protokolliert, nicht für das Modelltraining verwendet, und für die Nutzung sind weder Konto noch Login erforderlich
  • Zu den Datenschutzmechanismen gehören:
    • Reverse Proxy: Alle Anfragen werden über einen Anonymisierungsserver weitergeleitet, sodass Anfragen und Benutzeradressen nicht miteinander verknüpft werden können
    • Sofortige Verwerfung der Antworten: Antworten von Leo werden direkt nach der Generierung verworfen, und Gespräche werden nicht auf Brave-Servern gespeichert
    • Keine Erfassung von Identifikatoren: Es werden keine Identifikatoren wie IP-Adressen gesammelt, die mit Nutzern in Verbindung gebracht werden könnten
    • Keine Speicherung durch Drittanbieter: Weder das KI-Modell noch Drittanbieter von Modellen speichern personenbezogene Daten
    • Kein Konto erforderlich: Leo kann ohne Brave-Konto genutzt werden
    • Nicht verknüpfbare Abonnement-Tokens: Bei Leo Premium wird das Abonnement mit Tokens verifiziert, die Kaufinformationen nicht mit der Produktnutzung verknüpfen können

Nutzung und Verfügbarkeit

  • Leo ist in den Browser integriert und kann ohne separate App oder Erweiterung verwendet werden
  • Brave-Desktop-Nutzer können eine Frage in die Adressleiste eingeben und dann auf „Ask Leo“ klicken oder Leo in der Brave Sidebar öffnen
  • Der Zugriff auf die KI-Funktionen erfolgt über die Chat-Seitenleiste neben der Webseite oder über die Adressleiste
  • Im Seitenkontext werden folgende Aufgaben unterstützt:
    • Echtzeit-Zusammenfassungen von Webseiten oder Videos
    • Beantwortung von Fragen zu Inhalten
    • Erstellung neuer Inhalte
    • Übersetzung von Seiten
    • Analyse von Seiten
    • Umformulierung von Sätzen
    • Unterstützung beim Schreiben von Code
  • Leo ist seit November für Brave-Desktop-Nutzer verfügbar; die betreffende Version ist 1.60
  • Leo für Android und iOS soll in Kürze verfügbar sein

1 Kommentare

 
GN⁺ 2024-01-29
Hacker-News-Meinungen
  • Um Mixtral 8x7B lokal auszuführen, kann man llama.cpp verwenden und zusammen mit unterstützenden Libraries/Interfaces wie text-generation-webui https://huggingface.co/TheBloke/Nous-Hermes-2-Mixtral-8x7B-S... nutzen.
    Selbst die kleinste Version mit 2-Bit-Quantisierung benötigt 20 GB RAM und lässt sich in den VRAM einer ordentlichen 4090-GPU auslagern.
    Die 4-Bit-quantisierte Version ist das größte Modell, das gerade noch in ein System mit 32 GB passt, und belegt etwa 29–31 GB.
    6 Bit benötigt 41 GB, 8 Bit 52 GB; dafür ist also ein 64-GB-System nötig. Um Modelle mit höherer Präzision in den VRAM auszulagern, braucht man mehrere GPUs mit gemeinsamem Speicher.
    Ich habe 7B- und 13B-Modelle ausprobiert, aber diese Modelle oder andere große Modelle noch nicht getestet.

    • Wenn man mehr Leistung bei Code-Aufgaben möchte, kann man auch das dolphin-mixtral-Finetuning ausprobieren: https://huggingface.co/TheBloke/dolphin-2.7-mixtral-8x7b-GGU...
    • Statt mehrerer GPUs könnte auch eine leistungsstarke Apple-Silicon-Maschine reichen.
      Ich habe dolphin mixtral 4 Bit auf einem MacBook M3 mit 36 GB RAM ausprobiert, und die Inferenz war sehr schnell.
    • 2 Bit ist ziemlich miserabel und für ernsthafte Zwecke kaum zu empfehlen.
    • Ich bevorzuge koboldcpp gegenüber llama.cpp.
      Damit ist es einfacher, Modelle, die größer als der VRAM sind, auf GPU/CPU aufzuteilen.
    • Wenn man über Speicherbedarf spricht, sollte man auch die Sequenzlänge berücksichtigen.
      Mixtral unterstützt 32.000 Tokens, daher kann dieser Teil einen recht großen Anteil am belegten Speicher ausmachen.
  • Brave verdient Lob für diese Funktion und andere Datenschutzfunktionen.
    Es handelt sich um ein Verfahren mit nicht verknüpfbaren Abo-Tokens: Wenn man Leo Premium abonniert, wird bei der Nutzung von Leo ein Token zur Verifizierung des Abos ausgegeben, und Brave kann Zahlungsinformationen nicht mit der Produktnutzung verknüpfen.
    Auch die für die Kontoerstellung verwendete E-Mail ist nicht mit der alltäglichen Leo-Nutzung verknüpft; das ist eine ziemlich ungewöhnliche Art privater Zugangsdaten.

    • Sehr cool, würde ich gern auch in meine App einbauen.
      Ich frage mich, ob jemand weiß, wie das genau funktioniert, ohne Foreign Keys zu verwenden.
  • Ich habe wohl die erste Leo-Ankündigung verpasst, aber es ist interessant, und mir gefällt das auf Datenschutz bedachte Design.
    Dass Chatverläufe nicht gespeichert werden, ist genau das, was ich wollte.

  • Ich frage mich, wer ein guter API-Anbieter für Mixtral ist.
    Ich kenne nur OctoAI, das ganz gut aussieht, würde aber gern Alternativen kennen.

    • Der Modellhersteller betreibt ebenfalls eine eigene Plattform; dieses und andere Modelle sind dort per API nutzbar: https://console.mistral.ai/
    • Ich habe gerade Groq entdeckt; dort sollen bei mixtral 8x7B-32k 485,08 Tokens/Sekunde erreicht werden.
      Den Preis kenne ich nicht, aber offenbar kann man eine E-Mail an api@groq.com schicken.
    • OpenRouter ist insgesamt eine gute Wahl, und das Beste daran ist, dass es eine einheitliche API für alle LLMs bietet.
      Die Preise entsprechen auch den Preisen der jeweiligen Anbieter selbst.
      Allerdings mussten sie bei OpenAI-/Anthropic-Modellen wegen der Vorgaben der jeweiligen Unternehmen Input-/Output-Filterung aktivieren.
    • Das sind zwar bereits erwähnte Services, aber ich nutze Anyscale Endpoints ziemlich erfolgreich.
      Es ist sehr schnell und verarbeitet mit den Standardeinstellungen bereits 10 Aufgaben gleichzeitig.
      Together.ai sah in frühen Tests ebenfalls gut aus, aber ich habe es noch nicht im großen Maßstab genutzt.
    • Ich habe sowohl Mistrals kommerzielle API als auch AnyScales kommerzielle API mit mixtral-8-7b verwendet, und beide waren einfach zu nutzen.
      Auf einem M2 Pro mit 32 GB Arbeitsspeicher betreibe ich auch eine 3-Bit-quantisierte Version von mixtral-8-7b, die ziemlich schnell ist.
      Es ist gut, mehrere Optionen zu haben.
  • Ich habe in der vergangenen Woche die Versionen auf poe und chat.groq.com ausprobiert.
    Sie ist deutlich besser als llama 70b.

  • Interessant ist, dass man direkt in der Adressleiste LLM-Anfragen stellen kann.
    Ich frage mich, ob sie später eine Heuristik bauen, die entscheidet, ob eine Anfrage direkt an ein LLM geschickt oder der Standardsuchanbieter verwendet wird.

  • Wenn man von gpt4 zu mistral wechselt, fühlt es sich an, als würde man von einem Retina-Display wieder zu einem niedrig auflösenden Bildschirm zurückkehren.
    Man denkt ständig: „Aber GPT4 könnte das doch.“

    • Ich frage mich, ob du mixtral ausprobiert hast.
  • Ich führe Mixtral lokal mit ollama aus.

  • Ich frage mich, ob es eine gute Chrome-Erweiterung gibt, die Seiten mit AI zusammenfasst.
    Ich habe ein paar der oberen Google-Suchergebnisse ausprobiert; sie funktionieren zwar gut, waren aber wegen zu vieler unnötiger Funktionen aufgebläht.