2 Punkte von GN⁺ 3 시간 전 | 1 Kommentare | Auf WhatsApp teilen
  • Als Basismodell der dritten Generation für die Bildgenerierung in der Qwen-Image-Reihe verfolgt es mit „Real(实)“ ein zentrales Ziel: nicht nur ansprechende Bilder zu erzeugen, sondern sie für produktive Aufgaben nutzbar zu machen
  • Verarbeitet Eingaben mit bis zu 4,5k Tokens und erzeugt in einem Durchgang informationsreiche Layouts wie Zeitungen, Storyboards oder Prüfungsbögen sowie Bilder, in denen mehrere Konzepte parallel oder überlagert vorkommen
  • Rendert 10px große Schrift, LaTeX-Formeln und handschriftliche Anmerkungen lesbar und reproduziert feine Texturen wie Poren, Haare, Haut und Pinselstriche
  • Unterstützt 12 Sprachen, mehrere Schriftarten, mehr als 100 Kunststile sowie Web-, Game- und Livestreaming-UIs; kann außerdem aktuelle Informationen im Internet suchen und in Bilder einfließen lassen
  • Das Modell soll Bildgenerierung unter anderem für Zeitungs-PDFs, Short-Drama-Storyboards und komplexe UIs zu einem deploybaren Produktivitätstool für Design, Content-Erstellung, Bildung und E-Commerce erweitern

Ein Modell der dritten Generation auf dem Weg zu „Real“

  • Qwen-Image-3.0 ist das Basismodell der dritten Generation für Bildgenerierung in der Qwen-Image-Reihe
  • Die zentralen Ausrichtungen der Generationen sind:
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • „Real“ besteht aus drei Fähigkeiten
    • Reichhaltige Inhalte: Eingaben mit bis zu 4,5k Tokens und Unterstützung komplexer Layouts
    • Realistische Details: Wiedergabe feiner Elemente wie 10px-Schrift, Poren und Haare
    • Fundiertes Wissen: Generierung unter Nutzung von 12 Sprachen, verschiedenen UIs und Weltwissen
  • Ziel ist es, Bildgenerierung von „nutzbar“ zu „praktisch“ und von „schön anzusehen“ zu nützlich weiterzuentwickeln

Reichhaltige Inhalte und komplexe Anordnung

  • Auf Mathe-Folien kann es räumliche Beziehungen, mathematische Symbole, Erläuterungen zu Sätzen und die relativen Positionen der einzelnen Elemente gemeinsam rendern
  • Mit einer Anweisung von etwa 3,7k Tokens erzeugt es ein einzelnes 3×3-Raster in einem einzigen Durchlauf, ohne mehrere Bilder zusammenzufügen
    • Jede Zelle besteht aus einer komplexen Infografik, die chinesische und englische Sätze, Formeln, Diagramme und Comicfiguren kombiniert
    • In einem Bild werden ein Comic zur Tunnelsicherheit, eine Unterrichtseinheit zur Raumgeometrie, eine Stilanalyse von „Chu Shi Biao“, Wurfparabeln, Parasitologie, ein medizinisches Diagramm zu rechtsseitigen Brustschmerzen, der Satz von Sylow, interne Bankkontrollen und ein Vergleich der DNA-Struktur von Zellen angeordnet
  • Es verarbeitet Anweisungen mit bis zu 4,5k Tokens und versteht sowie rendert visuelle Layouts mit hoher Informationsdichte
  • Horizontale Skalierung

    • Gemeint ist die Fähigkeit, mehrere parallele Elemente auf einer einzigen Leinwand anzuordnen
    • Mithilfe von semantischer Gegenüberstellung und räumlicher Kontrolle werden mehrere Konzepte geordnet, ohne sich gegenseitig zu stören
  • Vertikale Tiefe

    • Dies ist die Fähigkeit, Bedeutungen zu zerlegen und logisch verschachtelte Interfaces schrittweise darzustellen
    • Mit einer einzigen Anweisung erzeugt es eine Multi-Screen-Struktur, in der ein VSCode-Programmierbildschirm, Qwen Chat, WeChat und ein Poster für Handfilterkaffee überlagert sind
    • Jede Ebene behält den Stil und die Detailelemente der jeweiligen UI bei

Von kleiner Schrift bis zur Restaurierung von Gemälden

  • Kleine Schrift und komplexer Satz

    • Auch kleine Schrift mit 10px Größe wird lesbar gerendert
    • Es kann Bereiche mit viel Text und Illustrationen gemeinsam erzeugen, etwa eine Wissensinfografik über Walhaie
    • Auf einer Seite einer algebraisch-geometrischen Arbeit reproduziert es LaTeX-Formeln, Hoch- und Tiefstellungen, griechische Buchstaben, Satznummern, geschweifte Klammern, Bruchstriche und mehrzeilige Ausrichtung
    • Auch bei kleinen Schriftgrößen bleibt die Lesbarkeit von Formeln und Fließtext erhalten
    • Durch die Kombination realistischer Papiertextur mit dicht gesetztem Text erzeugt es Bilder im Zeitungsformat
  • Bearbeitung und Handschrift

    • Auf Buchseiten lassen sich rote handschriftliche Anmerkungen hinzufügen
    • Dazu gehören Unterstreichungen, Wellenlinien, Kreise, Pfeile und kurze Notizen
    • Es setzt einen natürlichen Handschriftstil um, wie er in Unterrichtsnotizen von Oberschülern vorkommt
  • Texturdarstellung und Restaurierung

    • In Porträtfotos stellt es feine Elemente wie Poren, Haare und Hauttextur dar und kann auch die feinen Texturen anderer Objekte ausdrücken
    • Beschädigte oder teilweise verschwundene traditionelle Gemälde werden passend zum ursprünglichen Malstil und Pinselduktus restauriert
    • Bei einem Adlerkampfgemälde entfernt es Schimmelflecken und Schadspuren und ergänzt fehlende Bereiche, während es Abstufungen der Tusche, Federtextur und kompositorische Balance beibehält

Nutzung von Sprachen, UI und Weltwissen

  • Es unterstützt 12 Sprachen, mehrere Schriftarten, mehr als 100 Kunststile und verschiedene UI-Interfaces
  • Enthalten sind Beispiele, in denen Japanisch, Koreanisch und Spanisch korrekt gerendert werden
  • Es kann verschiedene Arten realistischer UI-Bildschirme erzeugen, darunter Webseiten, Spiele und Livestreaming
  • Wissensbasierte Infografiken

    • Es behält das Hauptmotiv eines realen Insektenfotos bei und erweitert es zu einer Forschungsinfografik
    • Enthalten sind taxonomische Informationen, Anmerkungen zu morphologischen Merkmalen, vergrößerte Detailansichten und Maßstabsbalken
    • Das Ergebnis wird als Forschungsdiagramm aufgebaut, das direkt für wissenschaftliche Publikationen verwendet werden kann
  • Nutzung aktueller Informationen und IP

    • Das Modell kann nicht nur auf sein vorhandenes Wissen zugreifen, sondern auch eine Internetverbindung nutzen, um aktuelle Informationen zu suchen
    • Es sucht das Wetter in Hangzhou am 21. Juli und erzeugt daraus ein Wettervorhersagebild
    • Es kann bestimmte IP-Figuren finden und auf dieser Grundlage Bilder erstellen
    • Es erzeugt eine Szene, in der Qi Baishi und Van Gogh in einem Livestreaming-Raum Qwen-Image-3.0 vorstellen

Erweiterung zu Produktivitätsaufgaben

  • Auf Basis der drei Kernfähigkeiten unterstützt es hochwertige Aufgaben wie Zeitungs-PDFs, Short-Drama-Storyboards und komplexe UI-Interfaces
  • Ziel ist es, die Fähigkeiten der Bildgenerierung mit Produktivitätswert in weiteren Bereichen wie Design, Content-Erstellung, Bildung und E-Commerce zu verbinden

1 Kommentare

 
GN⁺ 3 시간 전
Hacker-News-Kommentare
  • Es fühlt sich merkwürdig an, solche Modelle in den Onlinehandel zu drücken. Weil sie Kleidung so korrigieren, dass sie gut am Körper sitzt, und sogar die Beleuchtung ansprechend machen, bleibt Tragegefühl und Passform der realen Kleidung genauso schwer einzuschätzen wie vor der Einführung

    • Das kurzfristige Ziel ist der Verkauf von Produkten, aber das ehrgeizigere langfristige Ziel besteht darin, die Grenze zwischen Werbung und Realität zu verwischen und kulturelle Normen so zu verändern, dass normale Menschen sich solche Fragen zum Kaufzeitpunkt gar nicht mehr stellen
      In 50 Jahren könnte die „Wahrhaftigkeit von Werbung“ selbst als unwiederbringliche ideale Vergangenheit gelten
    • Was manche wollen, ist vielleicht weniger generative KI an sich als eine Bild-zu-Bild-Transformation nach dem Motto „Mach daraus etwas, das aussieht, als hätte es ein fähiger Fotograf aufgenommen“
      Aber bei einer Plattform, auf der jeden Monat 1.000 neue Produkte eingestellt werden, dürften echte, unvollkommene Fotos auch für die Conversion vor dem Kauf vorteilhafter sein. Besonders 3D-artige Bilder, bei denen alle Farbvarianten gleich aussehen, wirken eher abschreckend
    • Ähnlich ist es bei Anzeigen für gebrauchte Möbel auf Facebook Marketplace. Die meisten Bilder sind per KI wie ein Pottery-Barn-Katalog aufgehübscht, und erst ganz am Ende sieht man ein Foto des tatsächlichen Gegenstands voller Kratzer und Schäden in einer unordentlichen Garage
    • Fraglich ist, ob das wirklich weniger verzerrend ist als die bisherige Methode, bei der ein professioneller Fotograf ein Model unter perfekter Beleuchtung mit dem Hemd fotografiert
  • Interessant ist, dass in den Meta-Keywords des HTML über 100 Einträge mit Bezug zu Erwachsenenmaterial wie hentai, nudes usw. stehen

    • Diese Keywords werden global auch auf Seiten wie https://qwen.ai/usagepolicy angewendet, auf denen darum gebeten wird, das Produkt nicht für sexuelle Inhalte zu verwenden
      Wenn man in der Konsole document.querySelector('meta[name="keywords"]').content ausführt, kann man den gesamten Tag sehen
    • Offenbar hat irgendein Tool zur Suchmaschinenoptimierung automatisch Meta-Keywords hinzugefügt. Möglicherweise wurden gängige Suchbegriffe mit qwen gesammelt und dabei auch Tippfehler wie gwen oder ben im Kontext von Erwachsenenmaterial einbezogen
    • Ich weiß nicht, welchen Wert ein keywords-Meta-Tag heutzutage noch hat, und er fügt der Seite nur über 77 KB nutzloser Daten hinzu
    • Dem Qwen-Team dürfte auch klar sein, dass Communities für Erwachsenenmaterial neue Bildgenerierungsmodelle schnell übernehmen, wie man bei Civitai sieht. Das wirkt wie eine SEO-Strategie, um das Modell in Suchergebnissen zu platzieren, die diese Nutzer ohnehin prüfen
  • Es scheint mit Ausgaben von GPT Image 1 trainiert worden zu sein; der typische Gelbstich ist deutlich
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • Auch GPT Image 1 bekam einen Gelbstich, ohne mit Ausgaben anderer Bildgenerierungsmodelle trainiert worden zu sein. Weil Menschen Fotos mit weichem Sonnenuntergangslicht bevorzugen und Präferenzmodelle das leicht erfassen, entsteht bei der Optimierung auf ästhetische Wirkung in allen Bildern ein leichter Farbstich, sofern man ihn nicht gezielt unterdrückt
    • Gelbe und rötliche Farbstiche sind unabhängig von der Herkunft der Trainingsfotos ein sehr häufiges Problem. In einem Fotografie-Startup trat der Farbstich auch beim Training mit Originalbildern auf, und es blieb schwierig, ihn zu verhindern
    • Da KI-generierte Bilder inzwischen Teil des Webs sind, lassen sie sich bei gewöhnlichem Web Scraping in den Trainingsdaten nicht vermeiden
  • Das Arabisch im Titelbild ist offensichtlich kaputt, aber bei der tatsächlichen Nutzung des Modells ist das nicht so. Möglicherweise wurde das Titelbild gar nicht mit Qwen Image 3.0 erzeugt

    • Das ist ein guter Maßstab, um neue Modelle zu testen. Als ich GPT Image 2 und Nano Banana Pro mit Tamil und arabischen Koranversen getestet habe, wurden sie korrekt generiert, vermutlich dank der riesigen Trainingsdatenmenge
  • Es hieß, man brauche 3.700 Token, um ein komplettes 3×3-Raster exakt zu beschreiben, aber weil der Prompt nicht veröffentlicht wurde, wirkt die Demo weniger überzeugend

  • Es gibt keinerlei Angaben dazu, wann und ob die Gewichte veröffentlicht werden; ich frage mich, ob das irgendwo separat steht

    • Die Gewichte von Qwen-Image-2.0 wurden ebenfalls nicht veröffentlicht, daher scheint es auch diesmal unwahrscheinlich
    • Nach Z-Image und dem ersten Qwen-Image scheinen sie vollständig auf geschlossene Modelle umgestiegen zu sein. Den veröffentlichten Bildern nach wirkt Qwen-Image 3.0 nur wie eine schlechtere Alternative zu proprietären Modellen wie gpt-image-2 oder nb-pro
    • Wenn sie es veröffentlichen, werden ohnehin Cursor, Azure und Amazon es monetarisieren; warum sollten sie das also tun? Solange OpenAI nicht wirklich öffnet, ist die Chance gering
  • Ich habe 2 echte Logos, eine vollständige Spezifikation der Designsprache und 3 Screenshots von Anwendungsoberflächen bereitgestellt, bekam aber nur 3 schreckliche Bilder, von denen keines dem übergebenen Originallogo entsprach

  • Bei Tests auf chat.qwen.ai erreichte es weder bei Komposition noch bei anatomischer Genauigkeit auch nur Qwen Image 1-Niveau. Es erzeugt Ergebnisse mit drei Beinen oder leuchtenden Augen und liegt qualitativ etwa bei dem zurückgezogenen Microsoft Lens

  • Ich glaube, ich hätte mir ein solches Modell zu Studienzeiten gewünscht. Als visueller Lerntyp hätte ich manche Themen über Diagramme und erklärende Illustrationen viel leichter verstanden als über lange Texte

    • Aber die erzeugten Diagramme sind nur Imitationen. Wenn man ein Poster anfordert, das die Bestandteile eines Atoms korrekt erklärt, bekommt man statt Darstellungen im Zusammenhang mit Wahrscheinlichkeitswolken rote, blaue und graue Tischtennisbälle auf Kreisbahnen, und mit Glück ein Diagramm der Elektronenschalen
      Als ich Nano Banana 2 um ein „Infografik-Poster für Studierende im Grundstudium, das erklärt, wie ein Atom funktioniert“ bat, wurde ein Bohrsches Modell erzeugt, das wie aus einem Naturwissenschaftsbuch der Mittelstufe wirkte
    • Meine Frau hat alle Rezepte in die Bildgenerierung von ChatGPT gesteckt und daraus Seiten im Magazin-Stil gemacht; die Ergebnisse sind hervorragend. Sie erstellt gerade ein Familienkochbuch, damit die Kinder die Gerichte kennen, die sie in ihrer Kindheit gegessen haben
  • In den Bildern bleibt weiterhin überall ein gelblicher Filter zurück