- Als Basismodell der dritten Generation für die Bildgenerierung in der Qwen-Image-Reihe verfolgt es mit „Real(实)“ ein zentrales Ziel: nicht nur ansprechende Bilder zu erzeugen, sondern sie für produktive Aufgaben nutzbar zu machen
- Verarbeitet Eingaben mit bis zu 4,5k Tokens und erzeugt in einem Durchgang informationsreiche Layouts wie Zeitungen, Storyboards oder Prüfungsbögen sowie Bilder, in denen mehrere Konzepte parallel oder überlagert vorkommen
- Rendert 10px große Schrift, LaTeX-Formeln und handschriftliche Anmerkungen lesbar und reproduziert feine Texturen wie Poren, Haare, Haut und Pinselstriche
- Unterstützt 12 Sprachen, mehrere Schriftarten, mehr als 100 Kunststile sowie Web-, Game- und Livestreaming-UIs; kann außerdem aktuelle Informationen im Internet suchen und in Bilder einfließen lassen
- Das Modell soll Bildgenerierung unter anderem für Zeitungs-PDFs, Short-Drama-Storyboards und komplexe UIs zu einem deploybaren Produktivitätstool für Design, Content-Erstellung, Bildung und E-Commerce erweitern
Ein Modell der dritten Generation auf dem Weg zu „Real“
- Qwen-Image-3.0 ist das Basismodell der dritten Generation für Bildgenerierung in der Qwen-Image-Reihe
- Die zentralen Ausrichtungen der Generationen sind:
- Qwen-Image-1.0: Precision
- Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0: Real(实)
- „Real“ besteht aus drei Fähigkeiten
- Reichhaltige Inhalte: Eingaben mit bis zu 4,5k Tokens und Unterstützung komplexer Layouts
- Realistische Details: Wiedergabe feiner Elemente wie 10px-Schrift, Poren und Haare
- Fundiertes Wissen: Generierung unter Nutzung von 12 Sprachen, verschiedenen UIs und Weltwissen
- Ziel ist es, Bildgenerierung von „nutzbar“ zu „praktisch“ und von „schön anzusehen“ zu nützlich weiterzuentwickeln
Reichhaltige Inhalte und komplexe Anordnung
- Auf Mathe-Folien kann es räumliche Beziehungen, mathematische Symbole, Erläuterungen zu Sätzen und die relativen Positionen der einzelnen Elemente gemeinsam rendern
- Mit einer Anweisung von etwa 3,7k Tokens erzeugt es ein einzelnes 3×3-Raster in einem einzigen Durchlauf, ohne mehrere Bilder zusammenzufügen
- Jede Zelle besteht aus einer komplexen Infografik, die chinesische und englische Sätze, Formeln, Diagramme und Comicfiguren kombiniert
- In einem Bild werden ein Comic zur Tunnelsicherheit, eine Unterrichtseinheit zur Raumgeometrie, eine Stilanalyse von „Chu Shi Biao“, Wurfparabeln, Parasitologie, ein medizinisches Diagramm zu rechtsseitigen Brustschmerzen, der Satz von Sylow, interne Bankkontrollen und ein Vergleich der DNA-Struktur von Zellen angeordnet
- Es verarbeitet Anweisungen mit bis zu 4,5k Tokens und versteht sowie rendert visuelle Layouts mit hoher Informationsdichte
-
Horizontale Skalierung
- Gemeint ist die Fähigkeit, mehrere parallele Elemente auf einer einzigen Leinwand anzuordnen
- Mithilfe von semantischer Gegenüberstellung und räumlicher Kontrolle werden mehrere Konzepte geordnet, ohne sich gegenseitig zu stören
-
Vertikale Tiefe
- Dies ist die Fähigkeit, Bedeutungen zu zerlegen und logisch verschachtelte Interfaces schrittweise darzustellen
- Mit einer einzigen Anweisung erzeugt es eine Multi-Screen-Struktur, in der ein VSCode-Programmierbildschirm, Qwen Chat, WeChat und ein Poster für Handfilterkaffee überlagert sind
- Jede Ebene behält den Stil und die Detailelemente der jeweiligen UI bei
Von kleiner Schrift bis zur Restaurierung von Gemälden
-
Kleine Schrift und komplexer Satz
- Auch kleine Schrift mit 10px Größe wird lesbar gerendert
- Es kann Bereiche mit viel Text und Illustrationen gemeinsam erzeugen, etwa eine Wissensinfografik über Walhaie
- Auf einer Seite einer algebraisch-geometrischen Arbeit reproduziert es LaTeX-Formeln, Hoch- und Tiefstellungen, griechische Buchstaben, Satznummern, geschweifte Klammern, Bruchstriche und mehrzeilige Ausrichtung
- Auch bei kleinen Schriftgrößen bleibt die Lesbarkeit von Formeln und Fließtext erhalten
- Durch die Kombination realistischer Papiertextur mit dicht gesetztem Text erzeugt es Bilder im Zeitungsformat
-
Bearbeitung und Handschrift
- Auf Buchseiten lassen sich rote handschriftliche Anmerkungen hinzufügen
- Dazu gehören Unterstreichungen, Wellenlinien, Kreise, Pfeile und kurze Notizen
- Es setzt einen natürlichen Handschriftstil um, wie er in Unterrichtsnotizen von Oberschülern vorkommt
-
Texturdarstellung und Restaurierung
- In Porträtfotos stellt es feine Elemente wie Poren, Haare und Hauttextur dar und kann auch die feinen Texturen anderer Objekte ausdrücken
- Beschädigte oder teilweise verschwundene traditionelle Gemälde werden passend zum ursprünglichen Malstil und Pinselduktus restauriert
- Bei einem Adlerkampfgemälde entfernt es Schimmelflecken und Schadspuren und ergänzt fehlende Bereiche, während es Abstufungen der Tusche, Federtextur und kompositorische Balance beibehält
Nutzung von Sprachen, UI und Weltwissen
- Es unterstützt 12 Sprachen, mehrere Schriftarten, mehr als 100 Kunststile und verschiedene UI-Interfaces
- Enthalten sind Beispiele, in denen Japanisch, Koreanisch und Spanisch korrekt gerendert werden
- Es kann verschiedene Arten realistischer UI-Bildschirme erzeugen, darunter Webseiten, Spiele und Livestreaming
-
Wissensbasierte Infografiken
- Es behält das Hauptmotiv eines realen Insektenfotos bei und erweitert es zu einer Forschungsinfografik
- Enthalten sind taxonomische Informationen, Anmerkungen zu morphologischen Merkmalen, vergrößerte Detailansichten und Maßstabsbalken
- Das Ergebnis wird als Forschungsdiagramm aufgebaut, das direkt für wissenschaftliche Publikationen verwendet werden kann
-
Nutzung aktueller Informationen und IP
- Das Modell kann nicht nur auf sein vorhandenes Wissen zugreifen, sondern auch eine Internetverbindung nutzen, um aktuelle Informationen zu suchen
- Es sucht das Wetter in Hangzhou am 21. Juli und erzeugt daraus ein Wettervorhersagebild
- Es kann bestimmte IP-Figuren finden und auf dieser Grundlage Bilder erstellen
- Es erzeugt eine Szene, in der Qi Baishi und Van Gogh in einem Livestreaming-Raum Qwen-Image-3.0 vorstellen
Erweiterung zu Produktivitätsaufgaben
- Auf Basis der drei Kernfähigkeiten unterstützt es hochwertige Aufgaben wie Zeitungs-PDFs, Short-Drama-Storyboards und komplexe UI-Interfaces
- Ziel ist es, die Fähigkeiten der Bildgenerierung mit Produktivitätswert in weiteren Bereichen wie Design, Content-Erstellung, Bildung und E-Commerce zu verbinden
1 Kommentare
Hacker-News-Kommentare
Es fühlt sich merkwürdig an, solche Modelle in den Onlinehandel zu drücken. Weil sie Kleidung so korrigieren, dass sie gut am Körper sitzt, und sogar die Beleuchtung ansprechend machen, bleibt Tragegefühl und Passform der realen Kleidung genauso schwer einzuschätzen wie vor der Einführung
In 50 Jahren könnte die „Wahrhaftigkeit von Werbung“ selbst als unwiederbringliche ideale Vergangenheit gelten
Aber bei einer Plattform, auf der jeden Monat 1.000 neue Produkte eingestellt werden, dürften echte, unvollkommene Fotos auch für die Conversion vor dem Kauf vorteilhafter sein. Besonders 3D-artige Bilder, bei denen alle Farbvarianten gleich aussehen, wirken eher abschreckend
Interessant ist, dass in den Meta-Keywords des HTML über 100 Einträge mit Bezug zu Erwachsenenmaterial wie hentai, nudes usw. stehen
Wenn man in der Konsole
document.querySelector('meta[name="keywords"]').contentausführt, kann man den gesamten Tag sehenqwengesammelt und dabei auch Tippfehler wiegwenoderbenim Kontext von Erwachsenenmaterial einbezogenkeywords-Meta-Tag heutzutage noch hat, und er fügt der Seite nur über 77 KB nutzloser Daten hinzuEs scheint mit Ausgaben von GPT Image 1 trainiert worden zu sein; der typische Gelbstich ist deutlich
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
Das Arabisch im Titelbild ist offensichtlich kaputt, aber bei der tatsächlichen Nutzung des Modells ist das nicht so. Möglicherweise wurde das Titelbild gar nicht mit Qwen Image 3.0 erzeugt
Es hieß, man brauche 3.700 Token, um ein komplettes 3×3-Raster exakt zu beschreiben, aber weil der Prompt nicht veröffentlicht wurde, wirkt die Demo weniger überzeugend
Es gibt keinerlei Angaben dazu, wann und ob die Gewichte veröffentlicht werden; ich frage mich, ob das irgendwo separat steht
Ich habe 2 echte Logos, eine vollständige Spezifikation der Designsprache und 3 Screenshots von Anwendungsoberflächen bereitgestellt, bekam aber nur 3 schreckliche Bilder, von denen keines dem übergebenen Originallogo entsprach
Bei Tests auf chat.qwen.ai erreichte es weder bei Komposition noch bei anatomischer Genauigkeit auch nur Qwen Image 1-Niveau. Es erzeugt Ergebnisse mit drei Beinen oder leuchtenden Augen und liegt qualitativ etwa bei dem zurückgezogenen Microsoft Lens
Ich glaube, ich hätte mir ein solches Modell zu Studienzeiten gewünscht. Als visueller Lerntyp hätte ich manche Themen über Diagramme und erklärende Illustrationen viel leichter verstanden als über lange Texte
Als ich Nano Banana 2 um ein „Infografik-Poster für Studierende im Grundstudium, das erklärt, wie ein Atom funktioniert“ bat, wurde ein Bohrsches Modell erzeugt, das wie aus einem Naturwissenschaftsbuch der Mittelstufe wirkte
In den Bildern bleibt weiterhin überall ein gelblicher Filter zurück