1 Punkte von sjh9714 3 시간 전 | Noch keine Kommentare. | Auf WhatsApp teilen

Bildmodell-Kataloge sammeln meist nur die gelungenen Beispiele. Gerade das, was man wirklich braucht — "das geht nicht" —
fehlt. Also habe ich 561 Bilder durchlaufen lassen, 475 behalten und auch die 65 verworfenen zusammen mit den Gründen für ihr Scheitern
veröffentlicht. Sowohl die behaltenen als auch die verworfenen Bilder haben jeweils ihren Seed, sodass man sie exakt reproduzieren kann.

Koreanisch funktioniert. Nur werden falsche Wörter jedes Mal auf die gleiche Weise falsch geschrieben

Zuerst hatte ich nach nur einem Bild geschrieben: "Selbst wenn man Koreanisch angibt, wird es falsch geschrieben", aber nachdem ich sechs Beispiele ausprobiert habe, war das übertrieben. Vier waren exakt korrekt. guksu, doseogwan, "3beon chulgu" (Zahl + Koreanisch),
"oneur-ui chucheon menyu" (drei Wörter mit insgesamt sechs Silben).

Die Länge ist nicht die Variable. Zwei Silben funktionieren, sechs auch, aber ein Wort mit vier Silben war falsch.

Die zwei Fehler sind interessant. "Jeongjikan guksu" wurde zu "Jeongjeokan guksu", und selbst mit anderem Seed
kam genau derselbe Fehler heraus (1167746582, 1910572019). Derselbe Tippfehler zweimal. Das ist kein Seed-Glück, sondern ein Problem dieses Worts. "Hanbat Sikdang" wurde zu "Hanppaet Sikdang",
und das ist eine nicht existierende Silbe.

Beide Fehler kippten beim Endkonsonanten, aber auch guk·neul·cheon haben Endkonsonanten und wurden korrekt ausgegeben, daher will ich aus diesen zwei Fällen die Ursache nicht vorschnell festlegen.

Wenn es also falsch ist, würfelt nicht den Seed neu, sondern ändert den Text. Auch bei erneutem Würfeln scheitert es an derselben Stelle.

Zeichen, die man vorgibt, werden gezeichnet. Zeichen, die erfunden werden müssten, werden nicht gezeichnet

Drei Batches lang war ich irrtümlich überzeugt, dass die "Anzahl der Zeichenketten die Grenze" sei. Um die Grenze zu finden, habe ich auf demselben Schild nur die Zahl der Zeichenketten von 1→8 erhöht — und alle acht waren korrekt.

Die Anzahl war also nicht die Variable. Als ich die bisherigen Fehlschläge erneut ansah, wurde der Trennpunkt klar.

  • Café-Menütafel: Die drei im Prompt geschriebenen Einträge waren korrekt, der Rest wurde zu CAPEME, CABIELO
  • Zeitleiste: Ich hatte nur den Jahresbereich festgelegt; die Jahre erschienen, die Labels scheiterten
  • Kanban-Mockup: Ich hatte keine Spaltennamen angegeben, daher hießen alle drei Spalten "Kanban"

Schreibt den gesamten Text, der auf dem Bildschirm erscheinen soll, vollständig in den Prompt. Acht sind keine Grenze, sondern nur der Punkt, an dem ich aufgehört habe zu testen.

Allerdings reicht das Aufschreiben nicht immer aus. Als ich die ursprünglich gescheiterten drei Fälle erneut nur mit den Zeichenketten laufen ließ, waren bei der Menütafel alle zehn Zeilen korrekt, bei den Buchrücken 10 von 12, bei der Linienkarte aber nur 4 von 9. Wenn die Schrift klein ist und aus mehreren Winkeln rotiert, greift eine zweite Einschränkung.

Ich schrieb "Hände funktionieren im Großen und Ganzen" und nahm das drei Stunden später zurück

Ich habe Beleuchtung und Komposition fixiert, nur den Schwierigkeitsgrad der Hände in acht Stufen erhöht, auf das 1,5- bis 2-Fache vergrößert und geschrieben: "7 von 8 sind anatomisch in Ordnung." Das war ein Satz, der sich am besten verbreitet hätte, gerade weil er der gängigen Meinung widerspricht.

Keine zwei Stunden nach dem Post auf r/StableDiffusion kam ein Kommentar: "Die mit drei Fingern hat sechs Finger." Als ich auf das Vierfache vergrößerte, stimmte es. 20 Minuten später wies jemand anderes auf überlappte Hände hin. "Auch das ist falsch, es sind nur vier."

Zwei Leute fanden bei 3 von 8 Bildern genau das eine, was ich nicht getan hatte. Sie haben gezählt.

Darum habe ich die ganze Kategorie zurückgezogen. Ich habe nicht Bild für Bild neu bewertet. Das Werkzeug, das versagt hat, waren meine Augen; wenn ich mit denselben Augen die übrigen fünf beurteile, mache ich denselben Fehler ein drittes Mal. Alle 8 Bilder habe ich zusammen mit dem Seed in die Fehlkategorie verschoben.

Weitere Messergebnisse

  • Objekte kann es zählen, Eigenschaften nicht. Eier mit "genau N Stück" waren von 2 bis 8 alle korrekt,
    aber bei "genau zwei Farben" kamen vier Farben heraus. Wenn man die Objekte einzeln zeigen kann, kann man eine Anzahl verlangen; wenn man Farben, Bereiche oder Lichtquellen zählt, zählt das Ergebnis selbst nach.
  • Wenn man Licht beim Namen nennt, erscheint das Beleuchtungsgerät im Bild. In beiden Prompts mit "Softbox" erschien die Softbox als Motiv. Beschreibt, was das Licht tun soll.
  • Auch wenn man "seamless" schreibt, wird es nicht gekachelt. Von 8 Mustern war nur 1 nahtlos, und selbst das nur, weil es vertikale Streifen hatte und die Ränder dadurch zufällig passten.
  • "straight down" ist ein Wunsch, keine Anweisung. Bei 5 von 8 Luftaufnahmen kam ein schräger Winkel heraus. Wenn etwas Vertikales wie ein Kran oder ein Haus im Bild ist, neigt sich die Kamera nach unten, um genau das zu zeigen.
  • Größenvergleiche tauschen das Subjekt aus. Bei einem "käfer so groß wie ein Pony" kam ein gesatteltes Pony heraus. Einen Käfer gibt es nicht.
  • Dieselbe Person in ein anderes Foto zu setzen funktioniert nicht. Bei strength 0.45 bleibt das Gesicht, aber die ganze Komposition wird mitgezogen; bei 0.72 wird es eine andere Person. Dazwischen gibt es keinen funktionierenden Wert.
  • Image-to-image kann keine Objekte hinzufügen oder entfernen. Dagegen funktionieren Medienwechsel (Foto → Gouache usw.) stabil. Im strength-Bereich 0.50–0.60.

Die Gesamtkosten lagen bei $4.54 (fal.ai, $0.008 pro Megapixel).

Koreanisches README: https://github.com/sjh9714/awesome-krea-2/blob/main/README_KO.md
Alle Bilder durchsehen: https://sjh9714.github.io/awesome-krea-2/
Nur die Bearbeitungsrezepte, als Agent-Skill extrahiert: https://github.com/sjh9714/same-frame

Noch keine Kommentare.

Noch keine Kommentare.