Eine Pipeline, die allein aus auf dem Smartphone aufgenommenem Material ein kurzes Vorstellungsvideo für Hunde erstellt. Gibt man mehrere rohe Smartphone-Videos und einen Absatz mit einer natürlichsprachlichen Anfrage ein, entsteht nach etwa 4 Minuten ein vertikales 9:16-Video mit Untertiteln und Erzählerstimme. Der gesamte Ablauf von der Erkennung bis zu TTS wurde so entworfen, dass er lokal auf einem einzelnen MacBook läuft.
Es ist nicht schwer, einem LLM Videos zu geben und daraus eine plausibel wirkende Demo zu erzeugen. Stattdessen habe ich mir zum Ziel gesetzt, zwei Fragen zu beantworten: Kann man morgen noch einmal exakt dasselbe Ergebnis erzeugen, und vermischt sich dabei nicht von der KI Erfundenes mit vom Menschen Festgelegtem?
Struktur
- Das LLM übernimmt nur die Interpretation, die Ausführung ist deterministisch. Gemma (lokal) übernimmt nur semantische Entscheidungen wie Aktionsnamen, die Zerlegung von Schnittanweisungen und Szenenbeobachtung, während sich Python/OpenCV/ffmpeg vollständig um Pixel, Frames und Timing kümmern. Bei gleicher Eingabe entsteht die gleiche Ausgabe.
- Erkennung und Tracking übernehmen YOLO11 + ByteTrack, die Re-Identifikation mehrerer Hunde DINOv2-Embeddings + Ankerfotos der Halter, und die Unterscheidung von Bewegung und Stillstand erfolgt ausschließlich über ROI-Residuenmessung mit kompensierter Kamerabewegung. Achsen, die ein LLM strukturell nicht sehen kann, etwa Bewegung in einem einzelnen Stillbild, werden dem LLM nicht überlassen.
- TTS wird lokal mit Qwen3-TTS (mlx-audio) synthetisiert und per Whisper-CER-Gate im Roundtrip geprüft.
- Vom LLM erfundene Untertitel werden in Tatsachenbehauptungen zerlegt und mit den Video-Beobachtungsprotokollen abgeglichen; fehlt eine Grundlage, werden sie neu geschrieben. Vom Nutzer direkt verfasste Untertitel werden nicht geprüft.
Entscheidungsweise
- Änderungen an Modellen und Parametern wurden vollständig anhand der Auswertung eines handgelabelten Golden Sets entschieden.
- Verbesserungsvorschläge, von denen ich selbstverständlich erwartet hatte, dass sie besser werden, wurden bei der Bewertung des Golden Sets gleich zweimal verworfen.
Zahlen
- 148 Unit-Tests, Genauigkeit der Aktionsgruppenerkennung auf M4: 1.00
- Generierungszeit über den vollständigen Lebenszyklus von 8 auf 4 Minuten reduziert.
Grenzen
Das Golden Set umfasst 5 bis 9 Videos, eine Domain und ein Einzelentwickler-Projekt. Es ist die Strenge der Methodik, nicht die Validierung im großen Maßstab.
Den Entwicklungsprozess habe ich als Blogserie veröffentlicht.
Es steht unter der MIT-Lizenz. Fragen dazu, wie sich diese Methodik auf andere Domains übertragen lässt, oder zu den einzelnen Entscheidungen sind willkommen.
Noch keine Kommentare.