3 Punkte von chessire 3 시간 전 | Noch keine Kommentare. | Auf WhatsApp teilen

Eine Pipeline, die allein aus auf dem Smartphone aufgenommenem Material ein kurzes Vorstellungsvideo für Hunde erstellt. Gibt man mehrere rohe Smartphone-Videos und einen Absatz mit einer natürlichsprachlichen Anfrage ein, entsteht nach etwa 4 Minuten ein vertikales 9:16-Video mit Untertiteln und Erzählerstimme. Der gesamte Ablauf von der Erkennung bis zu TTS wurde so entworfen, dass er lokal auf einem einzelnen MacBook läuft.

Demo-Video

Es ist nicht schwer, einem LLM Videos zu geben und daraus eine plausibel wirkende Demo zu erzeugen. Stattdessen habe ich mir zum Ziel gesetzt, zwei Fragen zu beantworten: Kann man morgen noch einmal exakt dasselbe Ergebnis erzeugen, und vermischt sich dabei nicht von der KI Erfundenes mit vom Menschen Festgelegtem?

Struktur

  • Das LLM übernimmt nur die Interpretation, die Ausführung ist deterministisch. Gemma (lokal) übernimmt nur semantische Entscheidungen wie Aktionsnamen, die Zerlegung von Schnittanweisungen und Szenenbeobachtung, während sich Python/OpenCV/ffmpeg vollständig um Pixel, Frames und Timing kümmern. Bei gleicher Eingabe entsteht die gleiche Ausgabe.
  • Erkennung und Tracking übernehmen YOLO11 + ByteTrack, die Re-Identifikation mehrerer Hunde DINOv2-Embeddings + Ankerfotos der Halter, und die Unterscheidung von Bewegung und Stillstand erfolgt ausschließlich über ROI-Residuenmessung mit kompensierter Kamerabewegung. Achsen, die ein LLM strukturell nicht sehen kann, etwa Bewegung in einem einzelnen Stillbild, werden dem LLM nicht überlassen.
  • TTS wird lokal mit Qwen3-TTS (mlx-audio) synthetisiert und per Whisper-CER-Gate im Roundtrip geprüft.
  • Vom LLM erfundene Untertitel werden in Tatsachenbehauptungen zerlegt und mit den Video-Beobachtungsprotokollen abgeglichen; fehlt eine Grundlage, werden sie neu geschrieben. Vom Nutzer direkt verfasste Untertitel werden nicht geprüft.

Entscheidungsweise

  • Änderungen an Modellen und Parametern wurden vollständig anhand der Auswertung eines handgelabelten Golden Sets entschieden.
  • Verbesserungsvorschläge, von denen ich selbstverständlich erwartet hatte, dass sie besser werden, wurden bei der Bewertung des Golden Sets gleich zweimal verworfen.

Zahlen

  • 148 Unit-Tests, Genauigkeit der Aktionsgruppenerkennung auf M4: 1.00
  • Generierungszeit über den vollständigen Lebenszyklus von 8 auf 4 Minuten reduziert.

Grenzen
Das Golden Set umfasst 5 bis 9 Videos, eine Domain und ein Einzelentwickler-Projekt. Es ist die Strenge der Methodik, nicht die Validierung im großen Maßstab.

Den Entwicklungsprozess habe ich als Blogserie veröffentlicht.
Es steht unter der MIT-Lizenz. Fragen dazu, wie sich diese Methodik auf andere Domains übertragen lässt, oder zu den einzelnen Entscheidungen sind willkommen.

Noch keine Kommentare.

Noch keine Kommentare.