1 Punkte von catch88 7 시간 전 | Noch keine Kommentare. | Auf WhatsApp teilen

Ich wollte nicht den ganzen Tag einen Telegram-Tab offen lassen, um mit meinem lokalen Agenten (Hermes/OpenClaw) zu sprechen, also habe ich einen Avatar gebaut, der diesen Platz einnimmt. Das sind zwei videotelefonartige Fenster, die dauerhaft auf dem Monitor bleiben (Avatar + Chat), und die Antworten des Agenten nicht vorlesen, sondern „aufführen“ lassen.

  • Der Avatar nutzt zur Laufzeit keine GPU. Statt Echtzeit-Inferenz werden rund 30 vorgerenderte Clips anhand von Emotion-Tags aus der LLM-Ausgabe ausgewählt und abgespielt. Bei [working] setzt er eine Brille auf und macht Notizen, bei einem [confirm]-Tag erscheinen Genehmigen/Abbrechen, damit vor unumkehrbaren Aktionen nachgefragt wird, und Code/Logs werden nicht vorgelesen, sondern als Karten gerendert. Die GPU bleibt vollständig dem Modell vorbehalten.

  • Er ersetzt den Agenten nicht, sondern wird als Connector angebunden. Die Architektur ist so, dass das Gateway per Dial-out zu einem lokalen WebSocket verbindet, den die App geöffnet hat; aus Sicht des Agenten kommt also einfach ein weiterer Kanal hinzu. Auch das Slash-Command-Menü des Agenten wird unverändert übernommen und angezeigt.

  • Sprache bidirektional: Edge TTS (durch lokale Engine ersetzbar) + Silero VAD·faster-whisper.

  • Open Core (MIT). Ein kostenloser Starter-Avatar ist enthalten, sodass es nach dem Klonen sofort läuft. Dieser Avatar wurde selbst ausschließlich mit kostenlosen lokalen Tools erstellt (Animagine XL → HunyuanVideo 1.5 i2v) und ist damit auch ein Beispiel, das zeigt, dass die in der Dokumentation beschriebene Erstellungsmethode tatsächlich funktioniert.

Was ich beim Bauen gelernt habe: Für Video-Diffusionsmodelle ist es schwieriger als gedacht, subtile Gesichtsausdrücke per Prompt zu erzeugen. Wan 2.2 5B schafft ein Lächeln mit weit geöffnetem Mund, aber Emotionen, die über die Augenbrauen ausgedrückt werden, wie „besorgt“ oder „wütend“, kamen einfach neutral heraus. Nach dem Wechsel auf HunyuanVideo 1.5 (8.3B Step-Distillation) war es auf derselben 12-GB-Karte schneller und die Mimik funktionierte korrekt.

Derzeit gibt es nur einen Windows-Build, und Echtzeit-Lipsync ist nicht vorhanden (ein Trade-off des Vorab-Renderns).

Noch keine Kommentare.

Noch keine Kommentare.