Seedance 2.0 spricht kein Deutsch. Mit diesem Workflow schon.
← Alle Artikel

Seedance 2.0 spricht kein Deutsch. Mit diesem Workflow schon.

Chinesische Videomodelle und deutsche Sprache, das passt noch nicht zusammen. Mehrere Leute haben das zuletzt gezeigt, ich selbst auch. Gestern, kurz vor einem Kundengespräch, wollte ich es ein letztes Mal wissen und habe Seedance 2.0 nochmal getestet.

Nativ kann Seedance kein Deutsch. Der erste Testclip sagt eigentlich alles. Aber mit ein bisschen Vorarbeit komme ich trotzdem auf Ergebnisse, die ich guten Gewissens einem Kunden zeigen würde.

Der Trick sitzt vor dem Modell, nicht im Modell

Die Idee ist simpel: Ich lasse Seedance die Sprache gar nicht selbst erzeugen. Ich gebe dem Modell eine fertige deutsche Tonspur vor und sage ihm nur noch, es soll die Lippen dazu bewegen. Damit wird aus einem Sprach-Problem ein Lipsync-Problem, und das kann Seedance.

Der Ablauf im Ganzen:

  • Referenzbild der sprechenden Person generieren
  • Audio mit ElevenLabs erzeugen, sauberes Deutsch
  • Das Audio mit einem schwarzen Bild zu einem Video kombinieren
  • Referenzbild und dieses Audio-Video als Referenzen in Seedance geben
  • Im Prompt den gesprochenen Text eins zu eins mitgeben, mit der klaren Anweisung, sich maximal an der Audioreferenz zu orientieren

Das Herzstück ist der letzte Punkt. Die ElevenLabs-Spur ist die einzige Wahrheit. Der Prompt verbietet dem Modell alles, was es sonst gerne tut: keine neuen Wörter, keine Umformulierung, keine Übersetzung, kein Improvisieren, keine geänderte Aussprache. Wörter wie Schildkröte, Süßwasserfrosch oder Eisenbahnbundesamt sind für ein chinesisches Modell die reinste Folter. Wenn ich sie nicht generieren lasse, sondern nur nachsprechen, verschwindet das Problem.

Ein Detail noch aus der Praxis: Bei einzelnen Wörtern bleibt die Aussprache manchmal hartnäckig falsch. Dann hilft ein kurzer Aussprache-Hinweis im Prompt. Kein Hexenwerk, aber gut zu wissen, bevor man drei Durchläufe verschwendet.

Warum der Aufwand sich lohnt

Man könnte fragen, warum ich mir diese Kette überhaupt antue, wenn Google Veo beziehungsweise Omni natives Deutsch kann. Die ehrliche Antwort: Qualität. Für mich ist Seedance 2.0 aktuell mit Abstand das beste KI-Videomodell. Bewegung, Konsistenz, Bildqualität, da spielt es in einer eigenen Liga. Veo und Omni waren bisher die einzige Alternative für brauchbares Deutsch, aber mit Einschränkungen bei der Qualität und mit Filtern, die oft zu streng greifen.

Wenn das beste Bildmodell nur ein Sprach-Problem hat, dann löse ich das Sprach-Problem — und behalte das beste Bild.

Und der Zeitpunkt könnte besser kaum sein. Seedance 2.5 steht schon in den Startlöchern und wird die Sache noch spannender machen.

Als Nächstes baue ich das Ganze für einen Dialog zwischen zwei Personen aus. Wenn das sitzt, ist die Grenze zwischen nativer Sprachfähigkeit und cleverem Workflow praktisch aufgehoben. Genau da wird es für die Content-Produktion interessant: Nicht auf das perfekte Modell warten, sondern mit dem besten Modell arbeiten, das es heute gibt, und die Lücke selbst schließen.

Haben wir dich neugierig gemacht?

Projekt starten
← Alle Artikel