Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 13von 14 im Pfad

Video, Musik und 3D

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Grundkurs, Kapitel 14 endet beim Einzelbild. Kapitel 09 nimmt das Video dort auf, wo es zum Übungsplatz für einen Agenten wird. Dazwischen liegt der Fall, um den es hier geht: Video, Ton und Raum als Ergebnis, das jemand ansehen oder anhören will.

Vorweg eine Auskunft über dieses Kapitel: Es empfiehlt kein Werkzeug. Die genannten Angaben stammen von den Herstellern, unabhängige Messungen dazu liegen nicht vor, und eine Empfehlung ohne eigene Erfahrung wäre auf dieser Seite fehl am Platz.

Die Zeitachse ist das Neue

Ein Bild hat keine Reihenfolge. Ein Video hat eine, und daraus folgt die Anforderung, die es beim Einzelbild nicht gibt: Was im ersten Bild zu sehen ist, muss im dreißigsten noch dasselbe sein.

Wie ein Videomodell gebaut ist, sagt OpenAI in einem Satz, der die Verwandtschaft zum Sprachmodell zeigt:

Whereas LLMs have text tokens, Sora has visual patches. (externe Seite, openai.com)

Zerlegt wird also in Stücke, so wie Text in Grundkurs, Kapitel 03 zerlegt wird. Der Unterschied liegt darin, dass ein solches Stück eine Fläche über eine Zeitspanne bezeichnet. Die Zahl dieser Stücke wächst mit der Dauer.

Wie lang ein Clip ist, und warum das die wichtigste Angabe ist

Beim Bildmodell war die Auflösung der Maßstab. Hier ist es die Dauer.

Ein offenes Modell von Ende 2023 erzeugte 14 and 25 frames at customizable frame rates between 3 and 30 frames per second (externe Seite, stability.ai), also wenige Sekunden. Derselbe Anbieter schrieb dazu, die Fassung sei not intended for real-world or commercial applications at this stage (externe Seite, stability.ai).

Drei Jahre später liegen die Angaben bei bis zu dreißig Sekunden aus einem Auftrag (Beleg (externe Seite, alibabacloud.com)). Wer den Fortschritt dieses Gebiets messen will, vergleicht diese beiden Zahlen.

Der Ton kommt jetzt mit

Bis vor kurzem waren Bild und Ton getrennte Läufe. Inzwischen entsteht beides im selben Vorgang:

Veo 3 lets you add sound effects, ambient noise, and even dialogue to your creations (externe Seite, deepmind.google)

Damit fällt an dieser Stelle die Grenze zu Kapitel 08 weg. Eine Stimme im Video kommt aus demselben Modell wie das Bild dazu, und die Kennzeichnungsfrage aus Conversational AI, Kapitel 09 trifft sie genauso.

Musik entsteht anders

Bild, Video und Raum entstehen über Diffusion, also über das schrittweise Entrauschen, das Grundkurs, Kapitel 14 erklärt. Musik fällt aus dieser Reihe.

We introduce MusicGen, a single Language Model (LM) that operates over several streams of compressed discrete music representation, i.e., tokens. (externe Seite, arxiv.org)

Ein Sprachmodell also, nur dass seine Token verdichtete Musik bezeichnen statt Wortteile. Der zweite Punkt jener Arbeit ist die Vereinfachung: Das Verfahren eliminates the need for cascading several models (externe Seite, arxiv.org), also für mehrere hintereinandergeschaltete Modelle.

3D hat kein Netz voller 3D-Daten

Bei Bildern gab es Milliarden Beispiele mit Beschriftung. Für den Raum fehlt dieses Material, und die Arbeit, die das Gebiet eröffnet hat, sagt es im ersten Absatz:

Adapting this approach to 3D synthesis would require large-scale datasets of labeled 3D data and efficient architectures for denoising 3D data (externe Seite, arxiv.org)

Beides fehlte. Der Ausweg war ein Umweg über das, was es gab:

In this work, we circumvent these limitations by using a pretrained 2D text-to-image diffusion model to perform text-to-3D synthesis. (externe Seite, arxiv.org)

Ein Bildmodell beurteilt also Ansichten eines räumlichen Modells, bis sie von allen Seiten überzeugen. Das ist der eine Weg. Der andere geht von Fotos aus und rechnet daraus eine Szene, und beide führen zu Ergebnissen, die gleich aussehen.

Woran Sie ein bewegtes Ergebnis festmachen

Fragen Sie nach der Dauer, bevor Sie nach der Auflösung fragen. Die Sekundenzahl entscheidet, wofür ein Modell reicht.

Rechnen Sie mit Anläufen. Ein Fehlversuch beim Bild kostet Sekunden, beim Video Minuten und Geld.

Prüfen Sie, ob der Ton dazugehört. Eine erzeugte Stimme im Video fällt unter dieselben Kennzeichnungspflichten wie eine einzeln erzeugte.

Klären Sie die Rechte vor dem ersten Einsatz. Wem ein Ergebnis gehört und ob es überhaupt geschützt ist, sind zwei getrennte Fragen.

Quellen

11 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Ben Mildenhall und Mitautoren zeigen 2020, wie sich aus einer Handvoll Fotos eine Szene so ablegen lässt, dass sich daraus neue Blickwinkel berechnen lassen. Gespeichert wird dabei eine Funktion in den Gewichten eines kleinen Netzes; ein Gitternetz oder eine Oberfläche entsteht an keiner Stelle. Diese Arbeit ist der Ausgangspunkt der Rekonstruktionsseite der 3D-Erzeugung, und sie erklärt, warum ein solches Ergebnis kein CAD-Modell ist.

  • Ankündigung des Herstellerserreichbar

    Video generation models as world simulators (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Der technische Bericht vom 15.02.2024, in dem OpenAI ein Videomodell ausdrücklich als Weg zu einem Simulator der physischen Welt beschreibt. Er nennt die Bauform (Diffusion über Raum-Zeit-Stücke statt über Text-Token) und zählt die Fähigkeiten auf, die dabei ohne eigenen Bauteil entstanden sind. Der Bericht sagt selbst, dass Modell- und Umsetzungsdetails fehlen, und er nennt die Grenzen beim Namen.

  • Ankündigung des Herstellerserreichbar

    Introducing Stable Video Diffusion (externe Seite, stability.ai)

    stability.aigeprüft 24.09.2026

    Die Ankündigung eines offenen Videomodells vom November 2023, und sie ist vor allem als Maßstab nützlich: 14 bis 25 Bilder je Clip, also wenige Sekunden. Wer den Fortschritt dieses Gebiets messen will, hat hier den Ausgangswert. Der Anbieter schreibt außerdem selbst, dass die Fassung für den produktiven Einsatz nicht gedacht ist. Die frühere Adresse unter news leitet mit 301 hierher; im Register steht das Ziel.

  • Dokumentationerreichbar

    Veo (externe Seite, deepmind.google)

    deepmind.googlegeprüft 24.09.2026

    Die Modellseite von Google DeepMind zu Veo. Die Angabe, die für ein Kapitel über Medienerzeugung zählt, ist die Tonspur: Geräusche, Umgebungsklang und Dialog entstehen im selben Lauf wie das Bild. Damit fällt die Trennung zwischen Bilderzeugung und Sprachsynthese an dieser Stelle weg. Herstellerangaben ohne Versionsvermerk, die Seite wird überschrieben.

  • Originalarbeiterreichbar

    Simple and Controllable Music Generation (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Jade Copet und Mitautoren stellen im Juni 2023 MusicGen vor, das Verfahren hinter der Musikerzeugung aus einem Textauftrag. Es fällt aus der Reihe der übrigen Medienmodelle: Wo Bild und Video über Diffusion entstehen, arbeitet dieses Modell wie ein Sprachmodell über Token, nur dass die Token verdichtete Musik bezeichnen statt Wortteile. Der zweite Punkt der Arbeit ist die Vereinfachung, denn frühere Systeme brauchten mehrere hintereinandergeschaltete Modelle.

  • Originalarbeiterreichbar

    DreamFusion: Text-to-3D using 2D Diffusion (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Ben Poole und Mitautoren beschreiben 2022 den Umweg, über den ein Textauftrag zu einem räumlichen Ergebnis wird. Der Grund für den Umweg steht im ersten Satz der Arbeit und ist die wichtigste Auskunft über dieses Gebiet: Große beschriftete 3D-Datensätze gibt es nicht, also wird ein vorhandenes Bildmodell als Ersatz benutzt. Damit trennt diese Arbeit die erfindende Seite der 3D-Erzeugung von der rekonstruierenden.

  • Ankündigung des Herstellerserreichbar

    Wan3.0: 30-Second AI Video Generation from Any Input (externe Seite, alibabacloud.com)

    alibabacloud.comgeprüft 24.09.2026

    Alibabas eigene Ankündigung von Wan3.0 mit technischen Angaben zu Länge, Auflösung, Eingabeformaten und Preisen.

  • Ankündigung des Herstellerserreichbar

    Introducing Solaris (externe Seite, runway.com)

    runway.comgeprüft 24.09.2026

    Runways eigener Forschungsbeitrag beschreibt Funktionsweise, Anwendungsbeispiele und aktuelle Grenzen von Solaris.

  • Originalarbeiterreichbar

    LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Das Paper nennt Umfang, Erhebungsmethode und Benchmark-Ergebnisse des Datensatzes, Grundlage aller Zahlen im Text.

  • Originalarbeiterreichbar

    3D Gaussian Splatting for Real-Time Radiance Field Rendering (externe Seite, repo-sam.inria.fr)

    repo-sam.inria.frgeprüft 24.09.2026

    Bernhard Kerbl und Mitautoren am Inria lösen 2023 das Tempoproblem der Szenenrekonstruktion. Ihre Arbeit nennt beide Zahlen, die den Sprung beschreiben: Vorher erreichte kein Verfahren bei voller Auflösung Echtzeit, danach sind es hundert Bilder in der Sekunde. Erschienen in den ACM Transactions on Graphics, also begutachtet.

  • Dokumentationerreichbar

    Do I have the copyrights to songs I made? (externe Seite, help.suno.com)

    help.suno.comgeprüft 24.09.2026

    Die Hilfeseite eines Anbieters für Musikerzeugung, und sie trennt zwei Fragen, die im Gespräch ständig zusammenfallen. Die erste ist der Vertrag: Im kostenlosen Tarif gehören die Stücke dem Anbieter, im bezahlten dem Nutzer. Die zweite ist das Urheberrecht, und dort steht die unbequemere Auskunft: Was vollständig maschinell entstanden ist, kann in den Vereinigten Staaten schutzlos bleiben, weil kein Mensch es geschrieben hat. Es ist eine Anbieterauskunft, deutlicher formuliert als die meisten, und ein Rechtsgutachten ersetzt sie nicht.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.