Black Forest Labs veröffentlicht FLUX 3: Ein multimodales Strömungsmodell für die Vorhersage von Bild-, Video-, Audio- und Roboteraktionen


Black Forest Labs (BFL) hat veröffentlicht FLUX 3ein multimodales Basismodell, das aus Bildern, Movies und Audio innerhalb einer einzigen Architektur lernt. Es ist außerdem das erste FLUX-Modell, das Video-, Audio- und Aktionsvorhersagen aus einem einzigen Gewichtungssatz liefert.

Das Forschungsteam der Black Forest Labs (BFL) argumentiert, dass keine einzelne Modalität eine vollständige Beschreibung der Welt liefert. Bilder erfassen räumliche Strukturen in einem Second. Video stellt die Zeit wieder her und macht physikalische Dynamiken sichtbar. Audio offenbart kausale Zusammenhänge zwischen mechanischen Ereignissen und Klang. Jedes wird als verlustbehaftete Projektion derselben zugrunde liegenden Realität behandelt.

Wenn Sie alle gleichzeitig trainieren, beschränken sich die Modalitäten gegenseitig. Der Klang muss zur Wirkung passen. Die Bewegung muss der Masse gehorchen. Das Forschungsteam bezeichnet FLUX 3 als sein erstes Modell, das vollständig auf diesem Prinzip basiert.

Die Methode darunter: Self-Circulation

FLUX 3 baut darauf auf SelbstflussBFLs Methode zur Ausrichtung multimodaler Generierung und Verständnis in einer Architektur. Self-Circulation kombiniert das Circulation-Matching-Ziel mit einem selbstüberwachten Function-Rekonstruktionsziel. Der Referenzimplementierung auf GitHub ist Apache-2.0 und verwendet SiT-XL/2 mit Zeitschrittkonditionierung professional Token. Es trainiert mit einem Maskenverhältnis von 25 % professional Token und Selbstdestillation von einem EMA-Lehrer auf Schicht 20 zu einem Schüler auf Schicht 8.

Bei diesem veröffentlichten Checkpoint handelt es sich um ein ImageNet 256×256-Forschungsmodell, nicht um FLUX 3. BFL gibt an, dass es mit dem gleichen Ansatz „die Rechen- und Datenressourcen deutlich erhöht hat“, um FLUX 3 gleichzeitig über Video, Bilder und Audio zu trainieren. Self-Circulation selbst wurde im März 2026 eingeführt und ist daher bei dieser Einführung nicht neu. Neu ist der Maßstab.

Was FLUX 3 Video macht

FLUX 3 Video generiert in einer einzigen Era Clips mit einer Länge von bis zu 20 Sekunden und nativem Audio. Die unterstützten Modi umfassen Textual content-zu-Video, Bild-zu-Video, Video-zu-Video von einem Referenzclip, Keyframe-zu-Video für kontrollierte Übergänge und generative Video-Audio-Fortsetzung von Eingangsvideo und -audio.

BFL listet außerdem mehrsprachige Dialoge, die Agentenverkettung von Clips zu Sequenzen mit mehreren Einstellungen und eine starke Typografiegenerierung mit animierten Designs auf. Das BFL-Workforce berichtet von besonderer Stärke im menschlichen Gesichtsausdruck und in der Verknüpfung von Geräuschen mit physischen Ereignissen.

Leistung

Das BFL-Workforce veröffentlichte vorläufige Ergebnisse zur menschlichen Präferenz. Das Setup bestand aus 10-sekündigen Textual content-zu-Video-Clips mit 720p und Audio. FLUX 3 wurde in 93 % der Vergleiche gegenüber Luma Ray 3.2 und in 77 % gegenüber Runway Gen-4.5 bevorzugt. Gegenüber Grok Think about Video beträgt der Wert bis zu 69 %, dann Kling v3 Professional mit 60 %, Glad Horse v1 mit 59 % und Glad Horse 1.1 mit 57 %. Gegen Seedance 2.0 und Gemini Omni Flash liegt das Ergebnis bei 52 %, was einem Münzwurf nahe kommt.

Interaktiv Forscher


bfl@Flussmittel-3:~/real-world-models

Früher Zugriff




eingeben

Quellen: bfl.ai/weblog/flux-3 · bfl.ai/weblog/flux-3-mimic · mimicrobotics.com · Zahlen vom 23. Juli 2026
Gebaut von Markttechpost

Wichtige Erkenntnisse

  • FLUX 3 ist ein Circulation-Matching-Spine, das gemeinsam auf Bild, Video und Audio trainiert wird.
  • FLUX 3 Video generiert in einer einzigen Era bis zu 20 Sekunden mit nativem Audio.
  • Die Videovorhersage verbraucht über 95 % der Trainingsrechenleistung. Audio macht weniger als 0,5 % der Token aus.
  • Das gleiche Spine steuert FLUX-mimic, eine Roboterrichtlinie, die auf einer RTX 5090 in weniger als 80 ms ausgeführt wird.
  • Der Zugriff ist gesperrt: Video und Motion befinden sich im Early Entry, das Bild folgt, offene Gewichte kommen als letztes.

Schauen Sie sich das an Ankündigung von FLUX 3Die FLUX 3 x technischer Pfosten imitieren und die Self-Circulation-Papier. Alle Anerkennung für diese Forschung gebührt den Forschern dieses Projekts.


Michal Sutter ist ein Knowledge-Science-Experte mit einem Grasp of Science in Knowledge Science von der Universität Padua. Mit einer soliden Grundlage in statistischer Analyse, maschinellem Lernen und Datentechnik ist Michal hervorragend darin, komplexe Datensätze in umsetzbare Erkenntnisse umzuwandeln.

Von admin

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert