AI

画像も動画も音声も生成できるAI「FLUX 3」が発表される


AI開発企業のBlack Forest Labsが独自開発のAIモデル「FLUX 3」を発表しました。FLUX 3は「画像」「動画」「音声」の生成に対応したマルチモーダルモデルで、記事作成時点では動画生成機能が早期アクセス版としてリリースされています。

FLUX 3: One Multi-Modal Model | Black Forest Labs
https://bfl.ai/models/flux-3

FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. | Black Forest Labs
https://bfl.ai/blog/flux-3


Black Forest LabsがこれまでにリリースしてきたFLUX.1シリーズやFLUX.2シリーズは画像生成や画像編集を目的としたモデルでした。今回発表されたFLUX 3は画像だけでなく音声と動画の入出力にも対応した基盤モデルとして開発されており、ロボットの行動予測にも拡張可能とされています。また、これまでのモデルと命名規則が異なり、ドットが取れているのも特徴的です。

学習方式にはBlack Forest Labsが開発した自己教師ありフローマッチングフレームワークの「Self-Flow」を採用しています。画像・動画・音声を統合アーキテクチャ内で共同学習することで「物体同士の相互作用」「物体の動き方と音の関係」といった事柄を学習し高精度な出力を実現するとのこと。


FLUX 3の機能のうち、動画生成機能が早期アクセス版としてリリースされています。音声を含む最大20秒の動画を生成可能で「テキストから動画生成」「開始フレームを指定して生成」「参考画像で被写体を指定して生成」「参考動画のキャラクターを取り込んで生成」「動画と音声を入力して続きを生成」「キーフレームを入力して生成」「複数の動画を連結」といったワークフローに対応しています。

FLUX 3 Sneak Peek - YouTube


「720pで音声付きの10秒間の動画」を生成して人間に評価させた結果が以下。FLUX 3はGrok Imagine Videoに対して勝率69%、Seedance 2.0に対して勝率52%、Gemini Omni Flashに対して勝率52%という成績でした。FLUX 3のハーネスには改善の余地があり、さらなる性能向上が見込まれています。


Black Forest LabsはFLUX 3で生成した画像の例も投稿しています。FLUX 3は多用なスタイル・アスペクト比・解像度で画像を生成したり編集したりできます。学習段階に実施された予備評価では既存のFLUXシリーズと比べて大幅な改善を示したとのこと。具体的には複雑なプロンプトの処理能力と複数言語のテキスト描画性能が向上したそうです。画像生成機能は数週間以内に早期アクセス版がリリースされる予定です。


さらに、Black Forest LabsはMimic Roboticsと協力してFLUX 3をロボットの行動予測モデルとして活用する研究も進めています。

FLUX 3 x mimic: The Next Generation of Video-Action Models | Black Forest Labs
https://bfl.ai/blog/flux-3-mimic

Black Forest Labsは今後数週間から数カ月をかけて以下の展開を進める予定としています。また、すでに次世代モデルの開発も始めているとのことです。

FLUX 3 Video:APIおよびプライベートウェイトアクセスによる動画・音
FLUX-mimicおよびFLUX 3 Action:厳選された研究機関および商業パートナーとの連携によるロボット行動予測
FLUX 3 Image:APIおよびプライベートウェイトアクセスによる画像の生成・編集
FLUX 3 Dev:動画・音声・画像・行動予測のためのマルチモーダルモデルバックボーンへのオープンアクセス

・関連記事
iPhoneでローカル動作する画像生成AI「Bonsai Image 4B」が登場したので使ってみた、FLUX.2 Klein 4Bを1bit版に魔改造してメモリ使用量を8.3分の1に削減 - GIGAZINE

Googleがより高速で安価な画像生成モデル「Nano Banana 2 Lite」と動画生成モデル「Gemini Omni Flash」を発表 - GIGAZINE

画像生成AI「Qwen-Image-3.0」が登場したので使ってみた、イラストや日本語テキストの描画性能はいかに - GIGAZINE

MetaがGIFアニメも作れる画像生成AI「Muse Image」をリリース&音声付き動画を生成できる「Muse Video」も発表される - GIGAZINE

画像生成AI「Krea 2」がオープンモデル化されてローカル生成可能になったのでComfyUIで実写風画像とイラスト風画像を生成してみたよレビュー - GIGAZINE

アニメ・イラストに強い画像生成AI「Anima」の正式版がついに登場、タグ・自然言語両対応でSDXLやIllustrious系モデルが動作するPCなら余裕でローカル実行可能 - GIGAZINE

Nano Banana Pro超えでローカルで実行可能な画像生成AI「Ideogram 4.0」が登場、日本語での指示も可能 - GIGAZINE

OpenAIが画像生成AI「ChatGPT Images 2.0」を正式リリースしたので使ってみた、イラストも日本語セリフも高品質に描写可能 - GIGAZINE

in AI,   動画, Posted by log1o_hf

You can read the machine translated English article FLUX 3, an AI capable of generating imag….