【ITニュース解説】Ovi - Generate Videos With Audio Like VEO 3 or SORA 2 - Run Locally - Open Source for Free
2025年10月04日に「Dev.to」が公開したITニュース「Ovi - Generate Videos With Audio Like VEO 3 or SORA 2 - Run Locally - Open Source for Free」について初心者にもわかりやすく解説しています。
ITニュース概要
Oviは、テキストや画像プロンプトから音声付きの高品質な動画を生成するオープンソースプロジェクトだ。VEO 3やSORA 2のようなAI動画生成を、ローカル環境で無料で実行できる。低VRAMでも動作可能で、1クリックで簡単にインストールできるため、手軽にAI動画生成を試せる。
ITニュース解説
Ovi(オヴィ)は、入力されたテキストの指示や、画像とテキストを組み合わせた情報から、リアルな音声付き動画を自動で生成する最先端の人工知能(AI)プロジェクトである。このAIは、OpenAIのSORA 2やVEO 3といった、現在世界中で注目されている高性能な動画生成AIに匹敵する能力を持ちながら、ユーザー自身のパソコン上で実行でき、さらにオープンソースとして無料で公開されている点が大きな特徴だ。これまでの高度な動画生成技術は、非常に高価な計算リソースや専門知識を必要とすることが多かったが、Oviはより多くの人がこの技術を体験し、活用できる可能性を広げる画期的な取り組みと言える。システムエンジニアを目指す初心者にとっても、このような最新のAI技術がどのように動作し、どんな応用が可能かを知ることは、これからのIT社会で活躍するための重要な一歩となるだろう。
Oviが提供する最大の魅力は、単に動画を生成するだけでなく、それに完璧に同期した音声を同時に作り出す点にある。まるで映画のワンシーンのように、登場人物が話す声、背景に流れるBGM、情景に合わせた効果音など、動画と音声が一体となったコンテンツを生成できるのだ。この技術の裏側には、「Twin Backbone Cross-Modal Fusion(ツインバックボーン・クロスモーダル・フュージョン)」という高度なAIアーキテクチャが使われている。これは、視覚情報(動画)を扱う部分と聴覚情報(音声)を扱う部分が、それぞれ独立した「バックボーン」(基盤となるAIモデル)を持ち、それらを統合(フュージョン)することで、両者が密接に連携したコンテンツを生み出す仕組みだ。具体的には、高品質な音声を生成するための約50億ものパラメータを持つ「音声ブランチ」と、それと視覚情報を結びつけるための約10億パラメータを持つ「フュージョンブランチ」が、それぞれゼロから事前学習されている。これにより、生成された動画に登場する人物の唇の動きと音声が完全に一致する「リップシンク」が、特別な指示なしにデータから自動で学習される。また、複数の人物が登場する会話シーンや、状況に応じた環境音、さらには楽器の演奏まで、多様な音声を動画に合わせて作り出すことが可能になっている。
Oviは、さまざまな入力形式に対応して動画を生成できる。例えば、単純に「夕焼けのビーチで犬が遊んでいる」といったテキストプロンプト(指示文)を与えるだけで、それに対応した動画と音声を生成できる(T2AVと呼ばれる)。さらに、もしイメージに合う写真が手元にあれば、その写真とテキストプロンプトを組み合わせることで、指定した画像から始まる動画を生成することも可能だ(TI2AVと呼ばれる)。これにより、既存の素材を活かしつつ、物語性のある動画を簡単に作り出せる。特に、人間が中心となるコンテンツ生成に強みがあり、例えば、異なる感情を表現する人物の会話や、複数人が登場する複雑な対話シーン、さらには特定の動きに合わせた効果音、BGMが流れる動画など、幅広い表現に対応できる。
Oviはオープンソースプロジェクトとして公開されているが、より多くのユーザーが簡単に、そして高性能に利用できるように、「SECourses Ovi Pro Premium App」という形で高度なアプリケーションも開発されている。このアプリは、Webブラウザから操作できるGradioというフレームワークを利用しており、直感的なインターフェースでOviの機能を最大限に引き出すことができる。特に注目すべきは、GPU(グラフィックカード)のメモリ使用量を最適化する「ブロックスワッピング」という技術が実装されている点だ。これは、AIモデルが処理する大量のデータを一度にGPUのメモリ(VRAM)に読み込むのではなく、必要な部分だけを効率的に入れ替えることで、わずか8.2GBのVRAMでも高品質な動画を生成できるようにする技術である。通常、このような高性能AIモデルを動かすには、数十GBものVRAMが必要とされることが多いため、この最適化は多くのユーザーにとって非常に大きなメリットとなる。今後、さらにメモリ効率を高めるための技術(FP8_Scaledなど)も導入される予定だ。
さらに、このアプリは「1クリックインストーラー」を提供しており、Windows、RunPod、Massed Computeといった環境に、Pythonの実行環境や必要なライブラリ、AIモデルを自動でインストールしてくれる。これにより、技術的な知識が少ない初心者でも、複雑な設定なしにOviをすぐに使い始めることができる。Torch 2.8、CUDA 12.9、Flash Attention 2.8.3といった最新のライブラリに対応しており、RTX 3000シリーズ、4000シリーズ、5000シリーズといった最新の高性能GPUから、H100、B200のようなデータセンター向けGPUまで、幅広いグラフィックカードをサポートしている。生成された動画は自動的に「outputs」フォルダに保存され、一度に複数の動画を生成するバッチ処理や、設定の保存・読み込みなど、便利な機能も多数備わっている。高性能なRTX 5090のようなGPUでは、特別なメモリ最適化なしで非常に高速に動画を生成することも可能だ。
Oviは非常に強力なツールだが、全てのAIモデルには限界がある。Oviの視覚的な品質は、ベースとなっているWAN 2.2 5Bという別のモデルの性能に依存するため、そのモデルの持つ限界を受け継ぐ。また、動画と音声を統合する110億パラメータという巨大なモデルでありながら、推論速度とメモリ効率を両立させるために、非常に細かいディテールや複雑なテクスチャ、微細なオブジェクトの表現には限界がある場合がある。さらに、学習データが人間中心のコンテンツに偏っているため、人間が登場するシナリオでは非常に優れた性能を発揮するが、それ以外の分野ではまだ改善の余地があると言える。現在のOviは、事前学習という初期段階にあるため、一度の生成で常に完璧な結果が得られるわけではない。そのため、より良い結果を得るためには、複数の「ランダムシード」(生成の初期値)を試すことが推奨される。
しかし、Oviはオープンソースとして公開されており、その技術的な進化は止まらないだろう。世界中の開発者がこのプロジェクトに参加し、さらなる機能追加や性能改善、最適化が進められることが期待されている。システムエンジニアを目指す皆さんにとって、このような最先端のAI技術がどのように開発され、進化していくのかを間近で見ることは、将来のキャリア形成において貴重な経験となるはずだ。AIが生成する動画と音声の品質は日々向上しており、Oviのようなプロジェクトが、クリエイティブなコンテンツ制作の新たな可能性を切り開いていくだろう。