AIホームラボ、ついにffmpegが入り動画生成可能に!ローカルAIを一本のワークフローでつなげられました!

AIホームラボ、ついにffmpegが入り動画生成可能に!ローカルAIを一本のワークフローでつなげられました! AI制作・自動化


ここ数日、AIホームラボの構築を続けています。

Linuxを入れ、Dockerを入れ、n8nを入れ…。

ComfyUI、Irodori TTS、Whisper…。

一つ動くたびに新しい問題が出てきて、正直「いつ終わるんだこれ」と思うことも何度もありました。

ですが、今回ようやく一つ、大きな区切りまで到達しました。

音声・字幕・画像をまとめて動画にするところまで、一つのワークフローとして完成しました。

最初は全部バラバラだった

ここまでの構成は、

ComfyUIで画像生成

Irodori TTSで音声生成

Whisperで字幕生成

FastAPI+FFmpegで動画生成

それぞれは単独で動いていました。

しかし、

「全部つながるのか?」

が一番大きな壁でした。

Video APIも自作しながら修正

動画生成用のFastAPIは最初、

画像+音声

しか受け取れませんでした。

そこでPythonを書き換え、

image_path
audio_path
subtitle_path
output_path

を受け取れるよう変更。

FFmpegにも字幕フィルターを追加しました。

さらにAndroidで再生できるよう、

H.264

AAC

yuv420p

30fps

になるよう調整。

細かい部分ですが、このあたりが意外と重要でした。

エラーも山ほど

最初は当然失敗しました。

原因は、

「ファイルが存在しない」

でした。

実はJSONに書いていたのは

sample.wav
test.png

という仮のファイル名。

実際に生成されたファイル名を確認して差し替えると、一気に動き始めました。

AI同士をつなぐ時は、

「モデルが悪い」

より

「ファイルパスが違う」

ことの方が多いですね(笑)

そして完成

最終的にできたのは、

画像

音声

字幕

MP4動画

しかもAndroidでも問題なく再生。

字幕もしっかり表示されました。

output.mp4

166 KB
ファイルダウンロードについて

ここまで確認できた時は、思わず

「きた!」

となりました。

今のワークフロー

現時点では、

固定テキスト

Irodori TTS

Whisper

ComfyUI

Video API

MP4動画

という流れです。

固定テキストから動画までは、一通り完成しました。

次はいよいよ本命

ここからは、

note記事

Qwen(要約・動画台本)

Irodori

Whisper

ComfyUI

Video API

完成動画

へ進めます。

つまり、

記事を一つ書けば、動画まで自動生成する

そんなAI制作工場に近づいてきました。

振り返ると

数日前までは、

「Linuxってどう使うんだろう」

というところから始まりました。

そこから、

Linux

Docker

Samba

n8n

Ollama

ComfyUI

Irodori TTS

Whisper

FastAPI

FFmpeg

を一つずつ組み合わせながら、ようやくここまでたどり着きました。

正直に言うと、ここまでLinuxを入れ、n8nでComfyUIやIrodori、Whisperと一つずつ繋ぎながらも、心のどこかでずっと不安がありました。

「本当にこれ、全部繋がるのか」

「どこかで致命的なミスをしていて、また最初からやり直しになるんじゃないか」

そんな思いを抱えながら、一つずつ組み上げてきました。

今回、実際に動画として形になったのを見て、

「あ、ちゃんと繋がっていたんだ」

と、初めて少し安心できました。

不安がなくなったわけではありませんが、「積み上げてきたものが無駄じゃなかった」と思えたのは、地味に大きな収穫でした。

まだ完成ではありません。

でも、「点」だったAIツールが、少しずつ「線」になり始めています。

この積み重ねが、きっとあとから大きな差になる。

そんな手応えを感じた一日でした。

ブログサムネイラスト生成

コメント

タイトルとURLをコピーしました