中古パソコン活用編①――ローカルAIで「全部自動化」を目指して見えた限界

中古パソコン活用編①――ローカルAIで「全部自動化」を目指して見えた限界 AI制作・自動化

GPU付きの中古パソコンを導入してから、3日目。

ここまで、かなりの勢いで環境構築を進めてきました。

ローカルLLMのBONSAI、画像生成のComfyUI、音声生成のIrodori、動画処理のFFmpeg。さらに、noteの記事URLを入力すると、台本作成から音声、字幕、画像、動画まで自動で作る仕組みも形になってきました。

GPUを積んだ新しいパソコンは、明確に速いです。

処理速度だけを見れば、以前使っていた古いノートパソコンとは比べものになりません。音声生成も画像生成も、ローカルAIを試すこと自体が現実的になりました。

しかし、実際に完成した動画を確認していく中で、別の問題が見えてきました。

自動化はできても、完成品の品質が足りない

今回目指していたのは、単にローカルAIを動かすことではありません。

理想は、

noteの記事URLを入力する

内容を要約して動画台本を作る

音声、字幕、画像を生成する

完成動画が自動で出来上がる

という、一気通貫の自動動画生成です。

仕組みとしては、かなり近いところまで来ました。

ところが、BONSAIが生成した台本を確認すると、日本語として不自然な箇所が残っていました。

たとえば、

そして共に過ごす時間。ポケモンを通して、我々は最も気づいたことでした。

といった文章です。

意味は何となく想像できますが、主語と述語が合っておらず、そのまま公開動画には使えません。

一文だけなら直せます。

しかし、動画を作るたびに台本を最初から最後まで確認し、不自然な表現を一つずつ修正するのであれば、自動化の利点がかなり薄くなります。

それなら最初からChatGPTやClaudeで台本を作り、完成した文章を手動モードへ入力した方が早い。

そう感じ始めました。

BONSAIは速い。しかし、検品が必要になる

BONSAIはローカルで動き、回数制限もありません。

下書きや粗い要約には使える可能性がありますが、その結果にも確認が必要です。

私が求めていたのは「文章らしいもの」ではなく、ほぼそのまま公開できる動画台本でした。

必要なのは、

  • 自然な日本語

  • 前後の文脈の維持

  • 主語と述語の整合

  • 音声として聞きやすい文章

  • 内容を壊さない要約

です。

この基準になると、現時点ではChatGPTやClaudeとの差を強く感じました。

生成処理そのものが速くても、出力された文章を人間が毎回検品しなければなりません。

数秒で文章が出ても、その後の修正に何分もかかるのであれば、制作全体としては速くありません。

ローカルLLMは「無料で使えるChatGPT」ではなく、管理と確認を前提に使う別の道具なのだと思います。

ComfyUIで感じた利点は、ほぼ「無料」だけだった

画像生成についても、期待していた結果にはなりませんでした。

ComfyUIについては、一般的に「細かな制御ができる」「大量生成に向いている」と説明されることがあります。

しかし、実際に私が使ってみた感想は、かなり違います。

設定項目が多いことと、思いどおりに制御できることは別でした。

モデルやプロンプト、画像サイズ、生成条件を調整しても、人物の顔や手が崩れたり、指定した構図から外れたりします。

複数の画像を生成することはできますが、その中から使える画像を探し、破綻を確認し、必要に応じて再生成しなければなりません。

これでは、画像をたくさん作れるというより、確認しなければならない候補が増えるだけです。

私がComfyUIに感じた明確な利点は、ローカル環境で無料で生成できることでした。

しかし、無料であっても、低品質な画像を毎回確認し、何度も生成し直すのであれば、時間まで含めて本当に得なのかは疑問です。

それなら、ChatGPTやGeminiの無料プランを使い、少ない試行回数で意図に近い画像を作った方がよい。

少なくとも、私の動画素材作成という用途では、ComfyUIを積極的に使い続ける理由は見つけられませんでした。

世間で言われるComfyUIの強みを、私は今回の用途では実感できませんでした。

字幕の問題も発生した

自動動画生成では、台本以外にも問題がありました。

音声に対して字幕が少なすぎる、字幕の内容が音声と合っていない、字幕が更新されない、といった不具合です。

調査を進めると、台本、音声、字幕、動画の生成物が、同じ世代のものにそろっていない可能性が出てきました。

台本だけが更新され、音声や字幕には古い成果物が残っているような状態です。

そこで現在は、

  • 台本が変わったら音声を全再生成する

  • 音声が変わったら字幕と動画も無効化する

  • 古い成果物を再利用しない

  • 音声、字幕、画像時間、動画を一つの世代として管理する

  • 字幕を最大2行程度に収める

といった修正を進めています。

これは自動モードだけでなく、手動モードを安定させるためにも必要な修正です。

ただし、字幕や処理の不整合が直っても、元の台本が不自然なら、完成するのは「不自然な文章を正確に読み上げた動画」です。

システム上の問題と、生成AI自体の品質問題は、分けて考える必要があります。

結局、手動モードの方が実用的かもしれない

ここまで試した結果、現在の私に合っている構成は、かなりシンプルです。

ChatGPTやClaudeで台本を作る

ChatGPTで画像を作る

完成した台本と画像を手動モードへ入れる

Irodoriで音声を生成する

字幕と動画を自動生成する

これなら、内容の品質を決める部分は高性能なクラウドAIへ任せられます。

その後の繰り返し処理は、ローカルパソコンで自動化できます。

台本と画像を自分で用意するため、完全自動ではありません。

しかし、生成物を一つずつ確認して修正するより、最初から品質の高い素材を投入した方が、結果的には楽です。

自動モードは完成品を作る機能というより、

noteの記事から、動画の試作品を自動で作る機能

くらいに考えた方がよいのかもしれません。

IrodoriとFFmpegは、かなり良い

一方で、今回試したすべてが期待外れだったわけではありません。

Irodoriの音声生成は、十分に実用性を感じています。

入力する文章が決まっていれば、ローカルで何度でも音声を生成できます。外部APIの料金を気にせず、修正や再生成を繰り返せる点も大きな利点です。

FFmpegも非常に優秀です。

音声、字幕、画像を組み合わせ、動画として書き出す処理は安定しています。

画像や台本の内容を考える必要はありませんが、入力された素材を決められた形へ変換する処理には強い。

このような、

判断や表現ではなく、決められた処理を高速で繰り返す仕事

は、ローカル環境と非常に相性が良いと感じました。

GPUマシンは必要だったのか

正直に言えば、少し複雑な気持ちもあります。

今回の最終構成が、

  • 台本はChatGPT

  • 画像もChatGPT

  • ローカルでは音声と動画を生成

という形になるのであれば、以前のパソコンでも時間をかければ実行できた可能性があります。

GPUマシンによって処理は明確に速くなりました。

しかし、「GPUマシンを買ったことで初めて可能になった」というより、

以前からできたことが、かなり快適になった

という方が近いかもしれません。

購入時には、BONSAIとComfyUIを使い、文章も画像もローカルで作る制作工房を期待していました。

その中心部分をクラウドAIへ戻すのであれば、少し残念ではあります。

ただし、GPUマシンが無駄だったとも言い切れません。

実際にローカルモデルを高速で動かし、自分の用途に使えるかを試したからこそ、限界を短期間で確認できました。

古いパソコンでは処理が遅すぎて、ここまで試す前に諦めていた可能性もあります。

とはいえ、それだけで10万円の投資に納得できるかというと、今はまだ答えが出ません。

ローカルAIの使い道を、まだ見つけ切れていない

今回の経験で、ローカルAIに対する見方は変わりました。

少なくとも現時点では、ChatGPTやClaudeをそのまま置き換えられるものではありませんでした。

回数制限を気にせず試せることや、外部サービスに依存せず動かせることには利点があります。

思いついた仕組みを自分の環境へ組み込み、動作を検証する実験設備として使える場面もあると思います。

ただ、それが10万円をかけて導入したGPUマシンの十分な使い道なのかと問われると、今はまだ分かりません。

Irodoriによる音声生成や、FFmpegによる動画処理は実用的でした。字幕生成や大容量データの保存、各種の自動化にも使えます。

しかし、これらは以前のFMVAでも、時間をかければできていたことです。

新しい環境だからこそできることを、私はまだ見つけ切れていません。

3日目の結論

3日目までに、noteの記事URLから動画を作る自動処理は、技術的にはかなり形になりました。

しかし、実用性という点では、まだ課題が残っています。

現時点での正直な評価は、

自動モードは動いた。
ただし、日常的に使える完成品の品質には届いていない。

です。

そして、ローカルAIで何でも置き換えればよいわけではないことも分かりました。

文章や画像のように、文脈理解や表現力が重要な部分はクラウドAI。

音声生成、字幕処理、動画化、保存のように、入力が決まっている反復処理はローカル環境。

現時点では、この役割分担が最も現実的なのだと思います。

期待していた完全自動の動画工房には、まだ届きませんでした。

正直に言うと、今はまだこの結論に気持ちが追いついていません。

GPUマシンには10万円かけました。

手動モードだけなら、実は以前のFMVAでも、時間をかければ同じことができていたはずです。

そう考えると、素直に「良い投資でした」とは言い切れない自分がいます。

なんとかしたい、という気持ちはあります。

音声生成や動画化はローカルで無制限に回せるようになりましたし、この環境をもっと活かす道も、まだ探せるはずです。

ただ、今日のところは、その先を考える気力が出てきません。

コメント

タイトルとURLをコピーしました