写真を動かすAI:入力例と確認すべき崩れ方
写真を動かすAIは一枚の静止画に動きを加える画像動画変換です。仕事で使える場面、入力例と完成例、手や文字が崩れやすい点と確認手順をまとめます。
「写真を動かすAI」は、一枚の静止画をもとに、カメラがゆっくり動く・被写体がまばたきする・髪や服が風になびくといった短い動きを加える画像動画変換の技術です。ゼロから動画を生成する動画生成AIとは違い、素材となる写真がすでにあることが前提で、その写真の構図や被写体をなるべく保ったまま動きだけを足す点が特徴です。
よくある失敗は、複数の被写体が写った写真や、文字入りのポスター画像をそのまま入れて「動かして」とだけ頼むことです。どの部分を動かしたいかを指定しないと、AIは背景ごと不自然にゆがませたり、意図しない部分を動かしたりします。
仕事で使える場面
- 商品写真に軽いカメラの動きを加えて、広告用の短い動画素材にする。
- 不動産や店舗の静止画に、ゆっくりズームするような動きを加えて紹介動画の一部にする。
- 社内イベントの記念写真に、ごく短い動きを加えて社内共有用の動画にする。
- イラストやロゴのカット画像に軽い揺れを加えて、SNS投稿用の短い動画にする。
向いていないのは、複数の人物が近い距離で写っている写真や、細かい文字が読める看板・書類が写り込んだ写真です。人物が複数いると、AIがどちらを動かすべきか判断を誤りやすく、文字は動きを加えた瞬間に読めない形に崩れることがほとんどです。
ツールが崩れやすい部分
- 手と指:動きの中で指の本数や形が変わってしまうことが、他の部位より高い頻度で起きます。
- 写真内の文字:看板やパッケージの文字は、動きを加えると読めない模様に変わることがほとんどです。
- 背景の縁:被写体を動かす際、背景との境目がゆがんだりにじんだりしやすくなります。
- 実在する特定の人物:本人の同意なく、実在する特定の人物の写真を動かして本人が言っていないことを話しているように見せる使い方は避けるべきです。声を再現するクローン音声と同じ同意の問題がここにもあります。
入力例と完成例
弱いプロンプト:「この写真を動かして」。結果:何が動くか指定していないため、被写体全体がゆがんだように動いたり、背景だけが不自然に揺れたりする、狙っていない結果になりがちです。
完全なプロンプト:「この商品写真で、カメラだけがゆっくり左から右へパンするように動かしてください。商品自体と背景は変形させず、パッケージの文字はそのまま維持してください。」動かす対象(カメラ)と動かさない対象(商品と文字)を分けて指定することで、意図しない変形が起きにくくなります。
生成後は、まず数秒の短い動画を確認し、パッケージの文字が読めるか、商品の形が保たれているかを見ます。問題があれば、長い動画を生成する前にこの短い段階で修正します。
動いた瞬間の映像が自然に見えても、崩れているのは一部のコマだけということがあります。最後まで一度通して見るまで、崩れていないとは言えません。
出力を確認する方法
- 動画を最後まで一度通して再生し、途中のコマで手や指の形が不自然に変わっていないか確認する。
- 写真内に文字がある場合、動きの前後で文字が読める状態を保っているか確認する。
- 背景と被写体の境目が、動きの途中でにじんだりゆがんだりしていないか確認する。
- 実在する特定の人物が写っている場合、本人の同意なく公開する内容になっていないか確認する。
なぜ確認の手間が省けないのか
こうした画像・動画生成モデルの精度がどう向上しているかは、Stanford HAIのAI Indexが毎年測定しています。手や文字といった細部の崩れは年々減っていますが、完全になくなったわけではありません。生成された結果を人が確認する責任は、OECDのAI原則でも明記されています。
国内でこうした生成AIをすでに使ったことがある人の割合は、総務省の情報通信白書が国際比較とあわせて毎年公表しています。企業のAI活用がどこまで進んでいるかはIPA(情報処理推進機構)のDX動向調査でも追えます。
こうした確認の手間を引き受けられる力に、労働市場は賃金プレミアムを払っているとPwC AI Jobs Barometerは指摘しています。生成された動画をそのまま公開するのではなく、どこを確認すべきか判断できることが、その力の中身です。
月曜日に試すこと
- 被写体が一つだけ写っている写真を一枚選ぶ。人が複数写った写真やテスト用の画像ではなく、実際に使う予定の一枚を使う。
- 動かす対象(カメラか被写体か)と、動かさない対象(文字や背景)を分けて具体的に指定する。
- 数秒の短い動画をまず生成し、崩れがないか確認してから長い動画を作る。
- 実在する特定の人物が写っている場合、公開前に本人の同意を確認する。
複数の写真を自然に組み合わせたい場合は画像合成AIが同じ確認の考え方を扱っています。ゼロから動画を生成したい場合や、素材を社外に出したくない場合は動画生成AIをローカルで動かすで別の選択肢を扱っています。写真の背景を広げたり足りない部分を補ったりする作業は画像拡張AIで扱っています。イラストを生成する際の同じプロンプトの具体化についてはAIイラストプロンプトにまとめています。
こうした「対象を具体的に指定する」「最後まで確認する」という2つの力は、Coursiumがスマホの短いレッスンで練習できるようにしています。AIの一歩先へ、実際の仕事に近い練習から始めてみてください。詳しくはCoursiumについて。