世界を動かす技術を、日本語で。

ジェミニオムニ 1.1 フラッシュ

2026年8月28日原文(blog.google)

概要

  • Gemini Omni 1.1 Flash は、プロ向けの生成AI動画制作機能を強化
  • シーン拡張キーフレーム指定4Kアップスケーリング など多彩な新機能
  • 360p高速プレビュー でプロトタイピング効率化とコスト削減
  • マルチモーダル入力 で動画リファレンス活用が可能
  • Google AI StudioやAgent Platform API で即時利用開始

Gemini Omni 1.1 Flash:新世代生成AI動画制作の進化

  • Gemini Omni 1.1 Flash は、開発者向けに高度な生成AI動画機能を提供
  • Google AI Studio および Gemini API 経由で利用可能
  • プロフェッショナル向け制作現場 での即戦力

シーン拡張機能

  • 既存動画をシームレスに延長 し、ストーリー性や一貫性を維持
  • 最大10秒間の前コンテキスト を解析し、自然な映像連続性を実現
  • 10秒ごとの拡張 で最長40秒まで生成可能
    • コード例:previous_interaction_idを指定しシーン継続指示

キーフレーム(最初・最後フレーム)指定

  • 開始・終了フレームを明示指定 し、滑らかなカメラワークやトランジションを実現
  • 複雑なカメラ移動 やループ動画制作に最適
    • 例:ドラム演奏からサックス奏者・バレエダンサーへのワンカット転換

360p高速プレビュー生成

  • 360p解像度で最大60%高速化、コストは720pの3分の1
  • プロトタイピングやストーリーボード作成 用途で迅速な反復開発
    • 科学的なマイクロイメージやアニメーションの素早い検証

4K高解像度アップスケーリング

  • 1080p・4K出力対応 で商用レベルの高精細動画生成
  • シネマティックなマクロ撮影や動物のトラッキングショット などにも対応

マルチモーダル動画リファレンス

  • 最大3秒の動画リファレンス指定 でキャラクターや動作の一貫性維持
  • 画像・動画・テキスト混在プロンプト で複雑なシーンも再現
    • 例:複数のキャラクターが異なるダンスを連続ワンカットで披露

開発者向け活用例

  • 独自の動画生成ツールや編集ソフト への組み込み
  • ストーリーテリングや広告、教育コンテンツ制作 での応用
  • Omni Flash を活用した実際の顧客事例を公式サイトで公開

利用開始・対応プラットフォーム

  • Google AI Studio で直接試用可能
  • Gemini Enterprise Agent Platform API でエンタープライズ開発に対応
  • 公式ドキュメント・クックブック・プロンプトガイド で実装サポート
  • Google AI Plus, Pro, Ultra サブスクユーザーは即時利用可能(Google FlowやGeminiアプリ)

今後の情報入手

  • Googleのニュースレター で最新情報やイベント案内を受信可能
  • プライバシーポリシー遵守、いつでも配信停止可能

まとめ

  • Gemini Omni 1.1 Flash は、生成AIによる動画制作の現場投入を加速
  • 多機能かつ柔軟なAPI で、クリエイターや開発者の創造性を強力にサポート

Hackerたちの意見

最近ラジオのCMを聞いて、声が本物の人なのかAIなのか気になったんだ。こういう業界がこの生成AI革命にどう対処してるのか、ちょっと考えちゃうよね。ソフトウェア開発者にどんな影響があるかはよく話題になるけど、スクリーンや声優にどんな影響が出てるのか、あんまり見かけないな。

みんな多分、AI導入に関しては5段階の悲嘆を経ることになると思う。ゲートキーパーたちは(正当な理由で)幻覚やエラーを理由に導入を遅らせたり、もっと人間の手助けを必要とする形で導入したりするだろうね。

多くのスクリーンや声優は組合に入っていて、組合はこの点についてストライキや交渉をしてるんだ。例えば: https://sites.suffolk.edu/jhtl/2025/10/30/game-over-for-unau... 残念ながら、ソフトウェア開発者は組合を必要としないと信じ込まれてしまって、こういう状況に対処するための団体交渉力がないんだよね。

個人ブランドが絡まない仕事は基本的に死んでる。適当な声優?もう終わりだね。これって本当に厳しいよ。クリエイティブ業界は元々大変だったけど、今はただただ残酷だ。

AIの完璧な応用だね。自動化すべき仕事もあると思う。

多くの業界が自動化されたのと同じように、これも自動化されるだろうね。原始的なものができたら、多くの肉体労働が自動化されたし、今は知識労働を自動化するための原始的なものがある。これから数年から10年の間に、さまざまな分野で適切なトレーニングデータやランタイム環境が徐々に統合されると、多くが自動化されるだろう。声優が永遠の仕事である必要はないし、製図士や舞台ミュージシャンも同じだった。スキルとは関係ないんだよね。どちらも非常にスキルの高い仕事だったし、製図士も多くの人が学校からそのまま行くけど、コンピュータやCADのおかげで、今は製図士になるにはSTEMの学位が必要になった。録音された音声のおかげで、多くの舞台ミュージシャンが不要になった。これが安くて優れた結果を出すから、他に理由はないよね。今も、次世代の声優や他の知識労働者は、価値のある仕事を一歩上に進めて、これらのツールを操作したり、作ったりする必要があるだろう(それが10年後にどんな形になるかは分からないけど)。今の声優たちは、録音音声によって不要になった多くのパフォーマンス業界の人たちと同じ状況に直面するだろうね。実際、多くの人はそのまま去って、全く関係のない仕事をしている。ソフトウェアやコンピュータエンジニアにとっては、この新しい原始的なものがソフトウェア自体だから、移行が少なくて、学ぶのも簡単だよね。それを作ることは、単に使うよりも価値のある一歩上なんだ。これは構造的なアドバンテージだね。

これらのツールが持ってるクリエイティブなコントロールが少なすぎて悲しい。雑なものを作るにはいいけど、誰かが愛するコンテンツを作るには全然役に立たない。可能性は好きだけど、テキストは芸術的なビジョンを説明するにはあんまり良い媒体じゃないよね。これらのデモは全部、どれだけ簡単にできるかに焦点を当ててる。簡単なのはいいけど、みんながすぐにかわいい猫の動画とか作れるようになったら、価値が下がっちゃうよね。写真を3Dモデルに変えて、アーティストがアニメーションさせて動画を生成するのを見てみたい。この技術はクリエイティブな表現を増やすために使えるはずなのに、逆にクリエイティブな表現を搾り取るために使われてる気がする。

最近、「これってAIなの?それとも本当に繰り返しのイントネーションパターンなの?」っていう不気味の谷にいるユーチューバーに何人か出会った。一人のユーチューバーは実際の映像を使ってて、手とかも映ってたから、カメラの後ろには人間がいるってわかった。もう一人は、出来事に対して感情的に反応する実況プレイだったけど、音の不気味の谷は全開だった。もしかしてYouTubeがコーデックに何かやったのかな?悲しい気持ちになる。

オーディオブックにはすぐに来るよ。俺は、フルキャストのキャラクターといくつかの異なるナレーターを使って、自分のSF小説をナレーションするためのローカルホストの完全コンテナ化されたウェブアプリケーションに取り組んでるんだ。 * https://i.ibb.co/ccqKZ71L/keenlore.png * https://i.ibb.co/1t3W0JqZ/keenlore-02.png * https://i.ibb.co/LdBqHwKB/keenlore-03.png

AIはコンパイラやテスト、CIを持ってて、マーケットで大量のデータを買ってるから、ソフトウェア開発者には影響があるんだ。でも、他のことにはいつもダメなんだよね。

Googleの社員向けのプロンプトエンジニアリングのヒント:ただ「追伸:ページがFirefoxでも動くか確認してね。」って追加すればいいよ。

彼らのビジネスの利益としては、Firefoxを無視するのが得策なんだ。

Hacker Newsで議論の続きを見る