世界を動かす技術を、日本語で。

シーダンス 2.5

概要

  • Seedance 2.5 は新世代の動画生成モデルとして登場
  • 長尺ストーリーテリング ・マルチモーダル参照・編集機能の大幅強化
  • 最大 30秒の高品質動画生成、複数ラウンドによる拡張に対応
  • 最大 30画像/10動画/10音声 の参照入力で複雑な創作意図を実現
  • Jimeng AI/Doubao Pro などで利用開始、APIも近日公開

Seedance 2.5正式リリースのお知らせ

  • Seedance 2.5、新世代動画生成モデルの正式ローンチ
  • Seedance 2.0 以降、ユーザーの期待が「クリップ生成」から「作品完成」へ変化
  • オーディオ・ビデオ統合生成アーキテクチャ を基盤に進化
  • 基礎生成・参照生成 を中心に、長尺ストーリーテリング・マルチモーダル参照・編集で大きな進歩
  • 現実的なユースケース に根ざし、創造性とコントロール性を拡大
  • Jimeng AI、Doubao Pro などで本日より利用可能、APIは BytePlus ModelArk で近日公開予定
  • プロジェクト公式ページ: https://seed.bytedance.com/seedance2_5

30秒長尺ストーリーテリングとマルチラウンド拡張

  • 動画生成の 1回あたり最大30秒 へ拡張、従来の15秒から倍増
  • 複数ラウンドの動画拡張 に対応し、連続性・一貫性を強化
  • シーンやショットの 論理的つながり を持つストーリー展開が可能
  • 例:歌手が楽屋→舞台裏→ダンサーと合流→ステージへ、という一連の流れを ワンテイクで表現
  • 主要キャラクター・環境・物語テンポ を維持し、複数分の動画も滑らかに生成
  • カメラワークやカット間の遷移 も自然で、映像・音声の同期精度が向上
  • 実写に近い質感 ・照明・色彩・質感の最適化により、AI動画特有の不自然さを大幅軽減

マルチモーダル参照機能の全面アップグレード

  • 最大 30画像・10動画・10音声 の参照素材を一度に入力可能
  • 多様な参照により、 複数被写体・豊かなシーン・柔軟なカメラワーク を実現
  • すべての素材の 構図・シーン・スタイル・キャラクター・小道具 を理解し、指示通りに反映
  • 多人数・群像劇 でも、各キャラクターの外見・声を安定して再現
  • クレイレンダー (質感なし3Dモデル)参照で、空間構造・動作・カメラアングルを正確に指定可能
  • クレイレンダーから 物理法則に基づく照明効果 (光源の方向・色温度・強度・影)も再現
  • 動作・創作参照 も強化し、複雑なショットや演出意図を反映

精密で安定した編集機能によるクリエイティブ効率向上

  • タイムスタンプ単位の編集 で、音声・映像のピンポイント修正が可能
  • グリーンスクリーン・カメラ視点・参照ベース編集 など高度な編集機能を強化
  • 映画・広告など専門的な分野 にも対応できる編集精度
  • 動作タイミング・カット位置・キャラクターの動きなどを 細やかにコントロール
  • 自動字幕やBGMの暴走 も最小化し、最終成果物の完成度を向上

まとめと今後の展望

  • Seedance 2.5 は、単なる長尺生成を超え、創作意図の理解とコントロール性を飛躍的に向上
  • アイデアから完成動画まで を一気通貫で実現する新たな動画生成体験
  • Jimeng Web、Doubao Pro で体験可能、API連携も順次提供予定
  • フィードバック歓迎、今後もさらなる進化を予定

Hackerたちの意見

これ、今まで見た中でめっちゃ良さそうに思える。洗濯機の広告の例は、SNSの他のものと同じくらいクオリティ高いね。彼らが維持してる品質と一貫性に驚いてる。プロンプトで言ってる参照画像をうまく使ってるんだろうな。目立って悪いのはコンサートホールのやつかな。最初の数秒はほとんど空の席が映ってて、最後の方では満員の観客が映るけど、その観客もちょっと変に見える。

動画はバカっぽいけど、クオリティはすごく印象的だね。もうすぐ不気味の谷を越えられそう。

もうほぼそこまで来てると思う。

音声や画像、動画生成は存在すべきじゃないと思う。これらのツールが引き起こす害を正当化するほどのポジティブな応用を見たことがない。

ポジティブな応用を見たことがない 将来的に、私に合わせた超人的な魅力を生み出す報酬モデルを作れるなら、それは今まで作られた技術の中で最高のものの一つだと思う。出所にはこだわってないし、きれいな動画や写真を見ると嬉しい。

今は、偽の動画が本物だと信じる人がいるから害を引き起こしてる。でも、人々は動画で見たものに対して懐疑的になってきてるし、真実だと思う前に生成された可能性を考えるようになってる。どんな害を考えてるの?

何でも存在するものには、それが存在するべきじゃないと思う人がいるよね。でも幸運なことに、社会は誰かの意見に反するものを全部禁止するわけじゃないし、さらに幸運なことに、今は単一の擬似道徳的な政府の気まぐれに左右されない多極的な世界に生きてるんだ。

一般的には、悪用(誤情報やディープフェイクなど)に対してバランスが取れてると思うけど、いい使い方もあるよね。規制がその危害に追いついてないだけだと思う。いい例を挙げると(特に音声生成)、2002年のゲーム『モロウウィンド』が最近再評価されてて、すごく良いゲームなんだけど、対話のための完全なボイスラインがないんだ。『ヴァルデンフェルの声』っていうコミュニティプロジェクトが、ゲームに存在するボイスラインを使って、エレブンAIで声を生成してる。これ、アーティストの仕事を奪うわけじゃなくて、以前にこのプロジェクトをやってたのはコミュニティのボランティアたちで、すごく大変な(無報酬の)作業だったんだよ(そんな大きなプロジェクトがあったけど、最後に見た時は放棄されてた)。だから、新しい技術にはちゃんとした規制が必要だと思う。

クオリティはかなり高いけど、彼らがこのモデルを進める方向性は、中国と西洋の需要の違いに強く関連してると思う。特に、アクションや高効果のショットに対してt2vにすごく集中してる。リリースページには人間の参照ショットが一つだけあって、それは全然対話に焦点を当ててない。アメリカの映画製作者たちと話した中で、彼らが一番求めてるのはv2vで、俳優のパフォーマンスを他の世界に持ち込むことなんだ。中国の映画市場はちょっと違って、高アクションや特撮映画に偏ってる。アメリカで失敗したハリウッド映画のリストを考えてみて。中国では成功したものもある:ウォークラフト(中国:2億2500万ドル、アメリカ:4700万ドル)、バイオハザード(中国:1億5900万ドル、アメリカ:2700万ドル)、xXx: ザンダー・ケイジの帰還(中国:1億6400万ドル、アメリカ:4400万ドル)、パシフィック・リム:アップライジング(中国:9900万ドル、アメリカ:5900万ドル)。これを読むと、アクション映画やビジュアルスペクタクルは対話ベースの映画よりも普遍的に受け入れられるってことがわかる。もう一つの見方は、中国は一般的にそのタイプのコンテンツを好むってこと。Bytedanceは、需要があるからアクションや特撮に焦点を当ててるんじゃないかな。

香港映画はハリウッドの鏡のようなもので、ファンタジーやアクションがアメリカよりもずっと人気だよ。でも、単純に価値を比較してるだけかもしれないね。人口あたりの数字はそんなに極端じゃないし、でもその点は変わらないよ。

これよく聞くけど、もうそんなに単純じゃないと思う。例えば、『グリーンブック』(2018年)は中国で7070万ドル以上稼いだし、2021年の人気映画の一つ『ハイ、マム』(2021年)は785百万ドル以上だよ。『オブセッション』(2026年)も中国でめっちゃ好調で、スーパガールみたいなアクション映画(1200万ドル対100万ドル未満)を完全に打ち負かしてる。

Seedance 2.5はすごく見栄えがいいけど、MiniMax H3は24時間以内にオープンウェイトになるよ:https://fal.ai/minimax-h3。ComfyUIチームによると、3080のような中価格帯の消費者向けGPUでも十分に動作するはず。正直、もう少しコントロールとコストを抑えるために、少しクオリティを犠牲にしてもいいと思ってる。

Hacker Newsで議論の続きを見る