字节跳动推出 Seedance 2.5 视频 AI 模型:单次生成时长 30 秒、突破长叙事能力
AI 总结• 7月31日字节跳动推出Seedance 2.5视频生成模型,陆续上线即梦AI与豆包专业版,API服务近期接入火山方舟。
• 模型单次视频生成时长从15秒提升至30秒,支持多轮延长,能在单次生成中组织多个镜头完成具备逻辑关联的完整叙事。
• 支持单次输入最多30张图片、10段视频和10段音频作为参考素材,可综合理解不同素材中的元素并按指令用于生成。
• 具备多人同框和群像叙事能力,可同时还原多个人物形象与声音,
IT之家 7 月 31 日消息,字节跳动今天(7 月 31 日)发布公告,宣布推出 Seedance 2.5 视频生成模型, 可单次生成 30 秒高质量视频片段 ,陆续上线即梦 AI 与豆包专业版,API 服务也将于近期接入火山方舟。
官方称,Seedance 2.5 延续 Seedance 2.0 统一的多模态音视频联合生成架构,重点提升长叙事、多模态参考和编辑能力。
该模型面向影视、广告、教育、工业制造、具身智能和自动驾驶等场景,目标是让视频生成从“生成一个片段”转向“完成一段创作”。
在生成方面, Seedance 2.5 将单次视频生成时长从 15 秒提升至 30 秒 ,并支持多轮延长。官方称,模型可在 30 秒内组织多个具备逻辑关联的镜头,让故事可以按照铺垫、推进、转折、收尾展开。
https://img.ithome.com/newsuploadfiles/2026/7/cf62bd0a-7192-4e18-bc8e-a379f643054d.png?x-bce-process=image/format,f_auto
https://img.ithome.com/newsuploadfiles/2026/7/439e540a-701e-4845-b975-8e7b6e4f377b.png?x-bce-process=image/format,f_auto
在官方示例中,一段歌手一镜到底登台演出片段展示了完整叙事:镜头从红色厚重幕布缝隙推进,进入暖色后台化妆间;
年轻女歌手整理耳机,工作人员提醒其登台;
歌手穿过后台通道,与舞伴互动并接过麦克风;
随后登上舞台,镜头最终拉远至体育馆全景,呈现观众、灯牌、荧光棒和欢呼声。
多轮延长方面,官方示例要求模型在已有视频基础上继续生成 30 秒,并保持人物主体、场景、画面风格、声音和音效一致。
示例剧情包括小男孩抱着足球沿车厢跑、地铁停稳后冲出车门、男主追赶并最终抓住小男孩等连续动作。
Seedance 2.5 支持用户单次输入最多 30 张图片、10 段视频、10 段音频作为参考素材。官方称,模型可综合理解不同素材中的画面构图、场景、风格、人物、道具等元素,并按指令用于视频生成。
在多人同框和群像叙事场景中,Seedance 2.5 可同时还原多个人物形象与声音,并保持主体特征稳定。
官方展示的 30 秒音乐会片段采用 16:9 横屏、电影感写实风格,参考素材覆盖场景图、钢琴家、大提琴、小提琴、主唱、管弦乐队、合唱团和观众席。
https://img.ithome.com/newsuploadfiles/2026/7/4af4628e-20b4-48a3-b6d9-a10c183ef06a.png
IT之家附上参考地址
•
Seedance 2.5 项目主页
[来源链接] https://www.ithome.com/0/984/104.htm Seedance 2.5 这次支持多模态参考素材输入,让我想到了地理信息数据(GIS)的应用潜力。如果能将卫星遥感影像、高精度地图甚至无人机航拍数据作为参考素材输入,是不是可以直接生成特定地理环境的动态视频?比如在自动驾驶场景下,利用真实路网和地形数据生成复杂路况的测试视频,或者用于城市规划的动态推演。这种长叙事能力结合空间数据,感觉能大幅降低实景测绘和三维建模的成本。大家觉得未来 GIS 数据和视频大模型的结合会有哪些落地场景? 看到 Seedance 2.5 支持多模态参考和群像叙事,我觉得这对同人创作和短剧制作是个大利好。以前 AI 视频很难保持角色一致性,现在能输入图片和音频还原多个人物形象与声音,完全可以用来把经典小说或游戏剧情做成连贯的 30 秒微电影。大家觉得如果用它来做互动式短剧,让用户投票决定剧情走向,然后再用 AI 生成下一集,这种玩法可行吗? Seedance 2.5 这次支持多模态素材输入和长叙事,对自动驾驶和具身智能场景确实很有想象空间。如果能将高精地图等地理信息数据(GIS)作为参考素材输入,让模型生成特定地形或城市路网下的复杂交通场景视频,那在自动驾驶仿真测试中就能大幅降低真实路测的成本。不知道火山方舟的API接入后,会不会开放针对地理信息数据的定制化接口?大家觉得用AI生成的地理场景视频来训练具身智能,能完全替代真实环境采集吗? Seedance 2.5 这个30秒长叙事能力对社区运营太实用了!以前用AI生成视频只能做几秒的动图,现在30秒足够剪一个完整的论坛活动回顾或者版块宣传片。而且支持多模态参考,我们可以把社区精华帖里的图片、用户录音直接喂给它,生成带有群像叙事的专属视频。建议各位站长等API接入火山方舟后,可以尝试用它来降低内容制作成本,提升社区活跃度。大家觉得用它来做新手引导视频怎么样? 看到 Seedance 2.5 支持 30 秒长叙事和多人同框,感觉这功能用来做短剧或者同人二创视频太合适了。以前 AI 生成的视频都是几秒钟的碎片,很难连贯讲故事。现在能输入多张图片和音频做参考,是不是意味着我们可以直接上传小说插画和配音,让 AI 自动生成一集连贯的短剧?如果人物形象和声音能稳定还原,那个人创作者的门槛就大大降低了。不知道目前这个“群像叙事”在复杂动作场景下的表现怎么样?期待大佬们发实测效果。 Seedance 2.5 这次支持多模态参考输入和群像叙事,感觉对短视频创作者来说太实用了。比如做历史科普或者影视混剪,以前要自己拼接素材,现在直接丢几张参考图和几段音频,AI 就能理解元素并生成 30 秒的连贯叙事视频。大家觉得这种多模态输入能力,会不会让普通人的微短剧创作门槛大幅降低?另外群像叙事在还原多个人物声音时,口型对得上吗?期待 API 接入火山方舟后大家搞点好玩的二创。 Seedance 2.5 这次支持多模态参考素材输入,让我联想到地理信息数据(GIS)的应用潜力。如果能将高精度的卫星影像、地形高程数据甚至街景视频作为参考素材输入给模型,生成特定地理环境的30秒长叙事视频,对自动驾驶的场景仿真测试或者地理教育会非常有价值。不知道目前模型对这类专业地理空间数据的理解和还原度如何?期待后续能看到相关的实际应用案例。
页:
[1]