VicroCode
让代码创造价值
VicroCode是一个轻量级代码在线发布、交易平台,开箱即用,免部署、免服务器、免备案,支持接入智能体、通用管理系统、游戏等多种项目
稍候片刻,您可先学习AI编程手册
正在加载中...

市场信息

从生成内容到创造体验,多模态大模型如何改变内容生产?

点击查看原文>

www.infoq.cn · 2026-09-22T20:12:00+00:00

“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情,无法阻挡。

执导《可可西里》《南京!南京!

》的导演陆川说。今年云栖大会,陆川使用阿里巴巴多模态模型,制作了短片《历史·现场》,复原 1626 年明代北京城的“王恭厂之变”。

过去需要数月、千万级投入的制作,这次团队只用了 5 天。陆川甚至评价,模型对上下文的理解“已经达到‘博士后’的水平,超过 80% 以上的普通人”。

支撑陆川这类专业创作实践的,是过去一年多模态生成能力的持续提升。沿着技术演进继续往前看,两条路径尤其明显。

首先, 从单模态生成走向多模态融合生成 。对于视频而言,模型不仅可以联合处理画面与声音,参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。

过去主要依靠文字描述的创作意图,开始通过更直接的多模态信息传递给模型,生成因此更加一致和可控。其次, 从生成内容走向创造体验 。

随着生成时长增加、速度提升,视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入,根据新的状态生成后续内容,由此进入游戏、互动内容和仿真等新的应用空间。

这两条路径,也贯穿了阿里巴巴过去一年的多模态模型演进。 2025 年底发布的 Wan 2.6,已经支持智能分镜调度、参考生视频、多角色一致性等能力,视频生成开始从文生视频、图生视频,走向由更多参考信息共同控制的创作。

今年 4 月,Happy Horse 1.0 进一步采用单流 Transformer,原生联合生成音频和视频。整个第一梯队的视频模型,也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。

技术能力的提升,也在改变内容生产本身。 AI 已经开始进入越来越多专业工作流,成为内容生产的新基础设施。

承接此前在多模态领域的积累,今年云栖大会,阿里巴巴进一步更新了多模态生成模型家族。此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE(智能体式创作引擎)。

新一代视频生成模型也将在今年 11 月发布。与此同时,阿里巴巴还公布了对未来多模态模型的技术判断。

阿里巴巴 ATH 技术副总裁,淘天集团首席科学家郑波在云栖大会现场提到,三年内会出现一个原生全模态统一模型,体验将不再受限于模态的边界。图片,从“生成图片”走向视觉生产 过去两年,图像生成模型的画质、审美和真实感快速提升。

但进入生产场景,一张图片好看还不够。创作者需要稳定、可控地完成任务,而不是反复“抽卡”,靠概率碰出一张能用的图。

这对图像模型提出了更具体的要求: 信息要准确,排版要考究,专业内容要理解,生成结果最好能直接使用。今年云栖大会上,阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。

郑波以科研图示、营销图片和电影分镜为例,解释了生产力图像模型需要解决的问题。科研制图目前已经普遍使用了 AI 图像生成。

部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片,但前提是作者核验内容准确性,并明确披露 AI 的使用。在这个领域,AI 生成内容的准确性和对专业知识的理解,对于研究人员来说至关重要。

2024 年,《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文,其中出现了严重失真的大鼠解剖结构和错误标注。因此,面对学术原理图,模型需要实现“世界知识的渲染”:先理解复杂的科学原理,再将概念、流程和关系准确呈现出来。

图画得像不像,只是其中一个要求;知识有没有表达错,才决定它能不能进入科研生产。营销也是 AI 生图非常受欢迎的应用场景。

电商和品牌需要持续生产商品介绍、广告和社交媒体素材,一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题,展示了 Qwen-Image-3.1 生成的图片。

可以看到,模型能够同时处理中文标题、小字、图示和段落,并将不同信息组织出清晰的视觉层级,让读者一眼抓住重点。影视制作同样离不开图像模型。

AIGC 影视工作流不仅需要生成最终视频,前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜,需要把剧情进一步转换成具体的画面和镜头。

给出一段剧情,Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本,为后续视频生成提供更明确的视觉参考。而生产力图像还有一个重要要求: 模型需要理解一张图片在不同层级上的结构。

同一张人物照片,创作者可能只想修改其中一个对象,也可能需要提取轮廓、重新设计版式;再往后,还可能希望从单张正面照片生成不同角度的角色,甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境,对图像的理解层级也随之加深。

Qwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力,分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示,“编辑能力一定程度体现了图像模型的 reasoning 能力”。

这里的编辑,已经不只是对生成结果进行局部修改,也包括从已有图像中理解和提取结构,再沿着不同维度重新组织和生成内容。从科研图示、营销图片到电影分镜,这些生产任务最终指向的是同一个要求: 减少随机性,增加确定性。

当模型能够准确理解信息,并围绕已有视觉资产继续组织和生成内容,图像生成才真正走向生产。真正理解“审美”的音乐生成模型 AI 音乐供给快速增长,完整歌曲的生成能力早已不再稀缺。

现在,行业开始更关注专业可控性,以及更难量化的音乐品质:审美、旋律、人声和情绪表达。音乐的特殊之处也在这里。

图像是否准确,可以从文字、物体、空间关系等维度验证;音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳,人声是否自然,情绪是否准确,编曲是否符合特定文化和音乐类型的审美,很难依靠传统 Benchmark 完整衡量。

今年云栖大会发布的 Happy Shrimp 1.1,进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前,模型覆盖百余种曲风和十余种主流语言,可以生成人声歌曲和纯音乐。

相比 1.0,1.1 的旋律记忆点更强,人声唱法和情绪表达更加丰富,对复杂创作指令的理解进一步提升,多语言演唱的发音也更加准确、清晰。在大会现场,郑波展示了 Happy Shrimp 1.1 生成的多首作品。

不同语言下,模型都能较为清晰地完成人声演唱,并按照要求处理曲风和情绪。如何让模型更好地理解创作意图,理解容易被主观意义影响的“好听”?

Happy Shrimp 1.1 引入了 音乐审美建模与强化学习 ,将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说,音乐性本身开始成为模型的优化目标。

这种变化首先体现在旋律和编排上。 Happy Shrimp 1.1 强化了旋律的记忆点,让主题能够在重复、变化和再现中保持辨识度;编排则进一步处理配器、声部和律动,让主歌、副歌、桥段等不同部分承担各自的段落功能,推动整首作品的情绪发展。

在人声生成上,准确只是基础,唱法和情绪同样决定最终的听感。 Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度,也增加了唱法和情绪表达的丰富度。

目前,模型覆盖百余种曲风和十余种主流语言。但“好听”没有一套统一标准。

不同年代、文化和音乐类型,都有各自的旋律、配器、律动和演唱习惯。除了音乐审美,模型还需要把创作者相对抽象的描述,转换成具体的音乐选择。

比如用户只给出“雨夜返乡,克制的喜悦”,模型需要判断什么样的曲风和配器符合对应的文化语境,什么样的唱法适合这种情绪,律动应该有多强,段落又应该如何展开。 Happy Shrimp 1.1 通过世界知识增强音乐理解与生成,将文化语境和场景意图进一步对应到曲风、音色、律动和结构。

除了理解音乐本身,真正面向创作的模型,还要理解不同创作者需要什么。对于普通用户,目标是降低从一个想法到一首完整歌曲的门槛。

在 Happy Shrimp(快乐虾米)里,用户可以从一句想法开始,描述故事、情绪和风格,生成一首人声歌曲或纯音乐;歌词可以自己写,也可以由 AI 辅助完成。专业音乐人的需求则不同。

他们需要保留自己的创作判断,并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后,还需要继续修改、比较和选择版本。

Happy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律,用 B 的编曲风格与 C 的音色重新演绎”;局部修改副歌鼓组时,则只增强鼓组的冲击力,同时保护旋律、人声和其他段落。

这让创作者能够继续修改和加工生成结果,而不是反复抽卡,被迫接受模型的一次性成品。视频,从生成能力走向创作智能 这次发布会上,在预告新一代视频生成模型发布时间的同时,郑波公布了阿里巴巴对视频模型演进方向的判断。

视频模型已经从早期的 DiT 验证阶段,走向多模态参考创作,并开始进入理解创作的阶段。最早的 DiT 验证阶段,核心是先把视频生成出来,解决生成质量问题。

今年上半年开始,多模态参考能力快速演进,模型能够同时理解文字、图片、视频和音频,视频生成也从相对单一的输入走向多模态创作。郑波表示,目前市场上绝大部分用户都已经在使用多模态参考。

而现在,阿里巴巴的视频生成模型正在迈向下一个阶段:在生成素材的同时,进一步理解创作目标和创作意图。模型需要更懂叙事和镜头,能够从一个想法、一个故事出发,自动拆解剪辑和分镜,组织角色与场景,再完成最终生成。

再往后,阿里巴巴还在探索将理解、推理、生成和交互进一步统一,让 AI 从生成内容走向理解创作、参与创作和完成创作。沿着这个方向,阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。

“更长”,是在更长时间里保持人物、场景和内容的一致性,讲完一个完整故事;“更可控”,是让创作者更精确地控制人物、场景、镜头和其他创作元素;“更完整”,是从生成单个镜头走向理解剧情、情绪和完整叙事;“更智能”,则是更好地理解创作意图。要做到更长、更可控、更完整、更智能,仅靠视频生成模型本身并不够。

一段几秒的视频,还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频,人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化,都需要持续控制。

并且,除了文本、图片、视频和音频,3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态,也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同,视频生成工具还需处理跨时间的约束、工具调用,以及人物和场景等素材的持续复用。

阿里巴巴因此提出了 Agentic PE(智能体式创作引擎)辅助生成体系,用来组织复杂任务和长时域生成所需的多模态条件。 Agentic PE 先根据生成任务,确定需要哪些控制条件,再调用工具构建和组织这些条件。

条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频,以及相机几何信息。对于长时段生成,它还会规划不同时间段的约束,并持续更新条件。

为提高效率,它会检索和复用已有素材,并根据任务要求和时延选择控制精度。同时,推理时使用的控制信号需要在模型训练阶段得到支持,才能在生成时发挥作用。

多模态预训练与 Agentic PE 配合,可以让视频在持续生成的过程中保持可控,支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。

Agentic PE 则负责组织、构建和更新这些条件。对于长视频,持续的条件约束有助于保持前后内容一致,让变化符合创作要求。

对于实时流式生成,条件可以随着新输入逐步更新,引导后续画面,实现边生成、边交互。 Agentic PE 辅助生产也未必是最终的架构形态。

阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练,同时保留不同模态的输出头或专家。

过去几年,图像、音乐和视频生成主要沿着各自的技术路线发展。现在,生成任务正在变得更加复杂:文本之外,图像、视频、音频,以及轨迹、相机参数、3D 几何等信息,都开始成为生成条件。

图片开始从一次生成走向可编辑、可继续生产的视觉资产;音乐开始从生成完整歌曲,走向对旋律、审美和创作意图更细致的控制;视频则开始处理更长的叙事、更复杂的条件,并进一步探索实时流式生成。更丰富的多模态输入、更完整的创作能力,以及实时生成与交互,正在带着 AI 从生成内容,走向创造体验。

返回 AI 市场导读

来源:infoq.cn