2025 世界人工智能大会(WAIC)期间,智象将来(HiDream.ai)联合创始人兼首席技术官姚霆发表主题演讲,体系阐释了多模态智能体在内容创作领域的技术突破与商业化实践。作为聚焦多模态生成的 AI 创新企业,智象将来期待通过探索多模态大模型的有用落地情势, “让创作回归灵感,让时间忠于故事” ,推动内容创作从工具服从提拔向生产力革命跨越。
AI技术的爆发式发展,正从实验室快速走向产业应用。智象将来始终以“解决真实创作痛点”为导向,在商业化落地中探索出一条“技术筑基、场景破局、价值闭环”的路径。智象将来认为,真正的AI商业化不是单点技术的夸耀,而是从模型能力到服务形态,再到最终成果的全链路赋能。
智象将来持续致力于从技术到价值的产品化思路,在这一过程中,智象构建了“MaaS-SaaS-RaaS”的递进商业化系统
MaaS(Model as a Service) 是根基。打造百亿级多模态基础模型,支撑图像、视频、音频、文本等多模态的生成与理解。
SaaS(Software as a Service) 是桥梁。基于基础模型,开发面向垂直场景的产品,建设小我创作者平台和社区,将技术能力转化为开箱即用的服务,降低创作门槛。
RaaS(Result as a Service) 是结局。通过商业视频营销服务、新媒体创作智能体,直接为客户交付“可落地的成果”,让AI真正成为创作的“生产力工具”而非“技术概念”。
这种 “模型支持服务,服务落地场景” 的逻辑,已在现实应用中验证:智象多模态生成平台已服务于影视制作、产品营销、文旅互娱等领域,实现从技术研发到商业价值的闭环。
多模态技术突破:从 “能生成” 到 “生成优”
技术实力是商业化的底气。智象多模态模型以“高维理解、精准生成”为核心,构建了覆盖图像、视频、编辑的全栈能力矩阵。
技术层面,智象多模态基础模型历经三次紧张迭代,构建起 “理解深、控制准、画质高” 的核心上风。模型从 2023 年 8 月的 1.0 版本(扩散模型 DiT,实现多模态对齐),到 2024 年 6 月 2.0 版本(扩散自回归模型 DiT+AR,强化时空建模),再到 2024 年 12 月 3.0 版本(MoE 多场景学习,记忆加强),持续突破生成技术瓶颈。
这些能力转化为三大核心价值:语义同等性(如 IP 故事活化时保持风格同一)、精准可控性(支撑个性化定制与元素自由调整)、影视级画质(4K 分辨率、长时序稳固输出),为专业创作提供技术保障。
在图像生成领域,HiDream 系列开源模型体现亮眼,累计下载量超 60 万次,被 Diffusers库、ComfyUI 、Recraft等主流工具集成。智象多模态全系列模型均在国际权威榜单排名前列。HiDream-I1 周全开源后24小时内即登顶 Artificial Analysis 榜单,成为首个问鼎榜首的中国自研模型,Hugging Face实时排名全球第一,下载量与点赞数持续攀升。此外,智象大模型家族已实现文本、图像、视频的联合建模,其视频生成产品支撑4K高清画质、全局 / 局部可控及剧本多镜头生成,被行业专家评价为「重新定义 AIGC 的美学标准」。同时,结合其开源的交互式编辑模型HiDream-E1,用户通过天然语言指令即可完成图像生成及编辑,直接降低创作门槛,助力全球开发者与创作者实现“所想即所得”。
7月,继问鼎图像生成开源模型竞技场榜单后,最新开源模型HiDream E1.1再次强势跻身Artificial Analysis图像编辑智能体榜单第一梯队,作为领先的开源图像编辑模型,性能周全超越Flux.1 Kontext等主流模型,支撑天然语言驱动的图像编辑 —— 用户通过笔墨指令即可完成背景替代、颜色修改、局部重绘等操作。
在视频生成领域,模型支撑文生视频、图生视频、首尾帧生成,可精准复刻国漫、吉卜力等风格,实现镜头活动与画面活动的联合学习。通过扩散自回归模型(DiT+AR),我们解决了视频生成中“时空同等性”难题,让生成内容更贴近真实物理世界的规律。
在创作工具箱层面,AI口播、视频模板、活动笔刷、假造换衣、图像超分等功能,形成了“生成-编辑-优化”的完备闭环,知足从小我创作者到企业客户的全场景需求。
产品形态:agent驱动的“创作革命”,重构内容创作全流程
在产品形态上,智象以 “智能体” 为核心形态,构建覆盖图像生成、视频创作、营销传播的工具链。
作为面向短视频二创的智能体,vivago agent以“多模态输入、智能拆解、交互式生成”为核心上风。用户只需提供图像、视频、音频、文本等素材(例如咖啡馆的logo、照片、宣传语),即可主动分析需求、拆解义务(分镜设计、剧本生成、素材检索),调用图像/视频生成模型补全内容,并通过智能剪辑工具整合输出。它不仅能理解“棕色线条勾勒的火焰+波浪logo”的视觉特性,还能捕获“静谧奢华的吧台场景”的氛围,让短视频创作从“从零开始”变为“按需生成”。
智象将来即将正式发布长视频编辑智能体-HiClip。针对长视频“内容过载、分发低效、回报周期长”的痛点,HiClip通过多模态语义理解,精准解构内容核心(如提取高光片段、生成音频择要),实现“一次创作、全域适配”的二次传播。无论是影视片段的高光剪辑,照旧教育课程的知识点拆解,HiClip都能让长视频内容焕发新的流量生命力。
产品化落地实现了创作方面的互补:vivago agent 聚焦短视频二创,通过模板检索、智能剪辑、多模态生成,帮助用户快速制作个性化内容,解决传统模板化创作的同质化题目;HiClip则针对长视频 “内容过载、分发低效” 的痛点,以多模态语义理解解构长视频核心信息,实现高光片段提取、跨平台适配剪辑,激发长视频二次传播价值。
生态共创:链接全产业链的价值网络
AI的价值,在于连接与赋能;技术与产品的落地,离不开生态的协同支持。目前,智象将来正携手跨境、互联网、影视、新媒体、文旅等多领域伙伴,构建覆盖多领域的生态网络,形成 “技术-场景-生态” 的共赢格局。
让每个创作者都能更好释放创意潜力,是智象的始终坚持。让AI 真正 “理解创作、辅助创作”,让内容产业的生产力革新正加速到来。智象将来期待以多模态智能体为支点,与行业伙伴共同探索“技术为笔,创意为墨”的新可能——让每个创作者都能聚焦灵感,让每个故事都能抵达更远的地方。
中国“一张蓝图绘到底”“一茬接着一茬干”的战略定力,在当前发展挑战不断增多的时代背......
0月25日,据住建部官网消息,2024年,全国计划新开工改造城镇老旧小区5.4万个。根据各地统计上报数据,1-9月份,......
0月25日,据住建部官网消息,2024年,全国计划新开工改造城镇老旧小区5.4万个。根据各地统计上报数据,1-9月份,......