阿里通义实验室近日发布 Wan-Streamer v0.2 模型,主打让 AI 像真人一样实现边听、边看、边回应的实时交互体验。根据官方介绍,这是一款面向实时双工交互的端到端全模态理解与生成模型,将“听、看、说、演”整合进单个 Transformer 之中。
在性能表现上,Wan-Streamer v0.2 强调极致低延迟,端到端响应延迟约为 550ms,其中包括 200ms 模型延迟和 350ms 网络延迟。与此同时,模型的画质能力也明显提升,输出分辨率从 v0.1 的 192×336 提高到 640×368 @ 25FPS,微表情等细节场景也能更清晰地呈现。
在能力架构上,该模型原生支持文本、音频、视频的实时理解与同步生成,无需依赖外部模块拼装。团队还将其与市面上的主流实时交互系统进行了对比,结果显示,Wan-Streamer 的端到端交互延迟约 0.55 秒(含网络传输),在响应速度上明显快于常见的实时语音对话模型。
相关快讯
资本重注端侧物理AI:前海母基金数亿元押注,Om AI联汇加速商业化落地
杭州联汇科技(Om AI 联汇)完成新一轮数亿元融资,由前海母基金领投,杭州政府产业基金等参投。公司同步开源 VLX-Seek 1.5 端侧原生多模态模型,性能据称超越英伟达同参数级核心模型。融资将用于 VLX 系列迭代、研发强化及物理 AI 商业化落地,显示资本对其技术与前景的认可。
蚂蚁AGI研究中心主任投身大模型创业,西湖心辰完成亿元融资
杭州大模型公司西湖心辰近日完成数亿元人民币B+轮融资。公司长期聚焦扩散范式下的原生多模态大模型研发,重点落地实时互动场景。其创始人蓝振忠为CMU AI博士、ALBERT第一作者,曾任谷歌AI研究院科学家。公司模型原生支持128K上下文,被称为全球首个大规模Agentic扩散模型,智能体测试表现接近同体量自回归模型。
MiniMax H3正式发布:新一代能力全面升级
稀宇科技正式发布 MiniMax H3,这是一款通用全模态生成模型,可统一理解文本、图像、视频和声音等多模态上下文,并生成具备原生双声道的音视频内容,最高支持 15 秒、2K 分辨率输出。
前 TikTok 产品经理创业,AI 视频共创平台 Wapoo 获千万美元天使融资
Wapoo 面向 Gen Alpha 推出视频共创社交平台,已完成近千万美元天使轮融资。创始人杨名宇曾任快手用户研究、TikTok 产品经理,参与过 TikTok Stories、TikTok Now 等项目。平台希望把 AI 视频生成变成轻量社交动作,让发布从“终点”变成“起点”,用户只需表达简单意图即可完成创作。
腾讯混元架构调整:合并大语言模型与多模态团队,加速模型研发
腾讯混元进行架构调整,将多模态模型部门与大语言模型部门合并为基础模型部,由首席 AI 科学家姚顺雨统一管理,以提升研发和协同效率,推动全模态模型探索。近年来,混元已形成图像、视频、语音、3D 生成等完整模型矩阵,且 2026 年以来迭代速度加快,与腾讯业务协同不断增强。
DeeVid AI悄然跻身第一梯队,斩获3000万欧美用户
DeeVid AI 是一款面向欧美市场的 AI 视频 Agent 产品,上线一年半已积累 3000 万注册用户,ARR 达数千万美元。它支持图片、音频、视频一体化生成,并可通过对话式 Agent 模式创建与引用 Skill、添加参考资料。整体体验主打“省心”,由 Agent 负责理解需求、拆解任务并在关键节点让用户确认。