阿里通义实验室发布 Wan-Streamer v0.2:AI 视频电话响应延迟降至 550ms

2个月前更新
8 0 0

阿里通义实验室近日发布 Wan-Streamer v0.2 模型,主打让 AI 像真人一样实现边听、边看、边回应的实时交互体验。根据官方介绍,这是一款面向实时双工交互的端到端全模态理解与生成模型,将“听、看、说、演”整合进单个 Transformer 之中。

在性能表现上,Wan-Streamer v0.2 强调极致低延迟,端到端响应延迟约为 550ms,其中包括 200ms 模型延迟和 350ms 网络延迟。与此同时,模型的画质能力也明显提升,输出分辨率从 v0.1 的 192×336 提高到 640×368 @ 25FPS,微表情等细节场景也能更清晰地呈现。

在能力架构上,该模型原生支持文本、音频、视频的实时理解与同步生成,无需依赖外部模块拼装。团队还将其与市面上的主流实时交互系统进行了对比,结果显示,Wan-Streamer 的端到端交互延迟约 0.55 秒(含网络传输),在响应速度上明显快于常见的实时语音对话模型。

阿里通义实验室发布 Wan-Streamer v0.2:AI 视频电话响应延迟降至 550ms的封面图

相关快讯

DeepSeek-V4多模态模型刚刚开源

DeepSeek-V4-Flash-Vision-Exp已正式开源,是DeepSeek-V4系列首个实验性多模态模型。该模型此前已于8月21日上线API平台,基于DeepSeek-V4-Flash架构,集成视觉模块并通过持续训练,实现了视觉理解能力。

“星际觅元”完成千万元种子轮融资,聚焦星际探索赛道

全域场景具身智能系统供应商“星际觅元”近日完成千万元种子轮融资,由同创伟业领投,卧安机器人和旭源资本跟投。公司拟通过自研“多模态物理资产重构引擎+高拟真场景模拟生成器+全域具身智能大脑”,贯通物理数据生产、仿真训练、认知决策与机器人部署,让机器人理解环境并自主完成复杂操作。

月之暗面Kimi K2.5月底将结束服役:第一代万亿参数多模态模型谢幕

月之暗面Kimi发布消息称,公司第一代万亿参数多模态模型Kimi K2.5将于本月底结束服役。这意味着该模型即将退出当前服务体系,相关用户和业务后续可能需要关注官方安排及替代方案。此次调整也标志着Kimi模型产品迭代与服务阶段转换进入新的节点。

稀宇科技发布 MiniMax Design

稀宇科技推出 MiniMax Design,这是一款将多模态模型能力转化为实际生产力的工具。用户只需提出创作需求,它即可理解目标并拆解任务,自动调用相应模型与 Skills,完成素材处理、内容生成、编辑到最终交付的全流程。

剪映员工离职创业为何频现“人传人”现象

7月中旬,LibTV与Flova相继推出视频 Agent 功能并加大推广,行业竞争迅速升温。Flova强调其首创 Agent 创作 AI 视频范式,试图建立先发优势。与此同时,创业潮持续扩散,过去两年至少有10位“剪映系”创业者投身 AI 应用公司,今年上半年尤为密集,显示相关人才正加速外溢。

资本重注端侧物理AI:前海母基金数亿元押注,Om AI联汇加速商业化落地

杭州联汇科技(Om AI 联汇)完成新一轮数亿元融资,由前海母基金领投,杭州政府产业基金等参投。公司同步开源 VLX-Seek 1.5 端侧原生多模态模型,性能据称超越英伟达同参数级核心模型。融资将用于 VLX 系列迭代、研发强化及物理 AI 商业化落地,显示资本对其技术与前景的认可。

暂无评论

暂无评论...