阿里通义实验室近日发布 Wan-Streamer v0.2 模型,主打让 AI 像真人一样实现边听、边看、边回应的实时交互体验。根据官方介绍,这是一款面向实时双工交互的端到端全模态理解与生成模型,将“听、看、说、演”整合进单个 Transformer 之中。
在性能表现上,Wan-Streamer v0.2 强调极致低延迟,端到端响应延迟约为 550ms,其中包括 200ms 模型延迟和 350ms 网络延迟。与此同时,模型的画质能力也明显提升,输出分辨率从 v0.1 的 192×336 提高到 640×368 @ 25FPS,微表情等细节场景也能更清晰地呈现。
在能力架构上,该模型原生支持文本、音频、视频的实时理解与同步生成,无需依赖外部模块拼装。团队还将其与市面上的主流实时交互系统进行了对比,结果显示,Wan-Streamer 的端到端交互延迟约 0.55 秒(含网络传输),在响应速度上明显快于常见的实时语音对话模型。
相关快讯
Flova定义的Agent视频范式,正在成为新标杆
作者最近常用 Flova 制作 AI 小视频,并观察到许多 AI 视频产品的界面正趋于同质化:从 Agent 定位、交互方式到功能模块和操作流程,都在向相似方向演进。这种现象类似 ChatGPT 出现后,许多对话类 AI 产品纷纷模仿其对话框布局。
Meshy完成近4亿美元B轮融资,持续加码AI 3D生成技术
Meshy今日完成近4亿美元B轮融资,投后估值超100亿元人民币,创AI 3D领域单轮融资规模和估值新纪录。IDG资本、经纬中国、Monolith砺思资本等参与投资,老股东也大幅跟投。资金将用于AI多模态模型研发和全球市场拓展。
谷歌 Google Vids 新增数字分身功能,轻松自导自演“AI 大片”
谷歌为 Google Vids 增加个人数字分身和 Gemini Omni 视频生成能力:用户可上传自拍和语音生成拟真虚拟形象,也能用文字和图片创建视频,或修改背景、光线与特效,并支持分步对话式编辑。此次升级让 Vids 从职场演示工具进一步转向完整视频创作平台,并与 HeyGen、Synthesia 等竞争。
腾讯发布两大具身智能基座模型,VLM与RxBrain让机器人更懂现实世界
7月15日,腾讯Robotics X实验室、福田实验室联合腾讯混元发布两款具身智能基座模型:Hy-Embodied-VLM-1.0和Hy-Embodied-RxBrain-1.0,提升具身大脑对现实世界的理解、推理与想象能力。其中,前者聚焦物理状态、动作变化和时序自适应推理,增强场景感知、行动规划与导航等多模态能力。
Xmax AI发布X2.0:通用实时交互AI视频模型亮相
Xmax AI正式发布新一代通用实时交互AI视频模型Xmax X2.0,并开放API与产业合作接入。该模型在实时重渲能力上进一步升级,支持CharX实时换人、ClothX实时换装、VibeX实时换风格等功能;同时通过统一交互架构,提升为可理解摄像头、视频流和手势行为的全能模型。
Xmax AI 发布 X2.0:把视频变成可交互“玩”的界面
Xmax AI 源于 KEG 实验室这类顶级 AI 团队背景,2 月曾发布全球首个虚实融合实时交互视频模型 X1,引发海外关注但当时仍偏技术突破。5 个月后,Xmax AI 再推 X2.0 并开放商用 API,成为国内在实时编辑与交互视频模型方向落地最快、且唯一可规模化商用部署的公司。