相关快讯
阿里通义实验室发布 Wan-Streamer v0.2:AI 视频电话响应延迟降至 550ms
阿里通义实验室发布 Wan-Streamer v0.2,面向实时双工交互,将听、看、说、演统一到单个 Transformer 中,支持文本、音频、视频的端到端实时理解与同步生成。模型端到端延迟约 550ms,较常见实时语音对话系统更快;输出分辨率提升至 640×368@25FPS,微表情和细节表现更清晰。
RynnWorld-4D:让机器人“看到三维未来”,重塑4D具身世界模型
近两年具身智能中,视频生成模型被广泛用于动作预测,思路是先生成未来视频,再提取动作执行。但这一范式仍受限于2D像素表征与3D物理世界之间的鸿沟:机器人需要精确距离和空间关系,而像素预测只能提供大致位置,难以支撑高精度操控。
Xmax AI 发布 X2.0:把视频变成可交互“玩”的界面
Xmax AI 源于 KEG 实验室这类顶级 AI 团队背景,2 月曾发布全球首个虚实融合实时交互视频模型 X1,引发海外关注但当时仍偏技术突破。5 个月后,Xmax AI 再推 X2.0 并开放商用 API,成为国内在实时编辑与交互视频模型方向落地最快、且唯一可规模化商用部署的公司。
海艺AI完成超亿元B轮融资,持续加码AI赛道
海艺(SeaArt)近日完成超亿元人民币B轮融资,由视觉中国、华盖创赢、祥峰投资联合领投,广发信德、天投科学城、川创投、合伟永晟跟投。资金将主要用于多模态底层技术研发、全球市场拓展以及AI垂类应用孵化,进一步强化其全球AI全模态内容互动娱乐平台布局。
蚂蚁灵波开源具身智能视频生成基础模型 LingBot-Video
蚂蚁灵波开源全球首个基于MoE架构、面向具身智能的视频生成基础模型LingBot-Video。该模型融合7万小时具身数据,重构视频预训练范式,在推理效率、物理合理性、动作理解和任务完成度上提升明显,并为视频基模迈向具身智能提供新底座。在RBench评测中总分0.620,超过Wan2.6、Seedance 1.5 Pro和Cosmos3 Super。
全球首个超高帧世界模型问世,零英伟达参与也能跑到50帧
魔芯科技联合浙江大学团队发布MoWorld,号称全球首个Flash World Model,也是首个全栈基于国产NPU构建的实时交互世界模型。该方案把世界模型推至50FPS实时交互,覆盖训练、蒸馏到部署的国产算力闭环,推理成本较同规模GPU方案降低70%。
