相关快讯
世界模型有触觉了:50万小时视频训练出首个隐式触觉世界动作模型
BeingBeyond智在无界发布首个基于人类视频数据的隐式触觉世界动作模型 Being-H0.8。它在预训练中让机器人学会预判接触方式,并在执行时结合触觉反馈及时调整动作,把触觉纳入“预测—执行—反馈”闭环,提升了对物体交互的适应能力。
谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1 的计算机视觉新突破
谷歌 DeepMind 发布 GenCeption,尝试把预训练的视频生成模型改造为通用视觉基础模型,用于深度估计、分割等经典任务。其思路借鉴大语言模型通过预测下一个 Token 学习语法和知识,但视觉领域长期缺少类似训练范式,因此一直依赖 Segment Anything、Depth Anything 这类面向单一任务的专用模型。
腾讯混元发布智能体 Hyra-1.0
腾讯混元推出首个 Hyra-1.0 版本,这是面向研究与工程任务的性能导向智能体,具备递归自我改进能力。除模型研发和科学发现外,Hyra 还可应用于游戏、设计、内容创作等开放场景,并通过自博弈、自评价和用户反馈持续迭代优化。
RynnWorld-4D:让机器人“看到三维未来”,重塑4D具身世界模型
近两年具身智能中,视频生成模型被广泛用于动作预测,思路是先生成未来视频,再提取动作执行。但这一范式仍受限于2D像素表征与3D物理世界之间的鸿沟:机器人需要精确距离和空间关系,而像素预测只能提供大致位置,难以支撑高精度操控。
灵光App升级世界模型体验,带来更沉浸的智能交互
7月9日,灵光App升级世界模型体验功能,接入蚂蚁灵波最新发布的 LingBot-World 2.0 能力。新版不再只是简单漫游和浏览,而是让AI生成的世界更具互动性,用户可像玩3D游戏一样进行技能操作,AI还会根据动作实时生成新的场景反馈。
全球首个超高帧世界模型问世,零英伟达参与也能跑到50帧
魔芯科技联合浙江大学团队发布MoWorld,号称全球首个Flash World Model,也是首个全栈基于国产NPU构建的实时交互世界模型。该方案把世界模型推至50FPS实时交互,覆盖训练、蒸馏到部署的国产算力闭环,推理成本较同规模GPU方案降低70%。
