牛津博士后林庆泓加入世界模型创企Video Rebirth,聚焦多模态智能体探索

3天前更新 haozi9365
1 0 0

获悉,新加坡国立大学博士、牛津大学博士后研究员林庆泓(Kevin)近日以首席研究员(Principal Researcher)身份加入世界模型公司 Video Rebirth,主要负责多模态智能体与世界模型方向的研究工作。

公开资料显示,Kevin 此前曾在腾讯、Meta、微软研究院参与研究,在计算机视觉视频多模态和智能体等方向积累了多项成果,其开源项目累计收获约 1.8 万个 GitHub Stars。

过去几年,他的研究路径从第一人称视频理解、长视频推理不断延伸至多模态智能体,持续聚焦的核心问题始终是:如何让 AI 不只是“看懂”视觉并回答问题,而是进一步进入环境、执行动作并完成任务。

牛津博士后林庆泓加入世界模型创企Video Rebirth,聚焦多模态智能体探索的封面图

相关快讯

世界模型有触觉了:50万小时视频训练出首个隐式触觉世界动作模型

BeingBeyond智在无界发布首个基于人类视频数据的隐式触觉世界动作模型 Being-H0.8。它在预训练中让机器人学会预判接触方式,并在执行时结合触觉反馈及时调整动作,把触觉纳入“预测—执行—反馈”闭环,提升了对物体交互的适应能力。

谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1 的计算机视觉新突破

谷歌 DeepMind 发布 GenCeption,尝试把预训练的视频生成模型改造为通用视觉基础模型,用于深度估计、分割等经典任务。其思路借鉴大语言模型通过预测下一个 Token 学习语法和知识,但视觉领域长期缺少类似训练范式,因此一直依赖 Segment Anything、Depth Anything 这类面向单一任务的专用模型。

腾讯混元发布智能体 Hyra-1.0

腾讯混元推出首个 Hyra-1.0 版本,这是面向研究与工程任务的性能导向智能体,具备递归自我改进能力。除模型研发和科学发现外,Hyra 还可应用于游戏、设计、内容创作等开放场景,并通过自博弈、自评价和用户反馈持续迭代优化。

RynnWorld-4D:让机器人“看到三维未来”,重塑4D具身世界模型

近两年具身智能中,视频生成模型被广泛用于动作预测,思路是先生成未来视频,再提取动作执行。但这一范式仍受限于2D像素表征与3D物理世界之间的鸿沟:机器人需要精确距离和空间关系,而像素预测只能提供大致位置,难以支撑高精度操控。

灵光App升级世界模型体验,带来更沉浸的智能交互

7月9日,灵光App升级世界模型体验功能,接入蚂蚁灵波最新发布的 LingBot-World 2.0 能力。新版不再只是简单漫游和浏览,而是让AI生成的世界更具互动性,用户可像玩3D游戏一样进行技能操作,AI还会根据动作实时生成新的场景反馈。

全球首个超高帧世界模型问世,零英伟达参与也能跑到50帧

魔芯科技联合浙江大学团队发布MoWorld,号称全球首个Flash World Model,也是首个全栈基于国产NPU构建的实时交互世界模型。该方案把世界模型推至50FPS实时交互,覆盖训练、蒸馏到部署的国产算力闭环,推理成本较同规模GPU方案降低70%。

暂无评论

暂无评论...