谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1 的计算机视觉新突破

2小时前更新 xiaoshan
1 0 0

报道称,谷歌 DeepMind 近日发布了 GenCeption 模型,尝试把原本用于预训练的视频生成器重新利用到深度估计图像分割等传统计算机视觉任务中。

援引博文介绍,大语言模型在学习预测下一个 Token 的过程中,往往会同步吸收语法规则、世界知识以及上下文关系等多层信息。

不过在计算机视觉领域,视觉模型目前还缺少类似的通用训练范式,因此长期以来更多由任务专用模型占据主导地位。比如用于分割的 “Segment Anything” 和用于深度估计的 “Depth Anything”,各自都依赖于专门设计的架构来完成对应任务。

谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1 的计算机视觉新突破的封面图

相关快讯

谷歌Gemini 4启动,一夜连发三则更新

谷歌DeepMind同日推出三款Gemini新模型:更强的 Gemini 3.6 Flash、轻量更快的 Gemini 3.5 Flash-Lite,以及面向安全的 Gemini 3.5 Flash Cyber,重点提升生产环境中的 AI Agent 速度、能力和成本效率。同时,Gemini 4 的下一代预训练已启动,释放出谷歌继续加码 AI 竞争的强烈信号。

哈萨比斯呼吁美国牵头建立全球 AI 监管机构,谷歌 DeepMind CEO 发声

谷歌 DeepMind CEO 哈萨比斯建议美国牵头成立全球 AI 监督机构,制定统一安全标准,并在前沿模型发布前进行评估;若风险过高,还可协调行业“踩刹车”放缓发布。他正推动该提案,希望年底前投入运作。

蚂蚁灵波开源空间感知模型 LingBot-Depth 2.0:11 亿参数挑战 70 亿大模型

LingBot-Depth 2.0 是一款空间感知深度模型,擅长在反光、透明、极暗和杂乱遮挡环境下保持物理结构并生成完整深度图。它在行业公开数据集和私有高精度测试中表现突出,累计拿下12个世界第一,显著提升机器人在真实场景中的感知能力。

北大与启元研究院、京东携手推出RealAppliance新产品

在国际顶级计算机视觉会议CVPR 2026上,北京大学科研团队与上纬启元研究院及京东合作推出了RealAppliance数据集及RealAppliance-Bench评测基准。该项目聚焦于家电智能操作规划问题,旨在通过高保真仿真体系解决家庭服务机器人在实际操作中的评测难题。这一研究推动了具身智能在真实居家场景中的应用进程。

Magic Leap 转型 AI 智能眼镜光波导供应商,同步裁员近 200 人

Magic Leap 再次转型,停止研发自有 AR 头显,改为聚焦 AR 光波导技术供应,为其他厂商的 AI 智能眼镜提供核心显示方案。公司未来将以生态合作伙伴、光波导供应商和整机集成方案提供者的身份,帮助合作伙伴更快推出面向大众市场的产品。

腾讯、阿里、字节齐发力,AI办公大战全面打响

腾讯旗下AI办公智能体WorkBuddy在2026年6月月活访问量达2097万,较4个月前增长显著,并在易观Q2报告中位居17款主流产品首位,领先第二、第三名总和。同时,腾讯、字节、阿里等大厂加速整合旗下AI产品;腾讯QClaw相关业务和部分团队也将调整至云产品六部,与WorkBuddy纳入同一体系,但产品仍独立运营。

暂无评论

暂无评论...