报道称,谷歌 DeepMind 近日发布了 GenCeption 模型,尝试把原本用于预训练的视频生成器重新利用到深度估计、图像分割等传统计算机视觉任务中。
援引博文介绍,大语言模型在学习预测下一个 Token 的过程中,往往会同步吸收语法规则、世界知识以及上下文关系等多层信息。
不过在计算机视觉领域,视觉模型目前还缺少类似的通用训练范式,因此长期以来更多由任务专用模型占据主导地位。比如用于分割的 “Segment Anything” 和用于深度估计的 “Depth Anything”,各自都依赖于专门设计的架构来完成对应任务。
相关快讯
谷歌AI业务重大人事变动:哈萨比斯卸任DeepMind CEO,首席科学家迪恩离职
谷歌宣布组织调整:DeepMind首席执行官哈萨比斯将转任董事长兼Alphabet首席科学家,卡武克丘奥鲁升任高级副总裁并接手其大部分职责,直接向皮查伊汇报;同时,任职27年的首席科学家杰夫·迪恩将离职,联合桑杰·格马瓦特创办新公司,推动机器学习、科学和工程领域探索。
消息称恩智浦洽谈收购边缘 AI 芯片设计企业 Ambarella
据《金融时报》报道,NXP 正与边缘 AI 芯片设计公司 Ambarella 谈判收购事宜,但交易仍在讨论中,未必最终达成。Ambarella 市值约 37.73 亿美元,主营计算机视觉和端侧 AI 芯片,面向汽车、安防、消费电子及工业机器人。若收购成功,NXP 将借此强化其在 SDV、雷达和电气化领域能力,并扩充车用半导体产品线。
牛津博士后林庆泓加入世界模型创企Video Rebirth,聚焦多模态智能体探索
林庆泓(Kevin)近期以首席研究员身份加入 Video Rebirth,负责多模态智能体与世界模型研究。他拥有新加坡国立大学博士、牛津大学博士后背景,曾任职腾讯、Meta、微软研究院,并在计算机视觉、视频多模态和智能体方向有多项成果,开源项目累计获 1.8 万 GitHub Stars。
谷歌Gemini 4启动,一夜连发三则更新
谷歌DeepMind同日推出三款Gemini新模型:更强的 Gemini 3.6 Flash、轻量更快的 Gemini 3.5 Flash-Lite,以及面向安全的 Gemini 3.5 Flash Cyber,重点提升生产环境中的 AI Agent 速度、能力和成本效率。同时,Gemini 4 的下一代预训练已启动,释放出谷歌继续加码 AI 竞争的强烈信号。
哈萨比斯呼吁美国牵头建立全球 AI 监管机构,谷歌 DeepMind CEO 发声
谷歌 DeepMind CEO 哈萨比斯建议美国牵头成立全球 AI 监督机构,制定统一安全标准,并在前沿模型发布前进行评估;若风险过高,还可协调行业“踩刹车”放缓发布。他正推动该提案,希望年底前投入运作。
蚂蚁灵波开源空间感知模型 LingBot-Depth 2.0:11 亿参数挑战 70 亿大模型
LingBot-Depth 2.0 是一款空间感知深度模型,擅长在反光、透明、极暗和杂乱遮挡环境下保持物理结构并生成完整深度图。它在行业公开数据集和私有高精度测试中表现突出,累计拿下12个世界第一,显著提升机器人在真实场景中的感知能力。