美图RoboNeo接入MiniMax H3,新增局部编辑与多模态理解

3周前更新 7g5rstyn
3 0 0

美图旗下 RoboNeo 正式宣布接入 MiniMax H3,此举将进一步提升其多模态理解能力,可同时识别并处理文字、图片、视频、音频等多种输入内容。

在编辑能力方面,RoboNeo 也同步强化了更精细的视频局部修改功能,支持人物替换、物体增减、背景调整、特效变更、音色迁移以及台词修改等操作。

美图RoboNeo接入MiniMax H3,新增局部编辑与多模态理解的封面图

相关快讯

京东开源实时流式视频编辑模型 JoyAI-Video-Edit

京东于8月5日宣布开源自研实时流式视频编辑模型JoyAI-Video-Edit。该模型支持用户边看视频边修改人物和场景,将视频创作从“先有素材再修改”升级为可实时互动编辑,提升视频制作效率与灵活性。

京东开源自研 JoyAI-Video-Edit:实现视频“边播边改”,多项指标全球领先

京东今日开源自研实时流式视频编辑模型 JoyAI-Video-Edit,支持边观看边修改人物和场景,让视频创作从“先素材后修改”升级为实时互动编辑。官方称其在流式视频编辑领域各项指标领先,达到世界一流水平,并基于全自研 JoyAI-Video 模型,在 720P 下实现每秒 30 帧推理速度,解决实时编辑的卡顿与延迟问题。

摩尔线程完成 MiniMax H3 多模态生成模型适配

MiniMax今日正式开源多模态生成模型MiniMax H3。与此同时,摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,率先完成了H3的适配与运行,展示了对该模型的快速支持能力。

A²-Edit:打破类别与掩码限制,实现精准参考图编辑

上海交通大学与上海创智学院团队提出 A²-Edit,构建统一框架支持任意物体类别和任意精度掩码的参考图引导局部编辑。该方法通过混合 Transformer 专家路由、掩码退火训练和50万级多品类数据,提升跨类别统一建模能力,使用户仅需提供粗略区域,即可实现身份一致、结构完整、自然融合的编辑效果。

MiniMax H3正式发布:新一代能力全面升级

稀宇科技正式发布 MiniMax H3,这是一款通用全模态生成模型,可统一理解文本、图像、视频和声音等多模态上下文,并生成具备原生双声道的音视频内容,最高支持 15 秒、2K 分辨率输出。

中国医疗AI再登顶,微信“私人医生”迎来重磅升级

过去十年医疗AI经历两次范式跃迁:先是基于数字化医学文献获得知识检索能力,后是通过WiseDiag V2等升级实现对影像、报告、化验单和体征照片的多模态理解。2026年7月底发布的WiseDiag V3与好伴AI,进一步夯实了医疗AI“看得见、看得懂”的统一推理基础。

暂无评论

暂无评论...