Hallo-Live:开启文本驱动音视频数字人的实时流式生成新时代

4个月前更新 zmtzn
30 0 0

最新研究成果由上海创智学院与复旦大学的研究团队推出,名为 Hallo-Live,旨在有效解决当前面临的矛盾。该方法融合了异步双流扩散(Asynchronous Dual-Stream Diffusion)与人类偏好引导蒸馏(Human-Centric Preference-Guided DMD),在两台 NVIDIA H200 GPU 上实现了20.38FPS的处理速度和0.94秒的端到端延迟。

Hallo-Live 的整体框架设计包括两个训练阶段。

Hallo-Live:开启文本驱动音视频数字人的实时流式生成新时代的封面图

相关快讯

百度二季度AI原生营销服务收入达26亿元

6月,百度APP月活跃用户达6.4亿。7月,百度一镜发布数字人视频播客解决方案,并在数字人微表情技术上取得重要突破。根据沙利文及IDC等机构报告认证,百度一镜已连续两年位居中国AI数字人市场份额第一、产品综合实力第一,显示其在数字人领域持续领先。

京东开源实时流式视频编辑模型 JoyAI-Video-Edit

京东于8月5日宣布开源自研实时流式视频编辑模型JoyAI-Video-Edit。该模型支持用户边看视频边修改人物和场景,将视频创作从“先有素材再修改”升级为可实时互动编辑,提升视频制作效率与灵活性。

MiniMax H3正式发布:新一代能力亮相

MiniMax正式发布通用全模态生成模型H3,支持统一理解文本、图像、视频和声音等多模态上下文,可生成原生双声道音视频,最高支持15秒、2K分辨率内容。MiniMax还表示,未来几天将在符合法律法规前提下开放模型权重。

MiniMax H3正式发布:新一代能力全面升级

稀宇科技正式发布 MiniMax H3,这是一款通用全模态生成模型,可统一理解文本、图像、视频和声音等多模态上下文,并生成具备原生双声道的音视频内容,最高支持 15 秒、2K 分辨率输出。

UW天才少女加入OpenAI!46场面试求职笔记刷屏

UW准博士、曾获OpenAI“超级对齐”资助的Alisa Liu,为进入OpenAI经历了57轮面试。面试内容覆盖Transformer底层原理、推理加速和数理统计推导等,题目高度浓缩、难度极高。她原以为顶级AI博士求职像“分院帽”式分配,现实却更像一场漫长而严苛的筛选。

百度一镜WAIC首发数字人视频播客,微表情技术再突破

百度一镜在WAIC首发数字人视频播客方案,突破微表情与多模态统一技术,可实现自然插话、专业视听表达,解决真人访谈成本高、数字人僵硬等痛点。方案由文心大模型、自研专精模型和海量样本训练支撑,配合编剧、导演、剪辑三大AI智能体,支持多类访谈内容工业化生产。实测显示,制作成本降74%,表现力提升785%,平均播放时长增29%。

暂无评论

暂无评论...