Xmax AI 发布 X2.0:把视频变成可交互“玩”的界面

6天前更新 crj211401
3 0 0

智谱诞生于 KEG 实验室,这里本身就是国内顶尖的 AI Lab。其实早在今年 2 月,Xmax AI 就已发布全球首个虚实融合的实时交互视频模型 X1。虽然当时在海外社交媒体上引发了不小关注,但能力层面仍主要停留在技术突破阶段。

时隔 5 个月,Xmax AI 又在今日凌晨于 X(Twitter)正式发布 X2.0 模型,并同步开放商用 API。放眼国内,这一赛道基本仍属空白,Xmax AI 也被视为落地进度最快的团队,是目前国内唯一能够实现可商用、规模化部署实时编辑与交互模型的公司。

01 从 X1 到 X2.0
今年 2 月,Xmax AI 发布了全球首个虚实融合的实时交互视频模型 X1。

Xmax AI 发布 X2.0:把视频变成可交互“玩”的界面的封面图

相关快讯

Flova定义的Agent视频范式,正在成为新标杆

作者最近常用 Flova 制作 AI 小视频,并观察到许多 AI 视频产品的界面正趋于同质化:从 Agent 定位、交互方式到功能模块和操作流程,都在向相似方向演进。这种现象类似 ChatGPT 出现后,许多对话类 AI 产品纷纷模仿其对话框布局。

阿里通义实验室发布 Wan-Streamer v0.2:AI 视频电话响应延迟降至 550ms

阿里通义实验室发布 Wan-Streamer v0.2,面向实时双工交互,将听、看、说、演统一到单个 Transformer 中,支持文本、音频、视频的端到端实时理解与同步生成。模型端到端延迟约 550ms,较常见实时语音对话系统更快;输出分辨率提升至 640×368@25FPS,微表情和细节表现更清晰。

谷歌 Google Vids 新增数字分身功能,轻松自导自演“AI 大片”

谷歌为 Google Vids 增加个人数字分身和 Gemini Omni 视频生成能力:用户可上传自拍和语音生成拟真虚拟形象,也能用文字和图片创建视频,或修改背景、光线与特效,并支持分步对话式编辑。此次升级让 Vids 从职场演示工具进一步转向完整视频创作平台,并与 HeyGen、Synthesia 等竞争。

Xmax AI发布X2.0:通用实时交互AI视频模型亮相

Xmax AI正式发布新一代通用实时交互AI视频模型Xmax X2.0,并开放API与产业合作接入。该模型在实时重渲能力上进一步升级,支持CharX实时换人、ClothX实时换装、VibeX实时换风格等功能;同时通过统一交互架构,提升为可理解摄像头、视频流和手势行为的全能模型。

阿里加码,AI视频赛道强势崛起

爱诗科技宣布完成整体C轮融资,累计融资达29.8亿元人民币,最新C+轮由阿里巴巴领投,十余家机构跟投。公司成立仅三年多便接近完成30亿元单轮融资,融资规模跻身国内AI视频与大模型领域第一梯队,也反映出AI视频正成为AI商业落地的重要赛道。

全球首个超高帧世界模型问世,零英伟达参与也能跑到50帧

魔芯科技联合浙江大学团队发布MoWorld,号称全球首个Flash World Model,也是首个全栈基于国产NPU构建的实时交互世界模型。该方案把世界模型推至50FPS实时交互,覆盖训练、蒸馏到部署的国产算力闭环,推理成本较同规模GPU方案降低70%。

暂无评论

暂无评论...