字节最强图像模型回归:17个案例深度实测Seedream 5.0 Pro

2周前更新 laddes
3 0 0

字节跳动 Seed 团队正式推出多模态图像创作模型 Seedream 5.0 Pro。距离今年 2 月 10 日 Seedream 5.0 预览版上线,已经过去近 5 个月。

与此前版本相比,Seedream 5.0 Pro 在图文匹配、结构合理性、文字渲染和画面美感等基础能力上进一步升级,并重点强化了四项核心能力:复杂信息可视化、交互式精准编辑、真实影像与人像质感、原生多语种输入与生成。

价格方面,Seedream 5.0 Pro API 采用输入图与输出图分别计费的方式。输出图不超过 236 万像素时,输入图首张免费,后续输入图按 0.02 元/张收费,输出图按 0.3 元/张收费。

字节最强图像模型回归:17个案例深度实测Seedream 5.0 Pro的封面图

相关快讯

字节旗下PICO迎来人事调整:创始人周宏伟卸任,李晓凯接任业务负责人

字节旗下XR业务PICO近日完成负责人调整,创始人周宏伟因个人规划不再担任负责人,由李晓凯接任并全面负责业务。此次交接不影响PICO既定战略、研发和产品计划,今年仍将按计划推出全新混合现实(MR)产品。字节内部表示,公司对XR长期价值判断未变,将继续支持PICO推进技术探索与产品创新。

阿里千问发布 Qwen-Image-3.0,图像生成再升级

阿里千问正式推出第三代图像生成基础模型Qwen-Image-3.0。新模型支持最高4.5k token输入,能够精准渲染10px小字,并原生支持12国语言的图像文字生成,进一步提升了多语言与细节表现能力。

字节亲自下场,“可玩版抖音”真的要来了?

今年以来,海外“可玩式内容”平台快速升温,融资和爆款不断,内容平台正从单纯分发信息转向分发体验。抖音近日内测“互动空间”,并向创作者开放AI互动内容生产工具、向用户开放消费入口,字节正式入局这一赛道。与此同时,腾讯、微信、小红书、阿里也在同步或先后布局互动内容。不同平台的基因,将决定各自最终能长出怎样的内容生态。

Meshy完成近4亿美元B轮融资,持续加码AI 3D生成技术

Meshy今日完成近4亿美元B轮融资,投后估值超100亿元人民币,创AI 3D领域单轮融资规模和估值新纪录。IDG资本、经纬中国、Monolith砺思资本等参与投资,老股东也大幅跟投。资金将用于AI多模态模型研发和全球市场拓展。

阿里通义实验室发布 Wan-Streamer v0.2:AI 视频电话响应延迟降至 550ms

阿里通义实验室发布 Wan-Streamer v0.2,面向实时双工交互,将听、看、说、演统一到单个 Transformer 中,支持文本、音频、视频的端到端实时理解与同步生成。模型端到端延迟约 550ms,较常见实时语音对话系统更快;输出分辨率提升至 640×368@25FPS,微表情和细节表现更清晰。

腾讯发布两大具身智能基座模型,VLM与RxBrain让机器人更懂现实世界

7月15日,腾讯Robotics X实验室、福田实验室联合腾讯混元发布两款具身智能基座模型:Hy-Embodied-VLM-1.0和Hy-Embodied-RxBrain-1.0,提升具身大脑对现实世界的理解、推理与想象能力。其中,前者聚焦物理状态、动作变化和时序自适应推理,增强场景感知、行动规划与导航等多模态能力。

暂无评论

暂无评论...