网易推出Confucius4-TTS:首个支持14种语言的无口音语音克隆开源模型,仅需3秒音频即可实现音色复制

2个月前更新 kw178
9 0 0

网易有道今日发布了“子曰 4.0”TTS语音合成引擎——Confucius4-TTS。根据官方介绍,Confucius4-TTS 是行业首个支持14种语言无口音跨语种语音克隆开源模型,且无需参考文本。

在技术性能上,Confucius4-TTS 实现了零样本语音克隆。情感表达方面,该模型突破了传统TTS依赖文本标签控制情感的局限,创新性地支持音频Prompt情感克隆迁移。

网易推出Confucius4-TTS:首个支持14种语言的无口音语音克隆开源模型,仅需3秒音频即可实现音色复制的封面图

相关快讯

Anthropic联合创始人承认:人工智能正遭遇信任危机

Anthropic首席执行官阿莫代伊否认自己应为公众对AI的末日担忧负责,但承认行业面临信任问题。他指出,当前关于AI治理存在非此即彼的误区:有人担心监管会导致权力集中,也有人认为开源和广泛分发模型才是降低风险的最佳方式。他强调法院等制度机构可实现权力去中心化,并表示Anthropic支持对前沿AI企业适度约束,同时为小型竞争者创造发展空间。

智谱正式发布GLM-5.3

智谱正式发布GLM-5.3。相比GLM-5.2,它基座不变,但通过更强的后训练Scaling显著提升智能上限,编程能力尤为突出。内部体感评测较GLM-5.2提升50%,并在Terminal Bench 3.0、Agents' Last Exam(CLI)等公开基准中取得开源第一。

小红书开源 dots3-note:IMO 42 分满分同系列模型来了

小红书 dots 实验室宣布开源 dots3-note preview,这是 dots3 系列首个开源版本。该模型承接此前 dots-note-3.0 在国际奥数竞赛中拿下官方认证满分 42 分的成绩,当前开源版本重点面向更贴近现实、评测更困难的长程任务,进一步延续了社区对其能力开放的关注。

xAI联创再创业:押注开源模型与个人AI,已融资11亿美元

8 月 11 日,xAI 联合创始人伊戈尔·巴布什金创办的 River AI 宣布完成 11 亿美元融资。此后,他加入 OpenAI,受 GPT-2、GPT-3 背后的 Scaling 路线吸引,并参与大模型训练。2023 年,他与马斯克共同创办 xAI,负责训练基础设施和模型研发,押注推理能力将快速提升,进而用 AI 解决物理、科学、医学和工程问题。

清华团队正式开源 VeriLoop Coder-E1:循证螺旋驱动可验证的递归自我改进

清华大学深圳国际研究生院智能机器人实验室团队发布开源垂类代码模型 VeriLoop Coder-E1,基于 Qwen3.6-27B,面向仓库级代码修复与智能体式软件工程任务。在 Hugging Face 四项软件工程基准中表现突出,SWE-bench Verified 达 85.20,SWE-bench Pro 为 62.38,Terminal-Bench 2.0 为 76.40,DeepSWE 为 33.63】【。

美国部分企业开始采用中国大模型以降低成本

美国在算法大模型领域长期领先,但中国大模型近年迅速崛起,正冲击全球AI格局。月之暗面Kimi K3等开源模型引发资本市场关注,被称与DeepSeek当年的热潮相似,甚至获马斯克称赞。同时,Coinbase、爱彼迎等美国公司也开始转用中国模型,如Qwen,以降低成本。

暂无评论

暂无评论...