逻辑智能低资源语音研究获选ICML 2026,韩国首尔见!

2个月前更新 zmtzn
5 0 0

逻辑智能团队将于7月6日前往韩国首尔,参与ICML 2026会议。团队提交的论文介绍了SE-Bridge-TTS技术,旨在解决真实语音稀缺的小语种环境。该技术通过合成数据扩展、自动筛选及偏好对齐,显著提升了语音合成的稳定性、自然度及可克隆能力。

逻辑智能低资源语音研究获选ICML 2026,韩国首尔见!的封面图

相关快讯

千问发布语音合成大模型 Qwen-Audio-3.0-TTS

千问正式发布语音合成大模型 Qwen-Audio-3.0-TTS,支持通过自然语言进行 Free-style 指令控制,提升了语音生成的灵活性与可用性。该模型提供面向实时交互的 Flash 版本,首包延时可达 300ms 级别,也提供面向高质量生成的 Plus 版本,满足不同场景需求。

阿里巴巴发布语音合成大模型 Qwen-Audio-3.0-TTS

阿里巴巴于7月20日发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度控制、自由指令、多语种方言和复杂声学鲁棒性上全面提升,并推出实时交互的Flash版和高质量生成的Plus版,使语音合成从“能说话”迈向“会表达”。目前Plus版已登顶Artificial Analysis榜单,预览版也曾夺冠。

如何评估 Multi-Agent 系统的过程?重新认识多智能体系统中的 Orchestrator

南京大学人工智能学院博士生朱俊泽作为第一作者,研究大模型多智能体理论、方法与框架。南京大学NLP实验室的ICML 2026论文指出:当前主流Orchestrator-Executor多智能体架构中,系统失败的关键原因往往不是执行器能力不足,而是负责全局调度的Orchestrator逐渐失去对任务的掌控。

网易推出Confucius4-TTS:首个支持14种语言的无口音语音克隆开源模型,仅需3秒音频即可实现音色复制

网易有道发布了“子曰 4.0”TTS语音合成引擎——Confucius4-TTS。该引擎是业内首个支持14种语言无口音跨语种语音克隆的开源模型,且无需参考文本。技术上,Confucius4-TTS具备零样本语音克隆能力,能够实现高效的语音合成。在情感表达方面,该引擎创新性地采用音频Prompt进行情感克隆迁移,突破了传统TTS依赖文本标签的限制,提升了情感表达的精准性和多样性。

小米玄戒芯片迎来新进展,国产自研芯片再进一步

小米于8月23日正式宣布,将于8月24日14点举行玄戒芯片技术沟通会。本次活动采用图文直播形式,方便外界及时了解相关技术动态与最新进展。届时,小米芯片负责人朱丹将出席并进行分享,介绍玄戒芯片目前取得的最新成果,为关注小米芯片研发和技术布局的用户提供更多信息。

联影携手天津大学发布全球首个磁共振脑机接口全栈解决方案「uMR神观」

全国首届磁共振脑机接口大会在天津召开。联影医疗与天津大学发布全球首个磁共振脑机接口全栈式解决方案“uMR神观”,打通“成像—仿真—调控—评估—算法迭代”闭环,推动磁共振由影像工具升级为脑机交互核心中枢。双方还联合发起创新联盟,旨在贯通采集、解码、调控、评估全链条,提升我国在该前沿领域的国际竞争力。

暂无评论

暂无评论...