• Home
  • Industry News
  • Innovation Hub

    Membership

    Innovation Cases

  • Expert Voices

    Expert Voices

  • Community
  • Partnership
  • 

    Search

  • 

    Login

  • 

    Collaboration

  • Home
  • Industry News
  • Innovation Hub
    • Membership
    • Innovation Cases
  • Expert Voices
  • Community
  • Partnership
  • 

    Search

  • 

    Login

  • 

    Collaboration

真正的情感自由!Fish Audio发布S2:多说话人、词级情绪控制、完全开源
作者:安安
 时间:2026-03-12 14:52:04

在文本转语音(TTS)技术长期追求“更像人”的征途中,情感表现力始终是那道最难跨越的门槛。过去的AI语音要么字正腔圆但机械味十足,要么即便能表达情绪,也无法精细到具体某个词是“开心”还是“低语”。

 

2026年3月10日,Fish Audio团队正式发布了新一代TTS模型 Fish Audio S2,试图彻底打破这一僵局。这款主打“情感自由”的开源模型,不仅实现了词级甚至短语级的精细化情绪控制,更原生支持多说话人对话生成,将AI语音的表现力推向了前所未有的高度。

 

让AI学会“表演”:用自然语言控制每一个词的情绪

 

Fish Audio S2最令人惊艳的核心突破,在于其对语音情绪的像素级操控能力。与以往仅能通过“高兴”、“悲伤”等全局标签调整整体语气的模型不同,S2允许用户通过自然语言指令或内联标签,在文本的任意位置插入具体的情感提示。

 

例如,你可以在台词中直接加入 `[laugh]`(笑)、`[whispers]`(耳语)、`[super happy]`(超级开心),甚至是更抽象的描述如 `[professional broadcast tone]`(专业播音腔)或 `[pitch up]`(升高音调)。模型会在生成音频时,严格遵循这些指令,在对应的词或短语上表现出相应的韵律、语调与气息变化。

 

这种能力让TTS从单纯的“朗读文本”进化为“有声表演”。据技术报告披露,为了达到这一效果,研究团队构建了包含约1000万小时、覆盖近50种语言的音频数据训练集,并结合了强化学习对齐(RL Alignment) 与双自回归(Dual-AR)架构。在Fish Audio自研的指令跟踪评测集上,S2的综合标签激活率高达93.3%,质量评分达到4.51/5.0,展现出对指令惊人的遵从度。

 

原生多说话人:一次推理,演完整场“对手戏”

 

除了情感控制,Fish Audio S2还实现了原生多说话人支持。这意味着,模型可以在单次推理中,无缝处理包含多个角色的复杂对话场景。

 

无论是对话的自然轮转、实时打断,还是不同角色音色的严格一致性与情感的自然传递,S2都能在生成音频时自动完成,无需额外的后处理或分轨合成。这为有声书多角色播讲、游戏NPC实时互动、虚拟主播连麦等场景提供了开箱即用的解决方案。

 

极致性能与完全开源:100毫秒的实时交互

 

在技术架构上,Fish Audio S2延续并进化了以往的积累。它采用RVQ(残差矢量量化)音频编解码技术,并结合了独特的双自回归架构:一个40亿参数的“慢速AR”模块负责规划语言结构、语义和整体韵律;另一个4亿参数的“快速AR”模块则专注于还原音色、气息和高频细节。这种分工让S2-Pro旗舰版本在生成44.1kHz高保真音频的同时,依然保持了极低的延迟。

 

性能方面,S2-Pro在NVIDIA H200硬件上的首音频延迟(TTFA)低于100毫秒,推理延迟小于150毫秒,完全满足实时对话机器人、虚拟主播直播等对响应速度要求苛刻的场景。

 

更令开发者兴奋的是,Fish Audio践行了完全开源的理念。不仅模型的权重和微调代码已在GitHub和Hugging Face全面公开,团队还发布了基于SGLang的流式推理引擎,方便开发者直接将其集成到生产环境中。

 

“真正的语言自由,从现在开始。”Fish Audio团队以此宣告,AI语音正在从冰冷的机械朗读,走向真正富有情感与个性的时代。随着S2的开源,我们或许很快就能在各种应用里,听到那些拥有“灵魂”的声音了。

分享到:
0
相关文章
  • 维基百科对 LLM 下 “逐客令”:严禁生成改写内容,守护知识净土

     2026-04-03

  • 苹果发布Manzano新型图像模型 突破理解与生成双重技术瓶颈

     2025-09-28

  • 告别手动操作:美团旗下光年之外推出Tabbit AI浏览器,集成多模型Agent实现网页全自动化

     2026-03-05

  • 马斯克预告AI编程新突破:Grok Build引领“氛围编程”革命

     2026-01-09

  • 阿里“呜哩”低调入场:通义千问加持,能否重塑AIGC设计赛道?

     2026-01-21

  • 阿里云国际出海峰会,数字化新篇章开启!

     2022-11-01

热门标签
  • 零售快消
  • CDIE
  • 数字化转型
  • 新零售
最新快讯
  • 

    OpenAI Codex全面攻占Windows,手机远程接管PC,7x24小时“数字员工”来了

    • Information Technology
  • 

    英特尔宣战英伟达:AI算力,不是只有GPU一条路

    • AI
  • 

    OpenAI亲自下场造机器人:时隔六年,世界模拟能力成为最大底牌

    • Information Technology
    • AI
  • 

    马斯克AI烧钱游戏:xAI去年巨亏64亿美元,靠Starlink养家,还要把算力送上天

    • Information Technology
    • AI
  • 

    8小时狂揽15K美金!Claude Code屠榜黑客松,开源神器爆15万星

    • AI
    • 新零售
查看更多 
最新入驻企业
  • 魔镜洞察

    AI市场研究与消费者洞察服务商

  • 拜特科技

    中国领先的资金管理软件服务商

  • 奇墨科技

    AI落地解决方案及数字化创新服务提供商

  • 致远互联

    一家集产品的设计、研发、销售及服务为一体高新技术企业

  • 滴普科技

    滴普科技是国内领先的全场景数据智能服务商

查看更多 
  • About Dot Connector

    About Us

    Join as Expert

    Join as Enterprise

    Media Partnerships

    Contact Us

  • Quick Links

    Industry News

    Enterprise Services

    Expert Voices

    Community

    Partnership

  • Popular Picks

    Latest Events

    Featured Companies

    Join as Enterprise

    Featured Experts

    Trending News

  • 关注我们

    扫码添加客服微信,
    享受1V1专属服务

    免费领取研究报告,
    发送名片申请入群
Copyright ©2017-2027 上海华昂商务咨询有限公司 All rights reserved. 沪ICP备15038859号-1