Fish Audio

2026-03-24发布 920 0 0

支持情绪控制、多说话人、声音设计、克隆与实时API的AI语音平台

所在地:
USA
语言:
en,zh
收录时间:
2026-03-24
Fish AudioFish Audio

Fish Audio 是面向创作者和开发者的 AI 语音平台,提供情绪控制、多说话人 TTS、声音克隆、Voice Design、语音代理和实时 API。选型时最重要的不是试听哪种声音最像真人,而是先确认声音从哪里来、谁授权、模型是否公开。

三种声音来源

路线 来源 主要风险
公共声音 平台发现页已有模型 许可、作者和可用性变化
Voice Design 用文字设计原创声音 与真实人物意外相似
Voice Clone 上传真人录音建立模型 同意、身份和模型泄漏

克隆前必须取得许可

Fish Audio 官方最佳实践明确要求,只克隆本人、获得书面许可的人或已有授权的声音;不得从网络抓取语音,也不得克隆名人和公众人物。合作时应写清可生成内容、渠道、地区、期限、模型可见性和撤回流程。

录音质量决定可用性

普通快速克隆可用短样本建立方向,但要减少机械感,应录制更长的干净人声。房间保持安静,只保留一个说话者,关闭电视和背景音乐,麦克风距离稳定;样本中包含的噪声、混响和口头习惯会一起进入模型。

模型可见性怎么选

开发文档将音色分为 public、unlist 和 private。Public 会出现在发现页,Unlist 可通过链接访问,Private 仅创建者可见。客户、员工和未发布角色默认不应公开;共享链接也可能继续传播,不能把 Unlist 当严格保密。

用情绪和多人标签组织脚本

  1. 按说话者拆分台词,标记情绪、停顿与重读。
  2. 先生成 20–30 秒样段,确认音色、语速和专有名词。
  3. 长文按章节生成,并保持同一模型和参数。
  4. 合并后统一响度、呼吸、背景音乐和字幕时间轴。

套餐区分什么

当前计划按生成分钟、公共或私有音色槽位、专业克隆、Voice Design、队列和商业使用区分。免费计划适合个人试用;需要 YouTube 变现、客户配音或商业应用时,应使用明确允许商业用途的付费方案并保存账单。

授权记录:书面同意应关联录音提供者、样本文件哈希、允许用途、有效期和撤回联系人。生成成片再记录模型 ID 与发布渠道;这样发生争议时能说明声音从何而来,也能定位需要下架的具体项目,而不是删除全部无法追踪的文件。

API 上线前的治理

实时语音或代理接入需保护 API Key,限制文本长度和并发,记录模型 ID、请求时间与失败原因,并防止用户选择未授权公共音色。语音模型属于敏感数字资产,团队成员离开、配音演员撤回或项目结束时,应及时关闭访问并处理留存数据。

数据统计

相关导航

暂无评论

none
暂无评论...