Fish Audio 是面向创作者和开发者的 AI 语音平台,提供情绪控制、多说话人 TTS、声音克隆、Voice Design、语音代理和实时 API。选型时最重要的不是试听哪种声音最像真人,而是先确认声音从哪里来、谁授权、模型是否公开。
三种声音来源
| 路线 | 来源 | 主要风险 |
|---|---|---|
| 公共声音 | 平台发现页已有模型 | 许可、作者和可用性变化 |
| Voice Design | 用文字设计原创声音 | 与真实人物意外相似 |
| Voice Clone | 上传真人录音建立模型 | 同意、身份和模型泄漏 |
克隆前必须取得许可
Fish Audio 官方最佳实践明确要求,只克隆本人、获得书面许可的人或已有授权的声音;不得从网络抓取语音,也不得克隆名人和公众人物。合作时应写清可生成内容、渠道、地区、期限、模型可见性和撤回流程。
录音质量决定可用性
普通快速克隆可用短样本建立方向,但要减少机械感,应录制更长的干净人声。房间保持安静,只保留一个说话者,关闭电视和背景音乐,麦克风距离稳定;样本中包含的噪声、混响和口头习惯会一起进入模型。
模型可见性怎么选
开发文档将音色分为 public、unlist 和 private。Public 会出现在发现页,Unlist 可通过链接访问,Private 仅创建者可见。客户、员工和未发布角色默认不应公开;共享链接也可能继续传播,不能把 Unlist 当严格保密。
用情绪和多人标签组织脚本
- 按说话者拆分台词,标记情绪、停顿与重读。
- 先生成 20–30 秒样段,确认音色、语速和专有名词。
- 长文按章节生成,并保持同一模型和参数。
- 合并后统一响度、呼吸、背景音乐和字幕时间轴。
套餐区分什么
当前计划按生成分钟、公共或私有音色槽位、专业克隆、Voice Design、队列和商业使用区分。免费计划适合个人试用;需要 YouTube 变现、客户配音或商业应用时,应使用明确允许商业用途的付费方案并保存账单。
授权记录:书面同意应关联录音提供者、样本文件哈希、允许用途、有效期和撤回联系人。生成成片再记录模型 ID 与发布渠道;这样发生争议时能说明声音从何而来,也能定位需要下架的具体项目,而不是删除全部无法追踪的文件。
API 上线前的治理
实时语音或代理接入需保护 API Key,限制文本长度和并发,记录模型 ID、请求时间与失败原因,并防止用户选择未授权公共音色。语音模型属于敏感数字资产,团队成员离开、配音演员撤回或项目结束时,应及时关闭访问并处理留存数据。
数据统计
相关导航
通过编辑转录文本剪辑音视频,并提供 Underlord、Studio Sound、字幕和短片工具
WellSaid
基于签约配音演员音色、按成品下载分钟计费并支持团队协作的 AI 旁白平台
AudioPen
把口述想法转录并重写成结构化文字,支持自定义文风、跨语言和多端输入
Adobe Podcast
提供 Enhance Speech、浏览器录制剪辑、转录字幕及分说话人原始音轨的 Adobe 音频工具
Typeless
AI 语音听写、语音转文本与办公写作工具
魔音工坊
面向短视频、有声书与团队协作的中文AI配音和自动打轴工具
Murf.ai
面向课程、演示和本地化团队的 AI 旁白工作室,支持幻灯片集成与商业导出
ElevenLabs
覆盖语音合成、配音翻译、语音识别、音效和声音克隆的 AI 音频平台
暂无评论...
