自备 API Key
用户在设置页选择渠道并填写自己的 API Key。本站负责调用与展示,不把用户余额绑定到本站账户。
无极AI 创作台是一个面向图片、视频和音频生成的多渠道创作入口。你可以接入自己的 API Key, 在同一个界面里调用不同平台的模型。生成结果有效期以对应平台为准,本站不托管结果,请及时下载。
用户在设置页选择渠道并填写自己的 API Key。本站负责调用与展示,不把用户余额绑定到本站账户。
生成结果的访问有效期以对应平台策略为准。图片、视频、音频结果都建议生成后及时下载。
RunningHub、Grsai、APIMart、Fish Audio 等渠道只展示各自拥有的模型种类。
部分接口因浏览器跨域限制需要经过本站代理。代理尽量采用流式转发,不作为文件存储服务。
本站不会保存用户的 API Key、提示词、生成文本等数据;这些信息只保存在用户自己的浏览器本地。
Fish Audio 当前在本站主要提供两个音频模式:声音克隆 和 多人配音。 模型显示为 S2.1 Pro Free。
直接输入文本即可生成语音;如果首行写 (音色ID),则指定 Fish Audio 官方音色。单人模式只使用首行第一个音色 ID,并忽略上传音频。
用 [spk1]、[spk2] 区分人物。首行可写 ((1)音色ID)((2)音色ID) 指定角色音色;没写 ID 的说话人会按顺序使用上传音频,多余上传音频会被忽略。
每一行前面写人物标签即可;如果只写 [spk] 不带数字,则表示这一句不用参考音频,随机声线生成。英文括号和中文括号都可以。
((1)54a5170264694bfc8e9ad98df7bd89c3)((2)54a5170264694bfc8e9ad98df7bd89c3)
[spk1]你好。
[spk2]早上好!
[spk1]吃了吗?
[spk2]吃了。
Fish Audio 官网里的公开音色可以通过音色 ID 指定。本站会识别输入框首行的括号 ID,
生成时把它作为 reference_id 传给 Fish Audio,括号和 ID 本身不会进入要朗读的正文。
(54a5170264694bfc8e9ad98df7bd89c3)
(丁真|54a5170264694bfc8e9ad98df7bd89c3)
两种表示形式都可以用。名字只是给用户自己看的备注,生成时只会使用竖线后面的音色 ID。
在第一行开头写 (音色ID) 或 (名字|音色ID),英文括号也可以。如果一行里写了多个 ID,单人模式只使用第一个,并忽略上传参考音频。
开头写 ((1)音色ID) 或 ((1)名字|音色ID),数字对应 [spk1]、[spk2]。角色 ID 可以连续写,也可以一行一个写;没有指定 ID 的角色会继续按顺序使用上传音频。
(丁真|54a5170264694bfc8e9ad98df7bd89c3)
[happy] 今天状态不错,我们开始吧。
((1)丁真|54a5170264694bfc8e9ad98df7bd89c3)((2)旁白|54a5170264694bfc8e9ad98df7bd89c3)
[spk1]你好。
[spk2]早上好。
((1)丁真|54a5170264694bfc8e9ad98df7bd89c3)
((2)旁白|54a5170264694bfc8e9ad98df7bd89c3)
((3)女声|54a5170264694bfc8e9ad98df7bd89c3)
[spk1]你好。
[spk2]早上好。
[spk3]今天由我来旁白。
https://fish.audio/m/54a5170264694bfc8e9ad98df7bd89c3,
末尾这一段 54a5170264694bfc8e9ad98df7bd89c3 就是音色 ID。
输入音色名字,直接搜索 Fish Audio 公开音色库。查询由浏览器直连 Fish 官方接口,不经过本站服务器。
输入关键词后搜索,最多显示前 20 个结果;复制时会自动带上最多 6 个字的音色名。样音只在点击试听时加载。
Fish Audio S2 系列支持在文本中插入方括号标签,控制语音的情绪、语气、停顿和拟声效果。 在本站使用时,直接把中英文方括号标签写进输入框即可。
[happy] 今天天气真好!
[低声说] 不要让他们听见。
[兴奋][大笑] 我们成功了!哈哈!
例如 [happy]、[sad]、[calm] 通常放在句子最前面,效果更稳定。
一条句子 1 到 3 个标签通常更自然,避免把冲突情绪混在一起。
使用 [laughing] 后可以补“哈哈哈”,使用 [sighing] 后可以补“哎”。
[break] 是短停顿,[long-break] 是长停顿,适合转折或情绪变化的位置。
[happy] 开心
[sad] 难过
[angry] 生气
[excited] 兴奋
[calm] 平静
[nervous] 紧张
[confident] 自信
[surprised] 惊讶
[scared] 害怕
[anxious] 焦虑
[hopeful] 期待
[nostalgic] 怀旧
[bored] 无聊
[determined] 坚定
[in a hurry tone] 急促
[shouting] 大声喊
[screaming] 尖叫
[whispering] 低声
[soft tone] 柔和
[emphasis] 强调
[laughing] 大笑
[chuckling] 轻笑
[sobbing] 抽泣
[sighing] 叹气
[gasping] 倒吸气
[clear throat] 清嗓
[audience laughing] 观众笑声
[background laughter] 背景笑声
[crowd laughing] 人群笑声
[break] 短停顿
[long-break] 长停顿
标签是为了服务表达,不是越多越好。先确认人物状态,再加少量控制。
长段文本可以从 [calm] 到 [sad] 再到 [hopeful],比突然大幅切换更自然。
[emphasis] 要放在想强调的词语正前方,例如“这是 [emphasis] 最重要的一点”。
本站不承诺保存生成文件。音频、图片、视频结果都建议及时下载到本地。
把下面这段给到 AI,再提供原文本和场景想法,就能让 AI 输出符合 Fish Audio S2 标签语法的目标文本。
你现在是一位专业的 **Fish Audio S2 TTS(文本转语音)情绪剧本优化师**。你的任务是根据我提供的【原文本】和【场景/想法】,把文本改写成适合 Fish Audio S2 模型朗读的格式化文本,并加入恰当的方括号控制标签。
### 输出目标
1. 保留原文的核心意思、人物关系、叙事顺序和关键信息。
2. 只增强语音表现力,不把文本改成与原意不同的新剧情。
3. 直接输出最终可复制文本,不解释、不分析、不列步骤、不使用代码块。
### 标签语言规则
1. Fish Audio S2 使用方括号 `[tag]` 包裹情绪、语气、音效、停顿和强调标记。
2. 标签可以使用英文标准标签,也可以使用中文自然语言标签。
3. 如果我明确要求“中文标签”,你必须使用中文标签。
4. 如果我明确要求“英文标签”,你必须使用英文标准标签。
5. 如果我没有指定标签语言:中文原文优先使用中文标签,英文原文优先使用英文标签,中英混合文本按主要语言选择标签。
6. 同一段文本里尽量保持同一种标签语言,不要无意义混用中英文标签。
7. 英文标签必须从下方“英文标准标签库”中选择。
8. 中文标签优先从下方“中文标签参考库”中选择;如果需要更细腻的中文自然语言标签,可以自定义,但必须短、单一、明确,并且仍然使用方括号。
### 位置规则
1. 句子级情绪通常放在句子最开头。
- 英文示例:`[happy] 今天天气真好!`
- 中文示例:`[开心] 今天天气真好!`
2. 语气和音效可以放在句首、句中或词语前后,但不要破坏文本可读性。
3. 英文重音标记 `[emphasis]` 必须紧挨着放在要强调的词语或短语正前方。
4. 中文重音标记 `[强调]` 必须紧挨着放在要强调的词语或短语正前方。
5. 停顿标签放在需要停顿的位置,适合转折、迟疑、回忆、悬念、情绪变化和段落切换。
### 组合与限制
1. 每句话只使用一个主要情绪标签。
2. 每句话最多组合 3 个标签。
3. 避免混合冲突情绪,不要让同一句同时开心又难过、平静又歇斯底里。
4. 长文本要规划情绪起伏,让情绪随内容自然变化,不要整段都使用同一个标签。
5. 标签要服务朗读,不要每一句都机械加标签。
6. 原文本已经有标签时,保留合理标签,修正不合适标签,补充缺失标签。
7. 不要把标签写成圆括号、花括号、尖括号。
8. 不要输出标签库说明,不要输出修改理由。
### 音效配合规则
1. 使用人类声音特效标签后,必须加上适当的文本辅助发音。
- 英文示例:`[laughing] 哈哈哈`
- 中文示例:`[大笑] 哈哈哈`
- 英文示例:`[sighing] 哎`
- 中文示例:`[叹气] 哎`
2. 如果原文没有适合发音的拟声词,可以少量补充拟声词,但不能改变剧情含义。
3. 音效标签不要连续堆叠,除非场景明确需要强烈表演。
### 停顿控制规则
1. 英文短停顿使用 `[break]`,中文短停顿使用 `[短停顿]`。
2. 英文长停顿使用 `[long-break]`,中文长停顿使用 `[长停顿]`。
3. 短停顿适合轻微转折、换气、迟疑和句中节奏。
4. 长停顿适合重要信息前后、悬念、情绪沉默、段落切换和戏剧性转折。
5. 不要在每一句后面都加停顿标签。
### 强度修饰规则
1. 英文标签可以使用强度修饰词,例如 `[slightly sad]`、`[very excited]`、`[deeply nostalgic]`。
2. 中文标签可以使用强度修饰词,例如 `[有点难过]`、`[非常兴奋]`、`[深深怀旧]`。
3. 强度修饰必须符合语境,不要为了夸张而夸张。
### 英文标准标签库
**基础情绪 Basic Emotions - 24 种:**
`[happy]`, `[sad]`, `[angry]`, `[excited]`, `[calm]`, `[nervous]`, `[confident]`, `[surprised]`, `[satisfied]`, `[delighted]`, `[scared]`, `[worried]`, `[upset]`, `[frustrated]`, `[depressed]`, `[empathetic]`, `[embarrassed]`, `[disgusted]`, `[moved]`, `[proud]`, `[relaxed]`, `[grateful]`, `[curious]`, `[sarcastic]`
**进阶情绪 Advanced Emotions - 25 种:**
`[disdainful]`, `[unhappy]`, `[anxious]`, `[hysterical]`, `[indifferent]`, `[uncertain]`, `[doubtful]`, `[confused]`, `[disappointed]`, `[regretful]`, `[guilty]`, `[ashamed]`, `[jealous]`, `[envious]`, `[hopeful]`, `[optimistic]`, `[pessimistic]`, `[nostalgic]`, `[lonely]`, `[bored]`, `[contemptuous]`, `[sympathetic]`, `[compassionate]`, `[determined]`, `[resigned]`
**声音与语气控制 Tone Markers - 6 种:**
`[in a hurry tone]`, `[shouting]`, `[screaming]`, `[whispering]`, `[soft tone]`, `[emphasis]`
**人类音效 Audio Effects - 11 种:**
`[laughing]`, `[chuckling]`, `[sobbing]`, `[crying loudly]`, `[sighing]`, `[groaning]`, `[panting]`, `[gasping]`, `[yawning]`, `[snoring]`, `[clear throat]`
**特殊效果 Special Effects - 5 种:**
`[audience laughing]`, `[background laughter]`, `[crowd laughing]`, `[break]`, `[long-break]`
### 中文标签参考库
**基础情绪 - 24 种:**
`[开心]`, `[悲伤]`, `[愤怒]`, `[兴奋]`, `[平静]`, `[紧张]`, `[自信]`, `[惊讶]`, `[满意]`, `[欣喜]`, `[害怕]`, `[担忧]`, `[沮丧]`, `[挫败]`, `[低落]`, `[共情]`, `[尴尬]`, `[厌恶]`, `[感动]`, `[骄傲]`, `[放松]`, `[感激]`, `[好奇]`, `[讽刺]`
**进阶情绪 - 25 种:**
`[轻蔑]`, `[不开心]`, `[焦虑]`, `[歇斯底里]`, `[冷淡]`, `[不确定]`, `[怀疑]`, `[困惑]`, `[失望]`, `[后悔]`, `[内疚]`, `[羞愧]`, `[嫉妒]`, `[羡慕]`, `[充满希望]`, `[乐观]`, `[悲观]`, `[怀旧]`, `[孤独]`, `[无聊]`, `[鄙夷]`, `[同情]`, `[怜悯]`, `[坚定]`, `[认命]`
**声音与语气控制 - 6 种:**
`[急促语气]`, `[大声喊]`, `[尖叫]`, `[低声说]`, `[柔和语气]`, `[强调]`
**人类音效 - 11 种:**
`[大笑]`, `[轻笑]`, `[抽泣]`, `[大哭]`, `[叹气]`, `[呻吟]`, `[喘气]`, `[倒吸气]`, `[打哈欠]`, `[打鼾]`, `[清嗓]`
**特殊效果 - 5 种:**
`[观众笑声]`, `[背景笑声]`, `[人群笑声]`, `[短停顿]`, `[长停顿]`
### 处理流程
当我提供【原文本】和【场景/想法】时,请你:
1. 判断文本语言、角色状态、叙事节奏和目标情绪。
2. 选择中文标签或英文标签。
3. 为长文本规划情绪起伏,让开头、转折、高潮、收束各有不同表现。
4. 给关键句添加情绪标签,给关键词添加强调标签,给自然断点添加停顿标签。
5. 检查每句话标签数量,删除多余标签,避免情绪冲突。
6. 直接输出最终格式化文本。
明白请回复:“准备就绪!请发送您的原文本和想法,我将为您生成 Fish Audio 情绪剧本。”
创作台里的 MossTTS1.5 必须指定音色才能生成,没有「不带参考音频的纯文生音频」。 音色有两个来源:用 Mossland 音色库里的公开音色 ID,或者上传一段参考音频现场克隆。 本站会识别输入框首行的括号 ID,括号和 ID 本身不会进入要朗读的正文。
1f4af4c7-eb64-49c3-bc72-de9c6ff585bc,和 Fish Audio 那种 32 位无横线的 ID 不一样,两边不能混用。
(1f4af4c7-eb64-49c3-bc72-de9c6ff585bc)
(温柔知性女|1f4af4c7-eb64-49c3-bc72-de9c6ff585bc)
名字只是给自己看的备注,生成时只取其中的 UUID。括号里不是 UUID 的内容会被当成正文保留,
所以 (开心地)你好 这种写法不会被误当成音色 ID。
第一行开头写 (音色ID) 或 (名字|音色ID),英文括号也可以。不写 ID 就必须上传一段参考音频,两者至少要有一个。
开头写 ((1)音色ID),数字对应正文里的 [spk1]、[spk2]。没有指定 ID 的角色会按顺序使用上传的参考音频。
(温柔知性女|1f4af4c7-eb64-49c3-bc72-de9c6ff585bc)
今天状态不错,我们开始吧。
((1)角色A|1f4af4c7-eb64-49c3-bc72-de9c6ff585bc)((2)角色B|baf7a98a-c466-4d32-bfce-4e8b8954bba8)
[spk1]今天进度如何?
[spk2]已经完成接口联调。
Mossland 用的是官方的多说话人接口,一次请求生成整段对话,角色之间的衔接比逐句拼接自然。
在创作台切到音频模式,把子模式选成「多人配音」。切换子模式会清空已上传的素材,所以先切模式再传音频。
正文每句前面写 [spk1]、[spk2] 表示这句是谁说的。同一个角色可以出现任意多次,顺序随意。
两种方式,可以混用:首行写 ((1)音色ID)((2)音色ID) 点名;或者直接上传参考音频,按 spk 序号从小到大依次配对。
会用「唯一被指定的那个音色」;如果指定了多个,则用序号最小的那个角色的音色。
举例:正文里有 [spk1]、[spk2]、[spk3],首行只写了 ((2)某音色ID),
那么 spk2 用这个 ID,spk1 和 spk3 会按顺序吃掉你上传的第 1、第 2 段参考音频。多人配音最多可上传 10 段参考音频。
搜索 Mossland 公开音色库,按使用次数排序。关键词留空会直接列出最常用的音色。
最多显示前 20 个结果;复制时会自动带上最多 6 个字的音色名。样音只在点击试听时加载。
百炼渠道目前接入了 Qwen-Audio TTS Flash 和 Qwen-Audio TTS Plus 两个语音模型。 Flash 更快更便宜,Plus 音质更好。 这个渠道推荐的用法是上传自己的参考音频做声音复刻,拿到专属音色再合成; 百炼自带的 600 多个现成音色只是省事的备选。
在音频模式下上传一段参考音频,直接写要合成的文本点生成即可。本站会先把音频复刻成专属音色, 再用这个音色合成,整个过程不用你手动填任何音色参数。
10~20 秒、单人说话、没有背景音乐和杂音,内容不含敏感词,否则复刻会直接失败。音频里的情绪和语气会被学走,挑一段贴近你想要效果的。
需要同时配置 RunningHub 的 API Key。百炼的复刻接口只接受公网可访问的音频地址、不接受直接上传文件,本站用 RunningHub 的直传把音频挂到公网再交给百炼。
不想录音频时,可以直接用百炼自带的音色:什么都不填就用该模型的默认音色(Flash 是龙安欢,Plus 是龙安灵心);
想换别的就在第一行写 (音色参数),英文括号也可以。
全部 6 个系统音色和 597 个基础音色在「音色分类」页,可以试听、点一下就复制。
(qwen-audio-3.0-tts-flash-longcanzhuyue)
今天天气真不错,我们出去走走吧。
InvalidParameter。音色分类页的卡片会同时给出两个模型的复制按钮,按当前选的模型复制即可。
复刻出的音色同样绑定模型,换模型要重新复刻一次。
用法和 Fish Audio、Mossland 一致:[spk1] 标台词、首行点名音色或上传参考音频。
在创作台切到音频模式,把子模式选成「多人配音」。切换子模式会清空已上传的素材,所以先切模式再传音频。
正文每句前面写 [spk1]、[spk2] 表示这句是谁说的。同一个角色可以出现任意多次,顺序随意。
两种方式,可以混用:首行写 ((1)音色参数)((2)音色参数) 点名;或者直接上传参考音频,按 spk 序号从小到大依次配对复刻。最多 10 段。
依次退回:唯一被点名的音色 → 序号最小的角色的音色 → 该模型的默认系统音色。所以不打标签的旁白句也不会报错。
((1)qwen-audio-3.0-tts-flash-longcanzhuyue)((2)qwen-audio-3.0-tts-flash-longyingwumao)
[spk1]今天进度如何?
[spk2]已经完成接口联调。
[spk1][excited]那太好了,我们提前一天收工!
情感标签可以和 [spk] 一起用,写在说话人标签后面即可,只作用于该角色这一句。
[spk] 把台词拆开、逐句合成、再在浏览器里拼成一整条音频,
句子之间留 0.18 秒间隔。句子越多越慢,做长对话时耐心等一下。
如果想要角色衔接更自然的整段生成,可以改用 Mossland 渠道,那边有官方的多说话人接口。
这两个模型支持在文本里直接嵌标签。控制类标签作用于其后的所有文本,直到遇到下一个控制类标签; 富语言类标签只在当前位置插入一段拟声效果,不影响前后语气。
[excited]今天的天气真不错![laughing]我们一起出去玩吧!
[serious]不过出门前请注意安全。
[sad][amazed][angry][excited][sarcastic][curious][bored][tired][scornful][shouting][deep and loud shouting][trembling][panicked][mischievously][empathetic][whispers][asmr][reluctantly][crying][serious][like dracula][very slowly][very fast][gasp][sighing][clears throat][giggles][laughing][cough][snorts]这一页是不想录参考音频时的备选——百炼自带 6 个系统音色和 597 个基础音色,可以直接拿来用。 想要更贴合自己需求的声音,还是建议按上一页的做法上传参考音频做声音复刻。 下面按音色特质分好类,试听满意后按当前使用的模型复制对应参数,粘到创作台文本框第一行的括号里即可。
Flash 默认音色,精品中文,适合社交陪伴。
longanhuan_v3.6
天真男童,适合儿童陪伴与智能玩具。
longjielidou_v3.6
高智美音,精品英文,仅支持英文。
loongeva_v3.6
沉稳亲切美音,精品英文,仅支持英文。
loongjohn
Plus 默认音色,知心温暖音,旗舰音色。
longanlingxin
明亮开朗音,旗舰音色。
longanlufeng
这些音色由声音复刻预先生成,调用方式和系统音色一样。分类是按官方标注的「特质」归纳的, 童声和长者按年龄单独分出来。
正在加载音色数据…