无极AI 文档 返回创作台
Wuji AI Docs

无极AI 创作台文档中心

无极AI 创作台是一个面向图片、视频和音频生成的多渠道创作入口。你可以接入自己的 API Key, 在同一个界面里调用不同平台的模型。生成结果有效期以对应平台为准,本站不托管结果,请及时下载。

使用原则

自备 API Key

用户在设置页选择渠道并填写自己的 API Key。本站负责调用与展示,不把用户余额绑定到本站账户。

结果不由本站托管

生成结果的访问有效期以对应平台策略为准。图片、视频、音频结果都建议生成后及时下载。

渠道各自独立

RunningHub、Grsai、APIMart、Fish Audio 等渠道只展示各自拥有的模型种类。

轻量中转

部分接口因浏览器跨域限制需要经过本站代理。代理尽量采用流式转发,不作为文件存储服务。

本地保存敏感信息

本站不会保存用户的 API Key、提示词、生成文本等数据;这些信息只保存在用户自己的浏览器本地。

01

Fish Audio 入门使用

Fish Audio 当前在本站主要提供两个音频模式:声音克隆多人配音。 模型显示为 S2.1 Pro Free

声音克隆

直接输入文本即可生成语音;如果首行写 (音色ID),则指定 Fish Audio 官方音色。单人模式只使用首行第一个音色 ID,并忽略上传音频。

多人配音

[spk1][spk2] 区分人物。首行可写 ((1)音色ID)((2)音色ID) 指定角色音色;没写 ID 的说话人会按顺序使用上传音频,多余上传音频会被忽略。

多人配音格式

每一行前面写人物标签即可;如果只写 [spk] 不带数字,则表示这一句不用参考音频,随机声线生成。英文括号和中文括号都可以。

((1)54a5170264694bfc8e9ad98df7bd89c3)((2)54a5170264694bfc8e9ad98df7bd89c3)
[spk1]你好。
[spk2]早上好!
[spk1]吃了吗?
[spk2]吃了。
提示 Fish Audio 部分接口由用户浏览器直连官方 API;如果当前网络访问不了 Fish Audio,需要用户自行处理网络环境。
02

Fish Audio 音色 ID

Fish Audio 官网里的公开音色可以通过音色 ID 指定。本站会识别输入框首行的括号 ID, 生成时把它作为 reference_id 传给 Fish Audio,括号和 ID 本身不会进入要朗读的正文。

纯 ID (54a5170264694bfc8e9ad98df7bd89c3)
带名字 (丁真|54a5170264694bfc8e9ad98df7bd89c3)

两种表示形式都可以用。名字只是给用户自己看的备注,生成时只会使用竖线后面的音色 ID。

单人声音克隆

在第一行开头写 (音色ID)(名字|音色ID),英文括号也可以。如果一行里写了多个 ID,单人模式只使用第一个,并忽略上传参考音频。

多人配音

开头写 ((1)音色ID)((1)名字|音色ID),数字对应 [spk1][spk2]。角色 ID 可以连续写,也可以一行一个写;没有指定 ID 的角色会继续按顺序使用上传音频。

写法示例

(丁真|54a5170264694bfc8e9ad98df7bd89c3)
[happy] 今天状态不错,我们开始吧。
((1)丁真|54a5170264694bfc8e9ad98df7bd89c3)((2)旁白|54a5170264694bfc8e9ad98df7bd89c3)
[spk1]你好。
[spk2]早上好。
((1)丁真|54a5170264694bfc8e9ad98df7bd89c3)
((2)旁白|54a5170264694bfc8e9ad98df7bd89c3)
((3)女声|54a5170264694bfc8e9ad98df7bd89c3)
[spk1]你好。
[spk2]早上好。
[spk3]今天由我来旁白。
怎么从官网链接拿 ID 如果官网音色链接是 https://fish.audio/m/54a5170264694bfc8e9ad98df7bd89c3, 末尾这一段 54a5170264694bfc8e9ad98df7bd89c3 就是音色 ID。

音色 ID 搜索

输入音色名字,直接搜索 Fish Audio 公开音色库。查询由浏览器直连 Fish 官方接口,不经过本站服务器。

打开 Fish Audio

输入关键词后搜索,最多显示前 20 个结果;复制时会自动带上最多 6 个字的音色名。样音只在点击试听时加载。

03

情绪控制

Fish Audio S2 系列支持在文本中插入方括号标签,控制语音的情绪、语气、停顿和拟声效果。 在本站使用时,直接把中英文方括号标签写进输入框即可。

[happy] 今天天气真好!
[低声说] 不要让他们听见。
[兴奋][大笑] 我们成功了!哈哈!

句子级情绪放句首

例如 [happy][sad][calm] 通常放在句子最前面,效果更稳定。

每句不要堆太多标签

一条句子 1 到 3 个标签通常更自然,避免把冲突情绪混在一起。

音效要配文字

使用 [laughing] 后可以补“哈哈哈”,使用 [sighing] 后可以补“哎”。

停顿增强真实感

[break] 是短停顿,[long-break] 是长停顿,适合转折或情绪变化的位置。

常用标签:基础情感

[happy] 开心 [sad] 难过 [angry] 生气 [excited] 兴奋 [calm] 平静 [nervous] 紧张 [confident] 自信 [surprised] 惊讶 [scared] 害怕

进阶情感

[anxious] 焦虑 [hopeful] 期待 [nostalgic] 怀旧 [bored] 无聊 [determined] 坚定

语气与声音特效

[in a hurry tone] 急促 [shouting] 大声喊 [screaming] 尖叫 [whispering] 低声 [soft tone] 柔和 [emphasis] 强调 [laughing] 大笑 [chuckling] 轻笑 [sobbing] 抽泣 [sighing] 叹气 [gasping] 倒吸气 [clear throat] 清嗓

环境音与停顿

[audience laughing] 观众笑声 [background laughter] 背景笑声 [crowd laughing] 人群笑声 [break] 短停顿 [long-break] 长停顿

最佳实践

先写好内容,再加标签

标签是为了服务表达,不是越多越好。先确认人物状态,再加少量控制。

情绪要有过渡

长段文本可以从 [calm][sad] 再到 [hopeful],比突然大幅切换更自然。

强调词紧贴标签

[emphasis] 要放在想强调的词语正前方,例如“这是 [emphasis] 最重要的一点”。

重要结果及时下载

本站不承诺保存生成文件。音频、图片、视频结果都建议及时下载到本地。

04

Fish Audio 元提示词

把下面这段给到 AI,再提供原文本和场景想法,就能让 AI 输出符合 Fish Audio S2 标签语法的目标文本。

你现在是一位专业的 **Fish Audio S2 TTS(文本转语音)情绪剧本优化师**。你的任务是根据我提供的【原文本】和【场景/想法】,把文本改写成适合 Fish Audio S2 模型朗读的格式化文本,并加入恰当的方括号控制标签。

### 输出目标
1. 保留原文的核心意思、人物关系、叙事顺序和关键信息。
2. 只增强语音表现力,不把文本改成与原意不同的新剧情。
3. 直接输出最终可复制文本,不解释、不分析、不列步骤、不使用代码块。

### 标签语言规则
1. Fish Audio S2 使用方括号 `[tag]` 包裹情绪、语气、音效、停顿和强调标记。
2. 标签可以使用英文标准标签,也可以使用中文自然语言标签。
3. 如果我明确要求“中文标签”,你必须使用中文标签。
4. 如果我明确要求“英文标签”,你必须使用英文标准标签。
5. 如果我没有指定标签语言:中文原文优先使用中文标签,英文原文优先使用英文标签,中英混合文本按主要语言选择标签。
6. 同一段文本里尽量保持同一种标签语言,不要无意义混用中英文标签。
7. 英文标签必须从下方“英文标准标签库”中选择。
8. 中文标签优先从下方“中文标签参考库”中选择;如果需要更细腻的中文自然语言标签,可以自定义,但必须短、单一、明确,并且仍然使用方括号。

### 位置规则
1. 句子级情绪通常放在句子最开头。
   - 英文示例:`[happy] 今天天气真好!`
   - 中文示例:`[开心] 今天天气真好!`
2. 语气和音效可以放在句首、句中或词语前后,但不要破坏文本可读性。
3. 英文重音标记 `[emphasis]` 必须紧挨着放在要强调的词语或短语正前方。
4. 中文重音标记 `[强调]` 必须紧挨着放在要强调的词语或短语正前方。
5. 停顿标签放在需要停顿的位置,适合转折、迟疑、回忆、悬念、情绪变化和段落切换。

### 组合与限制
1. 每句话只使用一个主要情绪标签。
2. 每句话最多组合 3 个标签。
3. 避免混合冲突情绪,不要让同一句同时开心又难过、平静又歇斯底里。
4. 长文本要规划情绪起伏,让情绪随内容自然变化,不要整段都使用同一个标签。
5. 标签要服务朗读,不要每一句都机械加标签。
6. 原文本已经有标签时,保留合理标签,修正不合适标签,补充缺失标签。
7. 不要把标签写成圆括号、花括号、尖括号。
8. 不要输出标签库说明,不要输出修改理由。

### 音效配合规则
1. 使用人类声音特效标签后,必须加上适当的文本辅助发音。
   - 英文示例:`[laughing] 哈哈哈`
   - 中文示例:`[大笑] 哈哈哈`
   - 英文示例:`[sighing] 哎`
   - 中文示例:`[叹气] 哎`
2. 如果原文没有适合发音的拟声词,可以少量补充拟声词,但不能改变剧情含义。
3. 音效标签不要连续堆叠,除非场景明确需要强烈表演。

### 停顿控制规则
1. 英文短停顿使用 `[break]`,中文短停顿使用 `[短停顿]`。
2. 英文长停顿使用 `[long-break]`,中文长停顿使用 `[长停顿]`。
3. 短停顿适合轻微转折、换气、迟疑和句中节奏。
4. 长停顿适合重要信息前后、悬念、情绪沉默、段落切换和戏剧性转折。
5. 不要在每一句后面都加停顿标签。

### 强度修饰规则
1. 英文标签可以使用强度修饰词,例如 `[slightly sad]`、`[very excited]`、`[deeply nostalgic]`。
2. 中文标签可以使用强度修饰词,例如 `[有点难过]`、`[非常兴奋]`、`[深深怀旧]`。
3. 强度修饰必须符合语境,不要为了夸张而夸张。

### 英文标准标签库

**基础情绪 Basic Emotions - 24 种:**
`[happy]`, `[sad]`, `[angry]`, `[excited]`, `[calm]`, `[nervous]`, `[confident]`, `[surprised]`, `[satisfied]`, `[delighted]`, `[scared]`, `[worried]`, `[upset]`, `[frustrated]`, `[depressed]`, `[empathetic]`, `[embarrassed]`, `[disgusted]`, `[moved]`, `[proud]`, `[relaxed]`, `[grateful]`, `[curious]`, `[sarcastic]`

**进阶情绪 Advanced Emotions - 25 种:**
`[disdainful]`, `[unhappy]`, `[anxious]`, `[hysterical]`, `[indifferent]`, `[uncertain]`, `[doubtful]`, `[confused]`, `[disappointed]`, `[regretful]`, `[guilty]`, `[ashamed]`, `[jealous]`, `[envious]`, `[hopeful]`, `[optimistic]`, `[pessimistic]`, `[nostalgic]`, `[lonely]`, `[bored]`, `[contemptuous]`, `[sympathetic]`, `[compassionate]`, `[determined]`, `[resigned]`

**声音与语气控制 Tone Markers - 6 种:**
`[in a hurry tone]`, `[shouting]`, `[screaming]`, `[whispering]`, `[soft tone]`, `[emphasis]`

**人类音效 Audio Effects - 11 种:**
`[laughing]`, `[chuckling]`, `[sobbing]`, `[crying loudly]`, `[sighing]`, `[groaning]`, `[panting]`, `[gasping]`, `[yawning]`, `[snoring]`, `[clear throat]`

**特殊效果 Special Effects - 5 种:**
`[audience laughing]`, `[background laughter]`, `[crowd laughing]`, `[break]`, `[long-break]`

### 中文标签参考库

**基础情绪 - 24 种:**
`[开心]`, `[悲伤]`, `[愤怒]`, `[兴奋]`, `[平静]`, `[紧张]`, `[自信]`, `[惊讶]`, `[满意]`, `[欣喜]`, `[害怕]`, `[担忧]`, `[沮丧]`, `[挫败]`, `[低落]`, `[共情]`, `[尴尬]`, `[厌恶]`, `[感动]`, `[骄傲]`, `[放松]`, `[感激]`, `[好奇]`, `[讽刺]`

**进阶情绪 - 25 种:**
`[轻蔑]`, `[不开心]`, `[焦虑]`, `[歇斯底里]`, `[冷淡]`, `[不确定]`, `[怀疑]`, `[困惑]`, `[失望]`, `[后悔]`, `[内疚]`, `[羞愧]`, `[嫉妒]`, `[羡慕]`, `[充满希望]`, `[乐观]`, `[悲观]`, `[怀旧]`, `[孤独]`, `[无聊]`, `[鄙夷]`, `[同情]`, `[怜悯]`, `[坚定]`, `[认命]`

**声音与语气控制 - 6 种:**
`[急促语气]`, `[大声喊]`, `[尖叫]`, `[低声说]`, `[柔和语气]`, `[强调]`

**人类音效 - 11 种:**
`[大笑]`, `[轻笑]`, `[抽泣]`, `[大哭]`, `[叹气]`, `[呻吟]`, `[喘气]`, `[倒吸气]`, `[打哈欠]`, `[打鼾]`, `[清嗓]`

**特殊效果 - 5 种:**
`[观众笑声]`, `[背景笑声]`, `[人群笑声]`, `[短停顿]`, `[长停顿]`

### 处理流程
当我提供【原文本】和【场景/想法】时,请你:
1. 判断文本语言、角色状态、叙事节奏和目标情绪。
2. 选择中文标签或英文标签。
3. 为长文本规划情绪起伏,让开头、转折、高潮、收束各有不同表现。
4. 给关键句添加情绪标签,给关键词添加强调标签,给自然断点添加停顿标签。
5. 检查每句话标签数量,删除多余标签,避免情绪冲突。
6. 直接输出最终格式化文本。

明白请回复:“准备就绪!请发送您的原文本和想法,我将为您生成 Fish Audio 情绪剧本。”
05

Mossland 音色 ID

创作台里的 MossTTS1.5 必须指定音色才能生成,没有「不带参考音频的纯文生音频」。 音色有两个来源:用 Mossland 音色库里的公开音色 ID,或者上传一段参考音频现场克隆。 本站会识别输入框首行的括号 ID,括号和 ID 本身不会进入要朗读的正文。

Mossland 的音色 ID 是 UUID 形如 1f4af4c7-eb64-49c3-bc72-de9c6ff585bc,和 Fish Audio 那种 32 位无横线的 ID 不一样,两边不能混用。
纯 ID (1f4af4c7-eb64-49c3-bc72-de9c6ff585bc)
带名字 (温柔知性女|1f4af4c7-eb64-49c3-bc72-de9c6ff585bc)

名字只是给自己看的备注,生成时只取其中的 UUID。括号里不是 UUID 的内容会被当成正文保留, 所以 (开心地)你好 这种写法不会被误当成音色 ID。

单人声音克隆

第一行开头写 (音色ID)(名字|音色ID),英文括号也可以。不写 ID 就必须上传一段参考音频,两者至少要有一个。

多人配音

开头写 ((1)音色ID),数字对应正文里的 [spk1][spk2]。没有指定 ID 的角色会按顺序使用上传的参考音频。

写法示例

(温柔知性女|1f4af4c7-eb64-49c3-bc72-de9c6ff585bc)
今天状态不错,我们开始吧。
((1)角色A|1f4af4c7-eb64-49c3-bc72-de9c6ff585bc)((2)角色B|baf7a98a-c466-4d32-bfce-4e8b8954bba8)
[spk1]今天进度如何?
[spk2]已经完成接口联调。

多人配音怎么用

Mossland 用的是官方的多说话人接口,一次请求生成整段对话,角色之间的衔接比逐句拼接自然。

第一步:切到「多人配音」

在创作台切到音频模式,把子模式选成「多人配音」。切换子模式会清空已上传的素材,所以先切模式再传音频。

第二步:用 [spk1] 标记台词

正文每句前面写 [spk1][spk2] 表示这句是谁说的。同一个角色可以出现任意多次,顺序随意。

第三步:给角色分配音色

两种方式,可以混用:首行写 ((1)音色ID)((2)音色ID) 点名;或者直接上传参考音频,按 spk 序号从小到大依次配对

没打标签的句子

会用「唯一被指定的那个音色」;如果指定了多个,则用序号最小的那个角色的音色。

举例:正文里有 [spk1][spk2][spk3],首行只写了 ((2)某音色ID), 那么 spk2 用这个 ID,spk1 和 spk3 会按顺序吃掉你上传的第 1、第 2 段参考音频。多人配音最多可上传 10 段参考音频。

上传参考音频会在你的 Mossland 账号里留下音色 Mossland 目前没有提供删除音色的接口,每次上传克隆都会新建一个音色并保留下来。 如果不想攒下大量临时音色,优先用下面搜到的现成音色 ID。多人配音尤其明显—— 一次用了几个未点名的角色,就会新建几个音色。

音色 ID 搜索

搜索 Mossland 公开音色库,按使用次数排序。关键词留空会直接列出最常用的音色。

打开 Mossland 音色库

最多显示前 20 个结果;复制时会自动带上最多 6 个字的音色名。样音只在点击试听时加载。

06

Qwen-Audio-TTS 入门使用

百炼渠道目前接入了 Qwen-Audio TTS FlashQwen-Audio TTS Plus 两个语音模型。 Flash 更快更便宜,Plus 音质更好。 这个渠道推荐的用法是上传自己的参考音频做声音复刻,拿到专属音色再合成; 百炼自带的 600 多个现成音色只是省事的备选。

推荐:用参考音频复刻自己的音色

在音频模式下上传一段参考音频,直接写要合成的文本点生成即可。本站会先把音频复刻成专属音色, 再用这个音色合成,整个过程不用你手动填任何音色参数。

参考音频要求

10~20 秒、单人说话、没有背景音乐和杂音,内容不含敏感词,否则复刻会直接失败。音频里的情绪和语气会被学走,挑一段贴近你想要效果的。

前提条件

需要同时配置 RunningHub 的 API Key。百炼的复刻接口只接受公网可访问的音频地址、不接受直接上传文件,本站用 RunningHub 的直传把音频挂到公网再交给百炼。

复刻出的音色用完即删,不占你的配额 本站为你复刻的音色只在这一次生成期间存在,生成结束后会自动删除。 百炼每个账号最多 1000 个自定义音色,满了之后创建会直接失败、系统也不会自动淘汰旧的, 所以临时音色不能留着堆。Qwen-Audio-TTS 创建音色本身不收费。

备选:直接用现成音色

不想录音频时,可以直接用百炼自带的音色:什么都不填就用该模型的默认音色(Flash 是龙安欢,Plus 是龙安灵心); 想换别的就在第一行(音色参数),英文括号也可以。 全部 6 个系统音色和 597 个基础音色在「音色分类」页,可以试听、点一下就复制。

(qwen-audio-3.0-tts-flash-longcanzhuyue)
今天天气真不错,我们出去走走吧。
两个模型的音色互不通用 同一个音色在 Flash 和 Plus 下是两个不同的参数(前缀不同)。把 Flash 的音色填给 Plus 会报 InvalidParameter。音色分类页的卡片会同时给出两个模型的复制按钮,按当前选的模型复制即可。 复刻出的音色同样绑定模型,换模型要重新复刻一次。

多人配音

用法和 Fish Audio、Mossland 一致:[spk1] 标台词、首行点名音色或上传参考音频。

第一步:切到「多人配音」

在创作台切到音频模式,把子模式选成「多人配音」。切换子模式会清空已上传的素材,所以先切模式再传音频。

第二步:用 [spk1] 标记台词

正文每句前面写 [spk1][spk2] 表示这句是谁说的。同一个角色可以出现任意多次,顺序随意。

第三步:给角色分配音色

两种方式,可以混用:首行写 ((1)音色参数)((2)音色参数) 点名;或者直接上传参考音频,按 spk 序号从小到大依次配对复刻。最多 10 段。

没打标签的句子

依次退回:唯一被点名的音色 → 序号最小的角色的音色 → 该模型的默认系统音色。所以不打标签的旁白句也不会报错。

((1)qwen-audio-3.0-tts-flash-longcanzhuyue)((2)qwen-audio-3.0-tts-flash-longyingwumao)
[spk1]今天进度如何?
[spk2]已经完成接口联调。
[spk1][excited]那太好了,我们提前一天收工!

情感标签可以和 [spk] 一起用,写在说话人标签后面即可,只作用于该角色这一句。

百炼的多人配音是逐句合成再拼接的 百炼没有官方的多说话人接口,所以本站按 [spk] 把台词拆开、逐句合成、再在浏览器里拼成一整条音频, 句子之间留 0.18 秒间隔。句子越多越慢,做长对话时耐心等一下。 如果想要角色衔接更自然的整段生成,可以改用 Mossland 渠道,那边有官方的多说话人接口。

情感与富语言标签

这两个模型支持在文本里直接嵌标签。控制类标签作用于其后的所有文本,直到遇到下一个控制类标签; 富语言类标签只在当前位置插入一段拟声效果,不影响前后语气。

[excited]今天的天气真不错![laughing]我们一起出去玩吧!
[serious]不过出门前请注意安全。

控制类标签

悲伤[sad]
惊叹[amazed]
愤怒[angry]
兴奋[excited]
讽刺[sarcastic]
好奇[curious]
无聊[bored]
疲惫[tired]
轻蔑[scornful]
大喊[shouting]
深沉大声呐喊[deep and loud shouting]
颤抖[trembling]
恐慌[panicked]
调皮[mischievously]
共情[empathetic]
耳语[whispers]
ASMR 轻柔耳语[asmr]
不情愿[reluctantly]
哭泣[crying]
严肃[serious]
德古拉风格[like dracula]
非常缓慢[very slowly]
非常快速[very fast]

富语言类标签

倒吸一口气[gasp]
叹息[sighing]
清嗓[clears throat]
咯咯笑[giggles]
大笑[laughing]
咳嗽[cough]
哼声、嗤笑[snorts]
生成结果 24 小时内有效 百炼返回的音频地址有效期为 24 小时,本站不托管结果,请及时下载到本地。
07

Qwen-Audio-TTS 音色分类

这一页是不想录参考音频时的备选——百炼自带 6 个系统音色和 597 个基础音色,可以直接拿来用。 想要更贴合自己需求的声音,还是建议按上一页的做法上传参考音频做声音复刻。 下面按音色特质分好类,试听满意后按当前使用的模型复制对应参数,粘到创作台文本框第一行的括号里即可。

系统音色

龙安欢Flash · 女 · 25 岁

Flash 默认音色,精品中文,适合社交陪伴。

longanhuan_v3.6
龙杰力豆Flash · 男 · 5 岁

天真男童,适合儿童陪伴与智能玩具。

longjielidou_v3.6
loongevaFlash · 女 · 28 岁

高智美音,精品英文,仅支持英文。

loongeva_v3.6
loongJohnFlash · 男 · 28 岁

沉稳亲切美音,精品英文,仅支持英文。

loongjohn
龙安灵心Plus · 女 · 25 岁

Plus 默认音色,知心温暖音,旗舰音色。

longanlingxin
龙安鲁风Plus · 男 · 25 岁

明亮开朗音,旗舰音色。

longanlufeng

基础音色(597 个)

这些音色由声音复刻预先生成,调用方式和系统音色一样。分类是按官方标注的「特质」归纳的, 童声和长者按年龄单独分出来。

正在加载音色数据…