专注批量处理软件

Auk-TTS一键启动运行工具

Auk-TTS一键启动,内置Python、CUDA、cuDNN等所需环境,支持N卡GPU,6G低显存、老显卡可用。本地大模型提供文本转语音、声音克隆、音色设计和音频编辑增强,支持超长TXT批量配音、音色库、参考裁剪降噪、任务恢复与API接口。

版本 1.0.0 更新于
6G显存声音克隆 AukTTS一键启动 文字描述音色设计

获取软件

软件版本 · 1.0.0

下载地址(上传中)

适用于 Windows 10 / Windows 11(64位)|NVIDIA GPU|6G显存、老显卡可用

首次使用?查看运行指南

软件详情

Auk-TTS · 本地语音创作工作台

长文配音,轻松开口;
克隆、设计、编辑一步上手

一整篇文稿需要配音,却还在反复录制、拆段、拼接?想为不同内容设计声音,或改善已有录音,又要在多个软件之间来回切换?尝试本地大模型时,复杂环境和显卡配置也常让人无从下手。

Auk-TTS一键启动运行工具内置Python、CUDA、cuDNN等所需环境,支持N卡GPU,6G低显存、老显卡可用。把文本转语音、声音克隆、音色设计和音频编辑增强放进同一工作台,支持超长文稿和文件夹批量任务;准备好内容,点击开始,让本地模型自动处理。

一键启动 · 环境已内置N卡GPU · 6G显存可用声音克隆 · 音色设计超长文本 · 批量配音音频编辑增强 · APIWindows 10 / 11

01 · 功能介绍和特点

让文稿、声音和录音,在一个窗口完成

从第一段试听到一整批成品,少做重复选择和复制,把时间留给内容和表达。

一键启动,所需环境已经内置

整合包内置Python、CUDA、cuDNN等所需运行环境,无需逐项安装和搭配。打开工具、准备文案与声音设置,点击开始后自动运行,让第一次制作配音也有清晰的入口。

N卡GPU加速,6G低显存可用

支持NVIDIA GPU,6G显存与老N卡也可按配置使用。提供节省显存选项,可缩短每段文字,并让识别、降噪使用CPU,方便给主要配音任务留出显卡资源。

本地大模型,文稿与结果在本机管理

使用本地模型完成合成、音色设计和音频编辑,WAV结果保存到指定目录。长篇文稿、参考音色与成品可按项目整理;空闲时释放模型资源,再继续其他工作。

文本转语音,文案直接变成配音

粘贴一段文案或加入TXT文件,选择克隆音色或设计声音,即可生成语音。短视频旁白、课程讲解、故事朗读都能先试听小样,再决定整篇或整批处理。

声音克隆,让参考音色朗读新内容

选择一段清晰的单人录音,再输入新的配音文字,生成接近参考音色的朗读。建议使用3—15秒录音;常用声音可以存入音色库,下次继续使用,减少重复准备。

音色设计,用文字描述理想声音

不需要准备参考录音,在声音描述中填写年龄感、音色、语气与用途,例如“温柔自然的年轻女声,适合睡前故事”。文案与声音描述分别填写,便于反复试听和调整。

音频编辑,用一句话提出修改要求

选好待编辑音频,填写明确指令,例如“保持内容不变,改成沉稳、清晰的男声”,再生成新的WAV。可尝试调整音色、语气和表达,适合修订已有讲解或比较不同呈现。

音频增强,改善嘈杂或不清晰的录音

可在音频编辑中描述减少噪声、减轻混响、提高语音清晰度等目标,也可直接给参考录音降噪。结果另存,方便和原音频对比;先用短片段检查,更容易找到合适的处理要求。

超长文本自动处理,不用手动拆文稿

长文章、小说章节和课程文稿可直接加入桌面任务,软件自动分段生成并保存为对应的完整WAV。每段字数与段间停顿可调,省去手动复制片段、逐段导出和拼接的操作。

多个文件与文件夹,批量自动完成

克隆、音色设计可批量读取TXT;音频编辑可批量处理音频,并使用统一修改指令。支持多选、拖入、扫描子目录和保持目录结构,方便成套课程、系列文案与录音一起整理。

音色库保存常用声音,后续直接选

为参考音频命名并保存,可连同识别文字一起管理,下次配音直接载入。按“日常旁白”“故事讲述”等用途组织声音,减少翻找文件和重新设置的时间。

裁剪、降噪与识别,参考录音先整理

可按起止秒数裁剪参考片段,减少底噪,并识别录音文字后修正和保存。处理后的音频另存,不覆盖原文件,方便挑选清楚、稳定的片段用于声音克隆。

中文与英语,语速按内容调整

配音语言可选中文或英语,合成语速支持0.5—2倍。故事可舒缓一些,知识讲解可略快一些;克隆时还可附加风格描述,为同一参考声音提出不同表达要求。

停顿、淡入淡出与首尾余量可调

长文本可调段间停顿,设置淡入、淡出与首尾静音处理,让片段衔接更适合收听。保留适当的首尾余量可保护开头和结尾发音,减少成品再次整理的工作。

停止后恢复批次,继续已保存进度

已经完成的文件与已保存片段会保留,可在日志窗口恢复批次或重试失败项。恢复沿用原批次设置,适合把较长任务分时完成;输入文稿或参考音频变化后请新建批次。

试听与清单核对,结果更容易交付

可试听参考音频和生成结果,拖动播放进度,并调整试听速度与音量。结果重名自动编号,避免覆盖;CSV清单记录状态、结果路径与失败原因,便于核对整批配音。

API接口,接入已有配音流程

提供统一的语音任务调用入口,可通过API使用文本转语音、声音克隆、音色设计、音频编辑及识别降噪等功能。提供仅本机或局域网范围与独立接口密钥,方便自己的程序按顺序取回结果。

Auk-TTS一键启动运行工具界面:音色克隆、音色设计、音频编辑、超长文本批量配音、参考裁剪降噪和API设置
三种语音模式清晰切换,文案、参考音频、语言、语速与保存位置集中设置。

02 · 应用场景

从短视频旁白,到整本长文朗读

按内容选择声音,按目录组织素材,让系列创作和批量整理更容易继续。

自媒体创作者 · 系列视频旁白

将多篇脚本保存为TXT,使用同一参考音色批量生成旁白,按内容调节语速,试听确认后再放入剪辑工程。

有声内容制作 · 长篇章节朗读

按卷、章组织文本目录,批量读取超长文稿并保持输出层级。任务暂停后可恢复已保存进度,便于连续整理多章节内容。

课程制作人员 · 中英文讲解配音

为中文与英文文案分别选择语言和声音,按课程节奏设置停顿与语速,集中生成一组讲解录音,减少重复录制和导出。

故事与角色创作者 · 探索不同声音

通过年龄感、音色与语气描述设计声音,先对同一段文本试听,再调整表达。也可把常用参考音色保存起来,便于后续使用。

录音整理者 · 处理已有语音

对自己的讲解、访谈片段或录音素材提出清晰的编辑增强要求,另存结果并对照试听,尝试改善噪声、混响或表达方式。

开发者 · 本地语音服务接入

让已有工具提交文案或音频任务,取回WAV结果。桌面和接口共享计算资源,按顺序调用,适合连接个人配音与内容处理流程。

03 · 使用说明

六步完成第一次配音,再开始整批处理

初次建议用一小段清晰文案和默认参数,确认发音、音色及衔接后再处理超长内容。

1

打开工具,先确认N卡与文件完整

下载后按包内说明启动Auk-TTS一键启动运行工具,登录一可软件账号。所需环境已内置,保留完整目录;合成、音色设计与编辑使用NVIDIA GPU,单显卡编号通常保持0。

2

选择音色克隆、音色设计或音频编辑

克隆:填写新文案并选择参考录音。设计:填写文案与声音描述。编辑:选择已有音频,在输入区填写修改指令。先根据任务选模式,再准备对应内容。

3

整理参考声音或填写具体描述

克隆建议选3—15秒清晰单人录音,可先裁剪、降噪和试听。设计模式可填写“温柔自然的年轻女声,适合睡前故事”。编辑指令一次先集中在一个明确目标上。

4

选语言、语速与保存目录

克隆和设计选择中文或英语,语速先用1.0,目标秒数保持0自动估算。第一次可保留每段90字、停顿180毫秒;6G显存或老显卡可缩短片段,按需开启节省显存。

5

先生成短样本,再安排长文与批量

选择保存目录并点击“开始生成”。满意后切换“批量文件”,克隆或设计加入TXT,编辑加入音频;处理子目录时勾选遍历,再按需保持目录结构。

6

试听核对,必要时恢复或重试

完成后点击“试听结果”或打开目录,核对内容、语气和衔接。在“查看日志”中可导出CSV清单、恢复批次或重试失败。停止后继续时,请保留原文稿、参考音频与任务文件。

四个任务示例,照着设置就能开始

声音克隆:个人旁白

音色克隆 → 选择8秒清晰个人录音 → 输入新文案 → 中文、语速1.0、目标秒数0 → 选择目录 → 开始生成 → 试听结果。

音色设计:睡前故事

音色设计 → 填入故事文案 → 描述“温柔自然的年轻女声,语速舒缓,适合睡前故事” → 开始生成 → 试听后微调描述。

编辑增强:整理讲解录音

音频编辑 → 选择一段录音 → 指令写“减少背景噪声,保留原说话内容” → 目标秒数先用0 → 开始处理 → 与原录音对比试听。

长文批量:整套章节配音

将章节保存为TXT → 批量文件 → 选择目录 → 遍历子目录并保持结构 → 使用同一音色 → 自动处理 → 查看日志并导出清单。

04 · 常见问题解答

声音克隆、6G显存与超长配音,常见疑问一次看清

点击问题展开答案;也可用键盘选择问题后按回车操作。

Auk-TTS一键启动运行工具有哪些主要功能?

主要提供文本转语音、声音克隆、文字描述音色设计和指令式音频编辑增强,支持超长TXT批量配音、参考裁剪降噪、音色库、中英语言与语速设置、任务恢复、WAV输出和API接口。

需要自己安装Python、CUDA和cuDNN吗?

整合包已内置Python、CUDA、cuDNN等所需运行环境,按包内说明启动即可,无需自行逐项搭建。请保留完整目录与配套文件;电脑仍需具备可用且符合运行要求的NVIDIA显卡驱动。

6G显存和老显卡可以运行吗?

本工具面向6G低显存与老N卡提供使用选择。建议先用短文案试做,缩短每段字数、按需开启节省显存,并让识别和降噪使用CPU。实际可处理长度和速度受显卡、驱动、系统内存与任务设置影响。

没有N卡,能用CPU完成语音合成吗?

当前程序的语音合成、音色设计和音频编辑需要NVIDIA GPU,不能切换为CPU合成。CPU可用于参考音频识别与降噪;硬件设置中的CPU线程数也不会把合成改成CPU模式。

声音克隆需要多长的参考录音?

建议使用3—15秒清晰、稳定的单人录音,尽量避开明显噪声、背景配乐和多人重叠说话。可以先在工具中裁剪、降噪和试听,再输入需要朗读的新文案。克隆效果会受参考录音质量影响。

声音克隆必须填写参考音频的逐字稿吗?

无需强制填写。需要留档或核对时,可点击识别文字,再到音色库查看、修改和保存参考文字。录音内容与新文案分别使用,不必把参考录音说过的话当成新配音内容。

音色设计需要上传参考录音吗?

不需要。选择音色设计,在配音文字区填写需要朗读的内容,在声音描述中写音色、年龄感、语气和用途。先试听一小段,再根据结果调整描述,更容易找到合适的声音方向。

能让克隆的声音更欢快或更沉稳吗?

可以在高级设置中开启“克隆时附加描述”,再填写更加欢快、沉稳清晰等风格要求。它是对表达方式的引导,建议通过短句试听确认效果,再应用到完整文稿。

音频编辑增强怎样操作?

选择音频编辑,导入待处理音频,在输入区填写明确要求,例如“保持内容不变,让声音更沉稳清晰”或“减少背景噪声,保留说话内容”。开始处理后结果另存为新的WAV,建议与原音频对照试听。

编辑指令能调整哪些方面,效果一定准确吗?

可围绕内容、音色、语气、语速、响度或语音清晰度提出要求。具体效果取决于输入音频和模型对指令的理解,不能保证每次都精确保留所有细节;建议一次只修改一个主要目标并核对结果。

超长文本需要手动切成很多小文件吗?

桌面端无需手动逐段拆分,直接输入长文或选择TXT,工具会自动分段生成,并将每份文稿保存为对应的完整WAV。可以调节每段字数和段间停顿;特别长的任务仍需预留足够时间和磁盘空间。

支持批量TXT和整个文件夹配音吗?

支持。切换批量文件,选择多个TXT、拖入路径或选择目录;需要读取下级目录时勾选遍历子目录,再按需保持目录结构。统一设置音色、语言与输出位置后依次处理,每份TXT生成对应音频。

能直接导入Word、PDF或SRT来配音吗?

当前克隆与音色设计的批量输入为TXT,也可以直接粘贴文字。Word、PDF或SRT请先整理为需要朗读的纯文本,再保存为TXT或粘贴到输入区;本工具没有按字幕时间轴配音的专用入口。

音频编辑也能批量处理吗?

可以。选择音频编辑和批量文件,加入多个音频或文件夹,在输入区填写统一的编辑指令。该批次所有音频使用同一要求,输出各自的新WAV;不同修改目标建议分别建立批次。

超长文本支持是否也等于支持超长音频编辑?

两者不同。长文本有自动分段配音功能;音频编辑按每个输入音频处理,没有同样的长音频自动分段编辑流程。建议先用短片段确认效果,较长录音按任务需要预先整理。

参考音频和编辑音频支持哪些格式?

支持WAV、MP3、FLAC、OGG、M4A、WEBM、AAC和WMA等格式,每个输入音频文件不超过64 MiB。能否读取还取决于实际编码和文件完整性,失败时可在日志中查看原因。

语速、语言和目标秒数怎样设置?

克隆与设计可选中文或英语,语速为0.5—2倍,第一次建议1.0。目标秒数设0自动估算,其他值按每段文本计算;编辑模式按每个音频计算,且不使用朗读语言和语速选项。

目标秒数能把整篇长文固定为指定时长吗?

不能直接把整篇长文锁定为该时长。它针对每个生成片段,音频编辑时针对每个输入音频;设置过短可能导致内容不完整。首次保持0,先确认内容和语速,再按需要调整。

段间停顿和首尾处理有什么用?

段间停顿用于控制长文片段之间的空隙;淡入淡出和首尾静音设置用于调整衔接。首部、尾部保留适当余量可保护首字与尾音,参数过大或裁剪过强可能削弱发音,建议先试听。

怎样保存常用音色,下次继续使用?

选择参考录音后打开音色库,填写名称,可一并保存参考文字。下次直接从已保存音色中选择即可。删除音色条目会移除库中的副本,输入的原始参考文件不受影响。

暂停或强制停止后,长文任务能继续吗?

第一次点击停止会等待当前片段结束;再次点击强制停止会结束后台。已完成文件与已保存片段会保留,可在查看日志中恢复批次或重试失败。恢复沿用原设置,请保留任务及中间文件;修改原文或参考音频后应新建批次。

生成结果保存为什么格式,会覆盖旧文件吗?

结果保存为WAV,重名自动增加编号,不覆盖已存在文件。每份文本对应一份完整音频,超过普通WAV容量时使用RF64 WAV;当前没有直接选择MP3输出的选项,需要时可后续转换。

API支持哪些调用,长文有长度限制吗?

API支持文本转语音、声音克隆、音色设计、音频编辑,以及音色管理、识别与降噪等调用。单次JSON合成文本最多10000字,上传最多64 MiB;更长文本建议使用桌面批量处理。具体参数可在工具的开放接口说明中查看。

API能并发处理任务或边生成边播放吗?

当前桌面与API共享计算资源,一次处理一个任务,忙碌时新请求会提示忙碌。语音接口完成后返回音频;当前程序没有供用户使用的实时麦克风变声或流式边生成边播放入口。

本地运行是否可以完全断网使用?

模型计算和音频结果在本机完成与保存,但账号登录、任务及接口权限验证需要联网。API可选择仅本机或局域网访问,调用使用独立接口密钥;关闭程序后接口停止。

为什么进度完成后仍有失败文件,TXT乱码怎么办?

总进度统计已处理文件,其中包含失败项,请用日志或CSV清单核对状态。TXT默认自动识别编码,乱码时可手动选择UTF-8、GB18030、UTF-16或UTF-32;修正设置或素材后重新建立任务。

支持哪些Windows系统,软件当前收费吗?

支持Windows 10/11(64位),语音合成、音色设计和音频编辑使用NVIDIA GPU。当前网站关联的软件记录为免费使用,启动及执行任务需登录一可软件账号。

05 · 下载地址

下载Auk-TTS一键启动运行工具

支持Windows 10/11(64位) · NVIDIA GPU · 6G低显存、老显卡可用 · 版本1.0.0

所需环境已内置。从一段文案开始,完成声音克隆、音色设计或录音编辑,再把整批长文本交给本地模型自动配音。

↓ 阿里云盘下载

当前免费使用,需一可软件账号登录。主下载入口:阿里云盘;备用下载地址暂未提供。下载后按包内说明启动,并保留配套文件。

继续处理素材:音视频转文字与字幕 · 更多音视频处理工具