专注批量处理软件

Qwen3-ASR一键启动运行工具

Qwen3-ASR一键启动,内置Python、CUDA、cuDNN等所需环境;支持N卡GPU与CPU,4G低显存、老显卡可用。可选1.7B或0.6B本地模型,批量处理超长音视频,生成文字稿与字幕,支持人声分离、热词、断点恢复和API服务。

版本 1.0.0 更新于
4G显存语音转文字 Qwen3ASR一键启动 双模型本地识别

获取软件

软件版本 · 1.0.0

下载地址

适用于 Windows 10 / Windows 11(64位)|NVIDIA GPU / CPU|4G显存、老显卡可用

首次使用?查看运行指南

软件详情

QWEN3-ASR · 0.6B / 1.7B 本地语音转写

长录音、一整批视频,
一键变成文字稿与字幕

一场长会议反复听写,课程视频逐个配字幕,忙了很久还没整理完?想让本地大模型帮忙,却被环境安装、显卡配置和复杂命令挡住;电脑只有4G显存,或还在用老显卡,又担心无法开始。

Qwen3-ASR一键启动运行工具已内置Python、CUDA、cuDNN等所需环境,打开界面即可安排转写。支持N卡GPU与CPU,4G低显存、老显卡可用,提供1.7B与0.6B两种本地模型;从单份录音到整批超长音视频,选好素材后点击开始,文字稿与字幕自动生成。

一键启动 · 环境已内置N卡GPU + CPU · 4G显存可用0.6B / 1.7B · 本地双模型超长音视频 · 批量自动转写Windows 10 / 11

01 · 功能介绍和特点

从录音听写,到成批字幕制作

不必逐个配置环境、逐份复制结果;把常用转写、输出和批次管理放在一个窗口。

一键启动,所需环境已内置

整合包内置Python、CUDA、cuDNN等所需运行环境,无需自己逐项安装和配置。打开工具,选择素材和输出位置,点击“开始转写”后自动运行,把时间留给内容整理。

N卡GPU与CPU,两种运行选择

有NVIDIA显卡时可使用GPU加速,没有独立显卡也能选择CPU转写。默认自动选择可用设备,同一套界面适配不同电脑;CPU处理通常更慢,适合按实际时间安排任务。

4G低显存、老显卡可用

为低显存和老N卡提供可调整的使用方式。建议优先选0.6B模型,关闭不需要的人声分离并缩短音频分段,先完成一段试转写,再安排长素材与批量任务。

1.7B与0.6B双模型,按任务选择

1.7B侧重精细识别,0.6B更轻量、省资源。界面中直接选择模型,不用更换整套工具;可根据录音清晰度、电脑配置和等待时间,挑选更合适的方案。

本地大模型运行,素材在本机处理

使用电脑中的本地模型识别音轨,文字稿和字幕保存到自己选择的目录,便于按项目管理。模型在任务开始时加载,空闲时可以释放占用,为其他软件腾出资源。

超长音视频转文字字幕,无需手动剪短

长会议、完整课程、访谈和直播回放可直接加入任务,软件自动连续处理并输出对应结果。无需先把素材剪成许多短文件,处理中可查看进度,停止后也能恢复已保存的进度。

多个文件与文件夹,批量自动处理

支持多选音频、视频,也能拖入文件和文件夹。确认模型、语言和输出内容后,一键依次处理整批素材,省去反复打开、等待和另存每份文件的操作。

30种语言与22种中文方言识别

模型覆盖30种语言和22种中文方言,可识别中文、英语、粤语、日语、韩语等内容。音频语言可自动识别或手动指定,适合不同来源的录音资料;字幕输出另有语言范围。

文字稿与时间轴字幕,按用途输出

会议整理可选TXT,视频制作可选SRT,也可同时生成两者;需要网页字幕时额外输出VTT,程序处理可输出带时间信息的JSON。一次任务准备多种结果,方便后续使用。

字幕长短可调,更贴合画面阅读

可调节每条字幕字数、显示时长和暂停阈值,并按标点分句。短视频可以缩短每条文字,课程字幕可适当放宽,减少生成后逐条拆分整理的工作。

识别前分离人声,应对明显配乐

素材带背景音乐时,可开启识别前分离人声,减少配乐对转写的干扰。干净的会议或访谈录音可关闭此项,节省处理时间和电脑资源,再按实际试听效果决定是否开启。

热词与上下文,辅助识别专有名称

填写人名、品牌名、专业术语或录音背景,为识别提供提示。常用热词可保存复用,适合持续处理同一项目的课程、会议和产品资料;关键名称仍建议对照录音核对。

保留目录层级,结果更容易归档

遍历子目录时可保留原有层级,让课程、章节和项目资料一一对应。已有同名文件自动编号,不覆盖旧结果;后续查找文字稿和字幕时更清楚。

断点恢复与失败重试,长批次可继续

可停止当前任务、恢复指定批次,或重试最近批次的失败和未完成项。已保存的进度保留,避免因中断就从头整理整批素材;CSV清单可查看状态、错误原因和结果位置。

结果预览、ZIP打包与API衔接

界面可预览或复制当前素材结果,完整文件保存到指定目录,成功结果可打包为ZIP。还提供API服务,供本机或局域网内的其他程序提交转写任务、查询进度和获取结果。

两种模型,选适合自己电脑的一种

0.6B · 轻量快速

优先考虑低显存、老显卡与日常转写。4G显存可先用此模型,关闭不需要的人声分离,试转写一份短素材后再扩大批量。

1.7B · 精细识别

适合更重视识别细节、电脑资源较充足的任务。可先用典型片段与0.6B比较,再根据结果和处理时间决定整批使用哪一种。

Qwen3-ASR一键启动运行工具界面:1.7B与0.6B双模型、批量音视频输入、GPU与CPU、TXT字幕输出和人声分离
素材、模型、语言和输出集中设置,日志与结果预览随时查看,底部一键开始转写。

02 · 应用场景

把需要反复听写的内容,变成可整理的资料

为视频、课程、会议与采访准备文字和字幕,也方便后续查阅、编辑与归档。

自媒体与剪辑师 · 为视频批量生成字幕

将口播、采访和产品演示视频批量转成SRT,按竖屏阅读需要调整每条字数。导入剪辑软件后再校对文字和时间位置,为一组视频统一准备字幕素材。

教师与培训团队 · 整理超长课程资料

把完整课程、讲座和章节视频加入同一批次,生成文字稿与字幕。保留课程目录层级,方便按章节查阅、修订和交付,不用手动切成许多小文件。

企业与采访团队 · 录音转成可编辑文字

将会议录音、访谈和沟通记录转为TXT,先填入常见人名与专业词提示。转写后对照关键内容进行校对,再自行整理摘要、纪要或文章,减少反复听写。

资料整理与技术团队 · 建立批量转写流程

按项目扫描音视频文件夹,用CSV核对处理状态、用ZIP归集成功结果。需要与已有工具衔接时,可使用API提交任务,让素材转写融入日常处理流程。

03 · 使用说明

六步完成第一次转写,再交给整批任务

第一次建议使用一分钟左右的清晰素材,确认设备、语言和输出效果后再处理长文件。

1

下载整合包,打开启动工具

在Windows 10/11电脑上按包内说明完成解压或安装,保留完整配套目录,再打开Qwen3-ASR启动工具并登录。整合包已带所需运行环境;GPU运行时,请保持NVIDIA显卡驱动可用。

2

加入音频、视频或整个素材目录

在“转写任务”中点击“选文件”多选素材,或点击“选文件夹”加入整个目录,也可以拖入。选择“保存到”目录;素材位于多级文件夹时勾选“遍历子目录”,按需开启“保留目录层级”。

3

选择模型、语言和运行设备

4G低显存或老显卡建议先选“0.6B · 轻量快速”;更重视识别细节且资源充足时可试“1.7B · 精细识别”。音频语言可自动识别或指定中文等语言,运行设备保留自动选择,也可手动选择GPU或CPU。

4

确定文字稿或字幕,补充热词

只整理录音文字时选择“仅TXT”;制作字幕时选择“仅SRT”或“TXT + SRT”。在“字幕与热词”设置字幕长度,填写人名和专业词;干净录音可关闭“识别前分离人声”,明显配乐素材再按需开启。

5

点击开始转写,等待自动处理

确认素材和保存目录后点击“开始转写”。首次使用需等待模型加载,长素材和批量任务会自动推进,可在日志与进度栏查看当前状态。低显存运行时,可在“运行设置”将音频分段从60秒调整为30秒。

6

检查结果,导出或继续未完成批次

在“结果预览”阅读并复制文字,通过“打开目录”查看完整TXT、SRT等文件。需要继续中断任务时,使用“批次操作 → 恢复批次”选择原批次记录;也可重试失败、导出CSV清单或打包结果ZIP。

常用任务,照着示例设置

4G显存与老显卡起步

0.6B模型 → 自动设备与精度 → 关闭人声分离 → 音频分段30秒 → 先输出TXT试用。需要字幕时,再确认语言并选择SRT或TXT + SRT。

会议录音转文字稿

加入M4A或WAV → 语言选中文 → 输出仅TXT → 填入常见人名与术语 → 开始转写。完成后打开完整文字稿,核对结论、金额和人名。

视频生成SRT字幕

加入MP4 → 输出TXT + SRT → 每条40字、最长6秒、暂停0.35秒 → 勾选按标点分句 → 开始转写。短视频可先尝试每条24字。

整套课程批量处理

选择课程文件夹 → 遍历子目录 → 保留目录层级 → 指定保存目录 → 开始转写。结束后用CSV核对结果,再把成功文件导出ZIP交付。

04 · 常见问题解答

4G显存、双模型和长音视频,常见疑问一次看清

点击问题即可展开答案,也可用键盘选择问题后按回车展开。

Qwen3-ASR一键启动工具还需要安装Python、CUDA和cuDNN吗?

整合包已内置Python、CUDA、cuDNN等所需运行环境,无需自行逐项搭建。按包内说明安装或解压后,保留完整配套文件再启动;不要只复制启动程序。使用NVIDIA GPU时,电脑仍需有可正常工作的显卡驱动。

支持Windows 10/11吗,没有N卡能不能运行?

支持Windows 10、Windows 11的64位环境,提供NVIDIA GPU与CPU运行方式。自动选择会优先使用可用的N卡,也可手动选择CPU;CPU通常耗时更长,可先用短录音确认运行效果,再安排长任务。

4G显存和老显卡怎样设置更合适?

4G低显存、老N卡可用,建议优先选择0.6B模型,关闭不需要的人声分离,音频分段先设为30秒,计算精度保留自动。实际占用会随模型和输出选项变化;若资源仍不足,可选择仅TXT、关闭额外VTT和JSON,或切换CPU。老显卡也需满足整合包与驱动的兼容要求。

1.7B与0.6B两种模型有什么区别?

1.7B在界面中标为精细识别,适合更重视识别细节且电脑资源较充足的任务;0.6B标为轻量快速,更省资源,适合低显存电脑和日常批量转写。可以用同一段代表性录音分别试转写,再根据结果和等待时间选择。

支持超长音频和视频吗,要先剪成短文件吗?

支持将超长会议、课程、访谈或直播回放直接作为文件加入任务,软件自动连续处理,无需先手动剪短。音频分段设置控制每次处理的片段,不是整份素材的总时长限制;超长素材需要相应的磁盘空间与处理时间,不建议让电脑在任务中进入休眠。

支持哪些音频和视频格式?

支持WAV、MP3、FLAC、M4A、AAC、OGG、OPUS、WMA、AIFF、AMR、APE等音频,以及MP4、MKV、MOV、AVI、WEBM、FLV、WMV、M4V、TS、MTS、M2TS、MPG、MPEG、3GP等视频。素材需能正常读取并含有音轨;无法读取的文件可先转换为常见格式后重试。

如何批量将文件夹里的音视频转文字?

在转写任务中选择文件夹,也可以多选或拖入多个文件和目录。需要扫描下级目录时勾选遍历子目录,选择保存目录和输出类型后点击开始转写,软件会依次处理整批素材,无需逐文件重复操作。

TXT、SRT、VTT和JSON分别适合什么用途?

TXT是纯文字稿,适合会议、采访和资料整理;SRT是常用时间轴字幕,适合播放器与剪辑软件;VTT适合网页视频字幕;JSON包含识别分段和字词时间信息,便于其他程序处理。可选TXT、SRT或同时输出,并按需额外生成VTT与JSON。

支持多少种语言,能识别中文方言吗?

本地识别模型覆盖30种语言和22种中文方言,包含中文、英语、粤语、日语、韩语等。可以选择自动识别,也可指定已知语言。音质、口音、多人重叠讲话和专业词汇会影响结果,建议抽查;不要把语言与方言合计52项理解为52种独立语言。

所有识别语言都能生成时间轴字幕吗?

不是所有语言都能输出带时间信息的结果。当前SRT、VTT和带时间戳JSON支持中文、英语、粤语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语,共11种语言。其他语言请选择仅TXT,并关闭额外VTT与JSON;自动识别到不支持的字幕语言时会提示失败。

字幕太长、分句太碎,怎样调整?

进入字幕与热词页面,调整每条字数、单条时长和暂停阈值,并按需要勾选按标点分句。默认可用40字、6秒、0.35秒暂停;短视频可先尝试24字,分句太频繁时可将暂停阈值调到0.6秒。字数与时长是目标上限,单个词不会被截断。

带背景音乐的音视频可以识别吗?

可以尝试开启识别前分离人声,再进行转写,适合配乐明显的素材。干净的会议录音通常可关闭此项以节省资源。分离并不保证消除所有干扰,重叠说话、强噪声或模糊人声仍建议先改善录音并核对结果。

人名、品牌名和专业术语识别不准怎么办?

在热词与上下文中填写常见名称或录音背景,例如“热词:一可软件、工业视觉、王小明”,并保存以便复用。提示内容最多4000字,热词用于辅助识别,不是强制替换;重要的人名、金额和专业词仍需对照录音校对。

可以区分不同说话人、自动写会议纪要或翻译吗?

当前工具主要把音视频中的语音转成文字稿与字幕,没有提供自动标注不同说话人、自动总结会议纪要或翻译的独立功能。可以先导出TXT整理纪要,需要翻译时再将文字或SRT交给对应的翻译工具。

生成SRT后,会自动把字幕压进原视频吗?

不会。本工具生成独立的文字和字幕文件,不直接把字幕烧录进视频画面。可以把SRT导入剪辑软件或站内字幕处理工具,校对内容、字体与位置后,再导出带字幕的视频。

任务停止或中断后,怎么恢复之前的进度?

在批次操作中选择恢复批次,选中原任务记录,即可继续尚未完成的部分,已保存分段会保留。恢复沿用原批次模型和参数;源素材变化或希望换模型、换设置时,应开始新批次,不要混用旧任务进度。

失败文件怎样重试,进度条结束就代表全部成功吗?

任务结束后请查看日志或导出CSV清单,核对每份素材的状态和错误原因。修复磁盘空间、路径或资源问题后,可用重试失败处理最近批次的失败与未完成项。进度条只能辅助了解处理情况,交付前应以结果文件和清单为准。

输出会覆盖同名文件吗,能保留目录并打包下载吗?

已有同名结果会自动添加编号,不覆盖旧文件。开启遍历子目录后可保留目录层级;批次操作中的导出结果ZIP会打包最近批次成功生成的文件并保留层级,未完成项不会打包。导出清单CSV可用于核对交付内容。

预览文字为什么不完整,完整结果在哪里?

界面最多预览前60000字,批量任务展示当前素材的结果。完整文字稿与字幕保存在您选择的目录,请点击打开目录查看;复制预览只能得到界面中显示的部分,交付长素材时应使用完整结果文件。

本地模型运行还需要联网吗?

语音识别使用本地模型,素材和结果在本机处理;软件账号登录与权限认证需要网络。因此使用时请保持账号认证所需的网络连接,不要把本工具理解为完全无需联网的软件。

API服务能做什么,可以给局域网内其他程序调用吗?

可以在API服务页启动转写服务,默认仅本机访问,也可按需选择局域网访问方式。其他程序可提交素材、查询进度和获取结果,需要使用独立API密钥;API与桌面任务依次处理,修改默认识别参数后需重启API。普通文件转写无需启动API。

首次加载慢、电脑资源紧张时怎么办?

首次任务需要加载本地模型,可结合日志判断当前阶段。资源紧张时先选0.6B、关闭人声分离、缩短音频分段,或使用CPU;磁盘或CPU较慢时,可适当延长界面中的等待超时。空闲后可点击释放模型,下次转写会重新加载。

05 · 下载地址

下载Qwen3-ASR一键启动运行工具

支持Windows 10/11(64位) · N卡GPU与CPU · 4G低显存、老显卡可用 · 版本1.0.0

内置所需环境,1.7B与0.6B双模型可选。从一份录音开始,确认效果后,让整批超长音视频自动转成文字稿与字幕。

↓ 阿里云盘备用下载

当前免费使用,需一可软件账号登录。主下载地址待补充,当前保留阿里云盘备用入口。下载后请按包内说明启动并保留配套文件。

转写后继续处理:文本与双语字幕翻译 · 更多音视频处理工具