文档

字幕生成器 使用指南

在设备上从音频或视频生成、编辑并导出带时间轴的字幕。

无需上传媒体,即可从一个音频或视频文件创建可编辑字幕。

使用方法

添加音频或视频文件,选择口语语言,或保留 自动
设置每行最大字符数,然后选择 生成字幕
播放媒体并跳转到字幕,编辑文本以及开始和结束时间。
添加、拆分、合并、删除或整体平移字幕,直到所有时间错误都已解决。
下载 SRT、WebVTT、纯文本或 JSON。

支持格式和限制

  • 常见的 WAV、MP3、M4A、AAC、OGG、Opus、FLAC、MP4、MOV、M4V、WebM 文件。
  • 每个文件最大 200MB、60 分钟。
  • 按 10 分钟窗口处理,结果最多包含 10,000 条字幕。

首次运行会下载本地 FFmpeg、语音识别模型和语音活动检测模型。请保持标签页开启,后续运行可复用缓存资源。

支持范围与问题排查

支持的扩展名不代表所有编码都能处理。解码失败时,可尝试 WAV 音频或更短的文件。除 FFmpeg 外,还可能下载语音识别和语音活动检测资源。字幕及时间轴都是草稿,请回放并检查重叠语音、静音、人名和数字,修正后再导出。此工具导出字幕文件,不会生成已烧录字幕的新视频。

隐私与首次加载

所选输入在此浏览器内处理,不会上传到 Aiviko 处理服务器。加载页面、程序库和所需模型仍会产生网络请求。缓存可能被清除,因此不保证完全离线运行。其他网站请求请参阅隐私政策

相关工具

快速说明与规格

核心流程在此浏览器中运行。开始前请核对支持格式、公开限制以及按需下载的模型大小。

输入
WAV、MP3、M4A、AAC、OGG、Opus、FLAC、MP4、MOV、M4V和WebM
输出
SRT、VTT、txt和JSON
处理位置
此设备的浏览器中
模型支持的语言
100 种语言 — 请查看语言选择菜单
单文件上限
200 MB
每次文件数
1
媒体时长上限
60 分钟
按需模型下载
99 MB
最后核验

界面语言与模型处理语言不同。识别和发音质量因语言而异,请核对结果。

On this page