Faster Whisper 海南鸡v2 Plus版(增强VAD)正式开源!
重磅更新:现已支持日文→日文(ja→ja)原文转录!翻译、转录双模式任选!
项目介绍Faster Whisper TransWithAI ChickenRice - 高性能音视频转录和翻译工具,专为日文场景深度优化。
既能日文转中文翻译(ja→zh),也能日文原文转录(ja→ja),直接输出日文字幕。
基于 Faster Whisper 开发,集成了经过
5000小时音频数据训练的"海南鸡v2"翻译模型,以及全新的
TransWithAI/whisper-ja-1.5B-ct2 日文原文转录模型,并搭载音声优化VAD(语音活动检测)技术,在ASMR等复杂音频场景下表现卓越。
开源地址GitHub: https://github.com/TransWithAI/Faster-Whisper-TransWithAI-ChickenRice下载链接GitHub Release(官方下载):https://github.com/TransWithAI/Faster-Whisper-TransWithAI-ChickenRice/releasesMEGA网盘(备用下载):https://mega.nz/folder/qAUmkT6D#xkqQMzNvgOnMu4N1GnfDIA 更新日志 V1.9 (2026-06-12) - 转录时间轴稳定性修复•
时间轴更稳定:改用外部VAD预先计算语音区间,并以 clip_timestamps 显式传入 faster-whisper,替代其内部 vad_filter
•
修复时间戳坍缩:在批处理与非批处理模式下都能避免 Whisper 时间戳坍缩/错乱,字幕时间轴更稳定
•
转录模型升级:日文转录模型切换为 TransWithAI/whisper-ja-1.5B-ct2(bf16转换版)
V1.8 (2026-06-10) - 日文原文转录(ja→ja)重磅登场!•
日文→日文原文转录支持:新增 TransWithAI/whisper-ja-1.5B-ct2 日文原文转录模型(由 efwkjn/whisper-ja-1.5B 转换而来),
无需翻译即可直接输出日文字幕•
翻译/转录双模式:新增 --task 参数(translate/transcribe),并拆分为 "运行(翻译)(...)" 与 "运行(转录)(...)" 两套启动脚本
•
三种发行包变体:重构为 无主模型版(-nomodel)、翻译版(-translate)、转录版(-transcribe)三种打包,按需下载
•
拖放交互提示:直接双击 .bat 启动脚本(未拖入文件)时,会提示将音视频文件拖入窗口后回车
•
下载更稳定:huggingface.co 下载失败时自动回退到 hf-mirror.com 镜像,并对 HTTP 429 限流自动退避重试
•
海南鸡模型地址更新:翻译模型改用 CT2 版本仓库 whisper-large-v2-translate-zh-v0.2-st-ct2
•
稳定性修复:修复 CTranslate2 运行时 setuptools/pkg_resources 导入、CUDA 11.8 兼容性等问题
V1.7 (2026-02-24) - AMD ROCm/HIP GPU支持•
AMD显卡支持:新增 AMD 显卡支持(RDNA1–RDNA4),覆盖 RX 5000 / 6000 / 7000 / 9000 系列
•
多架构构建:提供 gfx101x、gfx103x、gfx110x、gfx120x 四种架构的打包版本
•
ROCm运行时内置:AMD 版本内置 ROCm/HIP 运行时 DLL,无需单独安装 ROCm
•
设备别名:命令行支持 --device=amd(等同于 --device=cuda)
•
自动设备检测增强:改进 GPU 检测逻辑,支持 AMD HIP 设备自动识别
V1.6 (2026-01-12) - Modal云端GPU推理支持•
Modal云端推理:新增 modal_infer.exe,无需本地GPU也能使用云端GPU进行推理
•
多GPU选择:支持 T4、L4、A10G、A100、H100 等多种云端GPU
•
新用户福利:Modal新用户每月$30免费额度,T4 GPU性价比最高
•
交互式配置:通过命令行交互选择GPU类型、模型、批处理等参数
•
自动文件传输:自动上传本地音频、下载生成的字幕到本地
•
模型缓存:模型文件在Modal Volume中缓存,后续运行更快
•
环境整合:Modal依赖已集成到主环境文件,无需单独安装
V1.5 (2025-12-26) - 可配置字幕片段合并后处理•
字幕合并后处理:新增 segment_merge 配置选项,智能合并重复/重叠的字幕片段
•
灵活配置:在 generation_config.json5 中配置合并参数(启用/禁用、最大间隔、最大时长)
•
命令行覆盖:支持 --merge_segments、--no_merge_segments、--merge_max_gap_ms、--merge_max_duration_ms 参数
•
算法优化:改进合并算法,通过间隔和时长限制避免产生过长的字幕
V1.4 (2025-11-25) - 批处理推理加速•
批处理推理支持:新增批处理推理模式(--enable_batching),大幅提升处理速度
•
智能批次大小检测:程序启动时自动测试不同批次大小(1-8),找到显存允许的最大批次
•
手动批次控制:支持通过 --batch_size 参数手动指定批次大小,跳过自动检测
•
运行时自适应:处理过程中如遇显存不足(OOM),自动降低批次大小继续处理
•
新增高显存加速模式:提供 "运行(GPU,高显存加速模式).bat" 专为8GB+显存用户优化
•
批处理兼容性修复:修复faster-whisper批处理的max_initial_timestamp参数传递问题
V1.3 (2025-11-17) - 智能计算类型选择•
智能计算类型:自动检测设备并选择最优计算类型(bfloat16 > float16 > int8 > float32)
•
增强设备检测:改进CUDA可用性检测,支持CUDA_VISIBLE_DEVICES环境变量
•
简化批处理文件:移除硬编码的计算类型设置,全部使用自动检测模式
•
改进日志记录:添加自动检测设备和计算类型的详细日志信息
•
修复日志重复:移除重复的根日志处理器,避免日志重复输出
V1.2 (2025-11-15) - 性能与兼容性大升级•
CPU性能飞跃:添加 int16 计算类型支持,CPU处理速度显著提升
•
GPU兼容性增强:强制使用 float16 替代 bfloat16,支持更多显卡型号
•
操作更简便:视频翻译功能已集成到主批处理文件中
•
问题追踪:新增日志记录功能,自动保存到 latest.log 文件
V1.1 (2025-11-14) - 完美离线解决方案•
无需VPN即可使用:预下载 whisper-base 模型,实现完全离线运行
•
告别HuggingFace连接问题:WhisperFeatureExtractor 优先使用本地模型
•
智能下载管理:支持从已有模型文件夹复制,避免重复下载
•
稳定性提升:彻底解决网络不稳定环境下的超时问题
V1.0 (2025-11-13) - 初始发布•
多版本CUDA支持:兼容CUDA 11.8/12.2/12.8
•
卓越翻译效果:优化的日文转中文翻译(海南鸡v2版本)
•
精准语音检测:音声优化的VAD语音活动检测
•
高效缓存机制:加快CI/CD构建速度
•
灵活版本选择:提供基础版和完整版,满足不同需求
•
自动化管理:VAD模型自动下载和管理
推荐所有用户下载最新V1.9版本,体验全新日文原文转录(ja→ja)和更稳定的字幕时间轴!核心特性高精度日转中翻译(ja→zh)• 基于5000小时音频数据训练的"海南鸡v2"优化模型
• 专门针对日文转中文翻译场景深度优化
• 支持多种音频格式:MP3、WAV、FLAC、AAC等
• 支持视频文件:MP4、MKV、AVI、MOV等
日文原文转录(ja→ja)【新】• 全新 TransWithAI/whisper-ja-1.5B-ct2 日文转录模型(bf16)
• 无需翻译,直接输出日文原文字幕
• 适合日语学习、歌词提取、听写校对等场景
• 与翻译模式共用同一套工具链,通过 --task 参数或专用 .bat 一键切换
性能优化•
GPU加速:支持CUDA 11.8/12.2/12.8,充分利用NVIDIA显卡性能
•
智能缓存:自动跳过已处理文件,提高批量处理效率
•
低显存模式:4GB显存即可运行
•
CPU模式:无显卡用户也能使用
增强VAD技术• 集成 TransWithAI/Whisper-Vad-EncDec-ASMR-onnx 模型
• 音声场景优化,特别适合ASMR内容
• 智能语音活动检测,提高转录准确度
• 自动过滤静音和噪音段落
多格式输出• SRT字幕(标准格式)
• VTT字幕(Web视频格式)
• LRC歌词(时间轴歌词)
• JSON(结构化数据)
• TXT(纯文本)
版本选择翻译版(-translate)- 日文转中文• 所有GPU依赖项 + 音声优化VAD模型
• "海南鸡v2 5000小时"日转中翻译模型(开箱即用)
• 仅含翻译启动脚本
•
适合:需要高质量日转中翻译(ja→zh)的用户
转录版(-transcribe)- 日文原文转录【新】• 所有GPU依赖项 + 音声优化VAD模型
• TransWithAI/whisper-ja-1.5B-ct2 日文转录模型(开箱即用)
• 仅含转录启动脚本
•
适合:需要日文原文字幕(ja→ja)的用户
无主模型版(-nomodel)• 所有GPU依赖项 + 音声优化VAD模型
• 含翻译和转录两套启动脚本
• 不含主Whisper模型(需自行下载)
•
适合:需要使用自定义模型的高级用户
显卡兼容性| 显卡系列 | 推荐版本 |
| GTX 10/16系列 | CUDA 11.8 |
| RTX 20/30系列 | CUDA 11.8 或 12.2 |
| RTX 40系列 | CUDA 12.2 或 12.8 |
| RTX 50系列 | 必须使用 CUDA 12.8 |
| AMD RX 5000系列 | gfx101x_dgpu |
| AMD RX 6000系列 | gfx103x_dgpu |
| AMD RX 7000系列 | gfx110x_all |
| AMD RX 9000系列 | gfx120x_all |
使用方法1. 下载对应版本 从Release页面下载适合你显卡的版本(翻译选 -translate,转录选 -transcribe,自定义模型选 -nomodel)
2. 解压文件 解压到任意目录,无需安装
3. 开始使用复制代码- # 日文转中文翻译(ja→zh)
- 拖放文件到 → 运行(翻译)(GPU).bat
- # 日文原文转录(ja→ja)【新】
- 拖放文件到 → 运行(转录)(GPU).bat
- # 低显存模式(4GB显存)
- 拖放文件到 → 运行(翻译)(GPU,低显存模式).bat
- # CPU模式(无显卡)
- 拖放文件到 → 运行(翻译)(CPU).bat / 运行(转录)(CPU).bat
|
小提示:直接双击 .bat(不拖文件)也可以,程序会提示你把音视频文件拖入窗口后回车。
高级配置支持命令行参数自定义:
- 选择任务模式:translate(翻译)/ transcribe(转录)
- 覆盖已存在的字幕
- 指定输出目录
- 自定义音频格式
- 自定义输出格式
- 调整日志级别
详细配置可编辑
文件
应用场景• 日本动画、电影、剧集翻译
• ASMR音频内容转录
• 游戏实况、直播录像翻译
• 日语学习材料制作(日文原文字幕对照学习)
• 日文歌曲歌词提取(ja→ja 直出日文歌词)
• 日文听写、原文校对(ja→ja 转录模式)
• Vlog、纪录片字幕制作
Modal 云端推理无本地GPU或显存不足?使用Modal云端GPU进行推理:
1. 环境配置复制代码- # 使用现有 Conda 环境(已包含 modal 支持)
- conda activate faster-whisper-cu118 # 或 cu122, cu128
- # 或手动安装
- pip install modal questionary
|
2. Modal 账号设置复制代码- # 注册账号:https://modal.com/(新用户每月 $30 免费额度)
- # 配置 Token
- modal token new
|
3. 运行云端推理复制代码- # 使用打包版本
- modal_infer.exe
- # 或使用 Python
- python modal_infer.py
|
程序会交互式询问GPU类型、模型选择、输入文件等参数。
推荐配置:T4 GPU性价比最高,适合一般转录任务。
开发团队AI汉化组 - 致力于开源AI翻译工具开发
Telegram群组: https://t.me/transWithAI永久免费开源特别致谢• 基于
SYSTRAN/faster-whisper 开发
• 使用
chickenrice0721 的海南鸡日转中翻译模型
• 日文转录模型
TransWithAI/whisper-ja-1.5B-ct2,由
efwkjn/whisper-ja-1.5B 原版模型转换而来
• 集成
TransWithAI 的音声优化VAD
• 感谢
OpenAI Whisper 原始项目
•
特别感谢某匿名群友的算力和技术支持!开源协议本项目采用 MIT 许可证,完全免费开源
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
本工具由AI汉化组开源维护,永久免费。感谢社区的支持!如果觉得好用,请在下方评论一下以示鼓励,谢谢!