• «
  • 1
  • 2
  • »
  • Pages: 1/2     Go

242557255?v=4&size=128

grider_transwithai

AI汉化组 Faster Whisper 海南鸡v2 Plus版(增强VAD)正式开源!支持音声/AV等 持续更新 支持翻译/转录

Faster Whisper 海南鸡v2 Plus版(增强VAD)正式开源!


重磅更新:现已支持日文→日文(ja→ja)原文转录!翻译、转录双模式任选!


项目介绍

Faster Whisper TransWithAI ChickenRice - 高性能音视频转录和翻译工具,专为日文场景深度优化。既能日文转中文翻译(ja→zh),也能日文原文转录(ja→ja),直接输出日文字幕。

基于 Faster Whisper 开发,集成了经过5000小时音频数据训练的"海南鸡v2"翻译模型,以及全新的 TransWithAI/whisper-ja-1.5B-ct2 日文原文转录模型,并搭载音声优化VAD(语音活动检测)技术,在ASMR等复杂音频场景下表现卓越。

开源地址

GitHub: https://github.com/TransWithAI/Faster-Whisper-TransWithAI-ChickenRice

下载链接

GitHub Release(官方下载):
https://github.com/TransWithAI/Faster-Whisper-TransWithAI-ChickenRice/releases

MEGA网盘(备用下载):
https://mega.nz/folder/qAUmkT6D#xkqQMzNvgOnMu4N1GnfDIA

更新日志
V1.9 (2026-06-12) - 转录时间轴稳定性修复
时间轴更稳定:改用外部VAD预先计算语音区间,并以 clip_timestamps 显式传入 faster-whisper,替代其内部 vad_filter
修复时间戳坍缩:在批处理与非批处理模式下都能避免 Whisper 时间戳坍缩/错乱,字幕时间轴更稳定
转录模型升级:日文转录模型切换为 TransWithAI/whisper-ja-1.5B-ct2(bf16转换版)

V1.8 (2026-06-10) - 日文原文转录(ja→ja)重磅登场!
日文→日文原文转录支持:新增 TransWithAI/whisper-ja-1.5B-ct2 日文原文转录模型(由 efwkjn/whisper-ja-1.5B 转换而来),无需翻译即可直接输出日文字幕
翻译/转录双模式:新增 --task 参数(translate/transcribe),并拆分为 "运行(翻译)(...)" 与 "运行(转录)(...)" 两套启动脚本
三种发行包变体:重构为 无主模型版(-nomodel)、翻译版(-translate)、转录版(-transcribe)三种打包,按需下载
拖放交互提示:直接双击 .bat 启动脚本(未拖入文件)时,会提示将音视频文件拖入窗口后回车
下载更稳定:huggingface.co 下载失败时自动回退到 hf-mirror.com 镜像,并对 HTTP 429 限流自动退避重试
海南鸡模型地址更新:翻译模型改用 CT2 版本仓库 whisper-large-v2-translate-zh-v0.2-st-ct2
稳定性修复:修复 CTranslate2 运行时 setuptools/pkg_resources 导入、CUDA 11.8 兼容性等问题

V1.7 (2026-02-24) - AMD ROCm/HIP GPU支持
AMD显卡支持:新增 AMD 显卡支持(RDNA1–RDNA4),覆盖 RX 5000 / 6000 / 7000 / 9000 系列
多架构构建:提供 gfx101x、gfx103x、gfx110x、gfx120x 四种架构的打包版本
ROCm运行时内置:AMD 版本内置 ROCm/HIP 运行时 DLL,无需单独安装 ROCm
设备别名:命令行支持 --device=amd(等同于 --device=cuda)
自动设备检测增强:改进 GPU 检测逻辑,支持 AMD HIP 设备自动识别

V1.6 (2026-01-12) - Modal云端GPU推理支持
Modal云端推理:新增 modal_infer.exe,无需本地GPU也能使用云端GPU进行推理
多GPU选择:支持 T4、L4、A10G、A100、H100 等多种云端GPU
新用户福利:Modal新用户每月$30免费额度,T4 GPU性价比最高
交互式配置:通过命令行交互选择GPU类型、模型、批处理等参数
自动文件传输:自动上传本地音频、下载生成的字幕到本地
模型缓存:模型文件在Modal Volume中缓存,后续运行更快
环境整合:Modal依赖已集成到主环境文件,无需单独安装

V1.5 (2025-12-26) - 可配置字幕片段合并后处理
字幕合并后处理:新增 segment_merge 配置选项,智能合并重复/重叠的字幕片段
灵活配置:在 generation_config.json5 中配置合并参数(启用/禁用、最大间隔、最大时长)
命令行覆盖:支持 --merge_segments、--no_merge_segments、--merge_max_gap_ms、--merge_max_duration_ms 参数
算法优化:改进合并算法,通过间隔和时长限制避免产生过长的字幕

V1.4 (2025-11-25) - 批处理推理加速
批处理推理支持:新增批处理推理模式(--enable_batching),大幅提升处理速度
智能批次大小检测:程序启动时自动测试不同批次大小(1-8),找到显存允许的最大批次
手动批次控制:支持通过 --batch_size 参数手动指定批次大小,跳过自动检测
运行时自适应:处理过程中如遇显存不足(OOM),自动降低批次大小继续处理
新增高显存加速模式:提供 "运行(GPU,高显存加速模式).bat" 专为8GB+显存用户优化
批处理兼容性修复:修复faster-whisper批处理的max_initial_timestamp参数传递问题

V1.3 (2025-11-17) - 智能计算类型选择
智能计算类型:自动检测设备并选择最优计算类型(bfloat16 > float16 > int8 > float32)
增强设备检测:改进CUDA可用性检测,支持CUDA_VISIBLE_DEVICES环境变量
简化批处理文件:移除硬编码的计算类型设置,全部使用自动检测模式
改进日志记录:添加自动检测设备和计算类型的详细日志信息
修复日志重复:移除重复的根日志处理器,避免日志重复输出

V1.2 (2025-11-15) - 性能与兼容性大升级
CPU性能飞跃:添加 int16 计算类型支持,CPU处理速度显著提升
GPU兼容性增强:强制使用 float16 替代 bfloat16,支持更多显卡型号
操作更简便:视频翻译功能已集成到主批处理文件中
问题追踪:新增日志记录功能,自动保存到 latest.log 文件

V1.1 (2025-11-14) - 完美离线解决方案
无需VPN即可使用:预下载 whisper-base 模型,实现完全离线运行
告别HuggingFace连接问题:WhisperFeatureExtractor 优先使用本地模型
智能下载管理:支持从已有模型文件夹复制,避免重复下载
稳定性提升:彻底解决网络不稳定环境下的超时问题

V1.0 (2025-11-13) - 初始发布
多版本CUDA支持:兼容CUDA 11.8/12.2/12.8
卓越翻译效果:优化的日文转中文翻译(海南鸡v2版本)
精准语音检测:音声优化的VAD语音活动检测
高效缓存机制:加快CI/CD构建速度
灵活版本选择:提供基础版和完整版,满足不同需求
自动化管理:VAD模型自动下载和管理

推荐所有用户下载最新V1.9版本,体验全新日文原文转录(ja→ja)和更稳定的字幕时间轴!

核心特性

高精度日转中翻译(ja→zh)
• 基于5000小时音频数据训练的"海南鸡v2"优化模型
• 专门针对日文转中文翻译场景深度优化
• 支持多种音频格式:MP3、WAV、FLAC、AAC等
• 支持视频文件:MP4、MKV、AVI、MOV等

日文原文转录(ja→ja)【新】
• 全新 TransWithAI/whisper-ja-1.5B-ct2 日文转录模型(bf16)
• 无需翻译,直接输出日文原文字幕
• 适合日语学习、歌词提取、听写校对等场景
• 与翻译模式共用同一套工具链,通过 --task 参数或专用 .bat 一键切换

性能优化
GPU加速:支持CUDA 11.8/12.2/12.8,充分利用NVIDIA显卡性能
智能缓存:自动跳过已处理文件,提高批量处理效率
低显存模式:4GB显存即可运行
CPU模式:无显卡用户也能使用

增强VAD技术
• 集成 TransWithAI/Whisper-Vad-EncDec-ASMR-onnx 模型
• 音声场景优化,特别适合ASMR内容
• 智能语音活动检测,提高转录准确度
• 自动过滤静音和噪音段落

多格式输出
• SRT字幕(标准格式)
• VTT字幕(Web视频格式)
• LRC歌词(时间轴歌词)
• JSON(结构化数据)
• TXT(纯文本)

版本选择

翻译版(-translate)- 日文转中文
• 所有GPU依赖项 + 音声优化VAD模型
• "海南鸡v2 5000小时"日转中翻译模型(开箱即用)
• 仅含翻译启动脚本
适合:需要高质量日转中翻译(ja→zh)的用户

转录版(-transcribe)- 日文原文转录【新】
• 所有GPU依赖项 + 音声优化VAD模型
• TransWithAI/whisper-ja-1.5B-ct2 日文转录模型(开箱即用)
• 仅含转录启动脚本
适合:需要日文原文字幕(ja→ja)的用户

无主模型版(-nomodel)
• 所有GPU依赖项 + 音声优化VAD模型
• 含翻译和转录两套启动脚本
• 不含主Whisper模型(需自行下载)
适合:需要使用自定义模型的高级用户

显卡兼容性

显卡系列推荐版本
GTX 10/16系列CUDA 11.8
RTX 20/30系列CUDA 11.8 或 12.2
RTX 40系列CUDA 12.2 或 12.8
RTX 50系列必须使用 CUDA 12.8
AMD RX 5000系列gfx101x_dgpu
AMD RX 6000系列gfx103x_dgpu
AMD RX 7000系列gfx110x_all
AMD RX 9000系列gfx120x_all


使用方法

1. 下载对应版本
   从Release页面下载适合你显卡的版本(翻译选 -translate,转录选 -transcribe,自定义模型选 -nomodel)

2. 解压文件
   解压到任意目录,无需安装

3. 开始使用
复制代码
  1. # 日文转中文翻译(ja→zh)
  2. 拖放文件到 → 运行(翻译)(GPU).bat
  3. # 日文原文转录(ja→ja)【新】
  4. 拖放文件到 → 运行(转录)(GPU).bat
  5. # 低显存模式(4GB显存)
  6. 拖放文件到 → 运行(翻译)(GPU,低显存模式).bat
  7. # CPU模式(无显卡)
  8. 拖放文件到 → 运行(翻译)(CPU).bat / 运行(转录)(CPU).bat


小提示:直接双击 .bat(不拖文件)也可以,程序会提示你把音视频文件拖入窗口后回车。

高级配置

支持命令行参数自定义:
复制代码
  1. --task
- 选择任务模式:translate(翻译)/ transcribe(转录)
复制代码
  1. --overwrite
- 覆盖已存在的字幕
复制代码
  1. --output_dir
- 指定输出目录
复制代码
  1. --audio_suffixes
- 自定义音频格式
复制代码
  1. --sub_formats
- 自定义输出格式
复制代码
  1. --log_level
- 调整日志级别

详细配置可编辑
复制代码
  1. generation_config.json5
文件

应用场景

• 日本动画、电影、剧集翻译
• ASMR音频内容转录
• 游戏实况、直播录像翻译
• 日语学习材料制作(日文原文字幕对照学习)
• 日文歌曲歌词提取(ja→ja 直出日文歌词)
• 日文听写、原文校对(ja→ja 转录模式)
• Vlog、纪录片字幕制作

Modal 云端推理

无本地GPU或显存不足?使用Modal云端GPU进行推理:

1. 环境配置
复制代码
  1. # 使用现有 Conda 环境(已包含 modal 支持)
  2. conda activate faster-whisper-cu118  # 或 cu122, cu128
  3. # 或手动安装
  4. pip install modal questionary


2. Modal 账号设置
复制代码
  1. # 注册账号:https://modal.com/(新用户每月 $30 免费额度)
  2. # 配置 Token
  3. modal token new


3. 运行云端推理
复制代码
  1. # 使用打包版本
  2. modal_infer.exe
  3. # 或使用 Python
  4. python modal_infer.py


程序会交互式询问GPU类型、模型选择、输入文件等参数。

推荐配置:T4 GPU性价比最高,适合一般转录任务。

开发团队

AI汉化组 - 致力于开源AI翻译工具开发
Telegram群组: https://t.me/transWithAI
永久免费开源

特别致谢

• 基于 SYSTRAN/faster-whisper 开发
• 使用 chickenrice0721 的海南鸡日转中翻译模型
• 日文转录模型 TransWithAI/whisper-ja-1.5B-ct2,由 efwkjn/whisper-ja-1.5B 原版模型转换而来
• 集成 TransWithAI 的音声优化VAD
• 感谢 OpenAI Whisper 原始项目
特别感谢某匿名群友的算力和技术支持!

开源协议

本项目采用 MIT 许可证,完全免费开源

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━


加入我们的Telegram群组,获取最新更新和技术支持:
https://t.me/transWithAI


本工具由AI汉化组开源维护,永久免费。感谢社区的支持!如果觉得好用,请在下方评论一下以示鼓励,谢谢!

a16.gif

墨凡

两个小时的av字幕转录效果怎么样?之前的版本视频长一点就幻觉严重

1533634.jpg

Maybego

B2F  2026-06-13 14:14
(没人照看的白菜烂的那叫一个快,没人管的猪霍霍庄稼效果拔群。)
每次更新都要重新下载一遍 吗 又没有好的升级大法

242557255?v=4&size=128

grider_transwithai

回 2楼(Maybego) 的帖子

可以下无模型的版本覆盖

a14.gif

苹果酱


a10.gif

相遇

666666666,支持

3.gif

一根大黄瓜

为什么文件损坏 amd 120版本

none.gif

bis

改常用参数就是在运行翻译里用记事本打开修改,我找了好久。
运行(翻译)(GPU,高显存加速模式).bat右键在记事本打开就可以了。     

1564387.jpg

9c395e89

如果我想既可以翻译又可以转录,我是不是得下两套完整的zip啊?

242557255?v=4&size=128

grider_transwithai

回 8楼(9c395e89) 的帖子

目前是的

778269.jpg

Arashi

最新的翻译会有很多重复文字

68a9a01a07be2.jpg

雨离

B11F  2026-06-19 01:01
(雨离)
之前用的那个版本(1.7?)有些翻译的字幕和音频对不上,翻译是对的但是时间轴上会延后,在有些音频上又是正常的,不知道什么原因,这个版本不知道修好没有。另外,支持大佬开发这些程序还一直更新,在这个之前我用的还是内置的whisper,相比之下很僵硬。

none.gif

4b22608e

感谢大佬

none.gif

pclgo

B13F  2026-06-19 22:23
(https://www.ff98sha.me/archives/147)
respect大佬

none.gif

Faris

B14F  2026-06-20 00:23
(...)
能直出日语原文了?强强强,太好了

2069719.jpg

亲吻股间唇

B15F  2026-06-20 00:27
(亲吻股间唇)

none.gif

海绵体宝宝

感谢分享

none.gif

Gray

感谢大佬分享

none.gif

yuyk

不想登✈️,有没有discord?

187484.jpg

中野四叶


psyc2008

B20F  2026-06-20 13:24
马一下

1544058.jpg

5b36b1a7

B21F  2026-06-20 15:48
(fantastic)
怎么把这个字幕写入视频内呢?

none.gif

strayer404

B22F  2026-06-20 23:34
(strayer404)
感谢分享

a9.gif

三天觉觉

备用下载链接里是1.6的版本,希望能有其他的下载渠道

223896.jpg

神机营把总

非常感谢。

none.gif

kangshifu

解压.zip.manifest显示未知格式 解压其他几个报错

242557255?v=4&size=128

grider_transwithai

回 25楼(kangshifu) 的帖子

下英文方框里的链接,或者用7z打开.000那个

278891.jpg

Coupe___芙兰

我看TG群组还有1.10版本,请问大概什么时候更新!

242557255?v=4&size=128

grider_transwithai

回 27楼(Coupe___芙兰) 的帖子

等有人帮我测试amd再更新

561235.jpg

foxygenium

B29F  2026-06-25 15:25
(+1s ing……)
cu128-translate解压显示文件损坏是什么情况,校检了哈希值没问题

138099.jpg

式蜂鸟

之前在github上加star了,1.9版本确实好用不少,准确度也有所提升了
  • «
  • 1
  • 2
  • »
  • Pages: 1/2     Go