IndexTTS + ASMR-J2C Windows 手把手部署与使用教程

CN
hebolide.com
2026-08-25 16:14:43

本教程面向普通 Windows 用户,尽量做到“双击即可完成”。推荐有 NVIDIA 独立显卡(8GB 显存以上更佳),纯 CPU 也能跑但速度很慢。

一、准备工作(必做)

1. 硬件与系统建议

  • Windows 10/11 64位

  • 内存:16GB 及以上(推荐 32GB)

  • 显卡:NVIDIA 显卡,显存 ≥8GB(RTX 3060/4060 等即可)

  • 硬盘:预留至少 20~30GB 空间(模型 + 依赖)

2. 必须安装的软件

  1. Git
    下载地址:https://git-scm.com/download/win
    安装时一路默认即可。

  2. ffmpeg(必须加入系统 PATH)

    • 推荐去 https://www.gyan.dev/ffmpeg/builds/ 下载 ffmpeg-release-essentials.zip

    • 解压到例如 C:\ffmpeg

    • C:\ffmpeg\bin 添加到系统环境变量 PATH

    • 验证:打开 CMD 输入 ffmpeg -version,能显示版本即成功。

  3. Python 3.11 或 3.12(推荐 3.11)

  4. (可选但强烈推荐)NVIDIA 驱动 + CUDA

    • 显卡驱动保持最新

    • 如需完整加速,可安装 CUDA Toolkit 12.x(IndexTTS 推荐 12.8+)

二、下载项目

有两种方式:

方式 A:Git 克隆(推荐)

git clone https://github.com/sh1nny0u/ASMR-J2C.git
cd ASMR-J2C

方式 B:直接下载 ZIP
https://github.com/sh1nny0u/ASMR-J2C 点击 Code → Download ZIP,解压后进入文件夹。

重要提示:路径尽量不要包含中文和空格,推荐放到 D:\AI\ASMR-J2C 这类纯英文路径。

三、一键安装(核心步骤)

项目已经把复杂流程封装成 bat 脚本。

  1. 安装 IndexTTS2 服务
    双击运行:

    setup-index.bat
    
    • 首次运行会自动创建虚拟环境、安装依赖、下载 IndexTTS 模型。

    • 过程可能较长(网络好 10~30 分钟,慢的话 1 小时以上),请耐心等待。

    • 国内网络建议提前设置 HuggingFace 镜像(见下方常见问题)。

  2. 安装 ASMR-J2C 本身
    双击运行:

    setup-j2c.bat
    
  3. 启动服务
    双击运行:

    start.bat
    
    • 会自动启动 IndexTTS 服务 + ASMR-J2C 前端页面。

    • 浏览器一般会自动打开,如果没有,手动访问:http://127.0.0.1:端口(具体端口以启动窗口提示为准,常见是 7860 或项目指定端口)。

  4. 结束服务
    使用完毕后,双击:

    stop.bat
    

    强制释放端口,避免下次启动冲突。

四、首次使用流程

  1. 准备材料

    • 原日语音频(WAV/MP3 等,清晰人声优先)

    • 中文 LRC 字幕(时间轴尽量准确,对应原日语句子)

    • 目标音色参考音频(5~15 秒干净人声,可用中文或日语,建议同一说话人)

  2. 在网页界面操作

    • 上传原音频

    • 上传中文 LRC 字幕

    • 上传参考音频

    • 设置情绪参数(IndexTTS 支持情感向量、情感参考音频等)

    • 选择是否开启「双语音声」模式(原声 + 中文混音)

    • 点击生成,等待任务完成

  3. 生成完成后下载最终 WAV/MP3。

五、进阶:单独使用 IndexTTS 2.5(可选)

如果只想用 IndexTTS 做普通克隆/情感合成,不跑 ASMR-J2C:

# 进入官方仓库(或项目自带的 indexTTS2 目录)
git clone https://github.com/index-tts/index-tts.git
cd index-tts

# 安装 uv
pip install -U uv

# 安装依赖(国内镜像)
uv sync --all-extras --default-index "https://mirrors.aliyun.com/pypi/simple"

# 下载模型(2.5)
uv tool install "huggingface-hub"
set HF_ENDPOINT=https://hf-mirror.com
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpoints

# 启动 WebUI
uv run webui.py

浏览器打开 http://127.0.0.1:7860

六、常见问题与解决方法

问题

解决方法

模型下载极慢/失败

设置环境变量 set HF_ENDPOINT=https://hf-mirror.com 后重试;或用 ModelScope 下载

CUDA / 显存不足

使用 BF16/FP16 模式;关闭其他占显存程序;降低 batch 或换更小模型

DeepSpeed 安装失败(Windows 常见)

去掉 --all-extras 或跳过 DeepSpeed,用普通加速即可

ffmpeg 找不到

确认已加入系统 PATH,重启 CMD/PowerShell

端口被占用

运行 stop.bat,或手动结束相关 Python 进程

生成中文语速/时长不对

在界面调整语速参数,或手动微调 LRC 时间轴

情感不明显

提高 emo_alpha,或使用情感参考音频 + 情感向量组合

七、使用建议与注意事项

  • 第一次生成会比较慢(模型加载 + 缓存),后续会快很多。

  • 字幕质量直接决定最终效果,建议先用专业工具(如 Aegisub、剪映)把 LRC 对齐好。

  • 生成任务较吃资源,建议关闭浏览器其他标签和无关软件。

  • 商用前请确认原音频版权与参考音色授权,避免法律风险。

  • 项目开源协议为 GPL-3.0,使用时请遵守。

八、推荐目录结构示例

D:\AI\
├── ASMR-J2C\          ← 主项目
│   ├── setup-index.bat
│   ├── setup-j2c.bat
│   ├── start.bat
│   ├── stop.bat
│   └── ...
└── materials\         ← 素材库
    ├── original\      ← 日语原音频
    ├── lrc\           ← 中文字幕
    └── ref\           ← 参考音色

按照以上步骤,绝大多数用户都能在 1~2 小时内完成首次部署并成功生成第一条中文配音。

如果在某一步卡住(报错信息截图最好),把具体报错贴出来,我可以继续帮你针对性排查。祝部署顺利!