英文发声AI引擎Kokoro TTS服务在Linux服务器宝塔面板Docker部署的详细教程 - 开源小栈 - 专注于高质量开源项目、AI论文复现与开发者工具分享
英文发声AI引擎Kokoro TTS服务在Linux服务器宝塔面板Docker部署的详细教程

本文详细介绍如何在Linux服务器的宝塔面板中使用Docker部署Kokoro TTS——一款仅8200万参数的高质量开源AI文本转语音引擎。教程涵盖GPU与CPU两种部署方案,重点说明环境配置、镜像拉取、端口映射及权重文件挂载等关键步骤,并提供完整的Docker Compose示例和API测试方法,帮助用户快速在本地或云服务器上搭建自然、高效的英文语音合成服务。

Kokoro TTS是什么

Kokoro TTS:仅需 8200 万参数的先进 AI 文本转语音模型

Kokoro是近期在开源社区非常火爆的一个文本转语音(TTS)模型。前面写的《读了么?那个单词跟读网页重磅更新了!自己部署了Kokoro-TTS,声音更加像人且有不同的角色体验》单词跟读服务就是用的Kokoro模型。

它只有 8200万 (82M) 参数。相比于那些拥有数亿甚至数十亿参数的大模型,Kokoro 非常小巧。这意味着它可以在普通消费级显卡(甚至在纯 CPU)上飞快地运行,非常适合本地部署。尽管体积小,但它的生成质量被公认为接近行业标杆 ElevenLabs。它的发音自然,语调丰富,能够很好地处理停顿、重音和情感色彩,甚至能模拟呼吸声。

目前最成熟的是 英语(包含美式英语和英式英语),但也包含对日语和汉语的初步支持(但在英语方面表现最惊艳)。

Kokoro TTS Docker部署:宝塔面板环境配置方案

services:
  # -------------------------------------------------------
  # 1. GPU 版本 (推荐: 适配您的 RTX 3090)
  # -------------------------------------------------------
  kokoro-gpu:
    container_name: kokoro-gpu
    image: swr.cn-north-4.myhuaweicloud.com/ddn-k8s/ghcr.io/remsky/kokoro-fastapi-gpu:v0.2.4
    restart: unless-stopped
    ports:
      - "8880:8880"  # 主服务端口
    environment:
      - NVIDIA_VISIBLE_DEVICES=all
      - NVIDIA_DRIVER_CAPABILITIES=compute,utility
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]
    # 可选:挂载目录以保存生成的音频或自定义模型
    volumes:
      - ./weights:/app/api/src/models  # 将模型权重映射到本地

CPU版本:

services:
  kokoro-tts:
    # 使用你提供的国内华为云镜像地址,确保国内服务器能拉取
    image: swr.cn-north-4.myhuaweicloud.com/ddn-k8s/ghcr.io/remsky/kokoro-fastapi-cpu:v0.2.4
    container_name: kokoro-tts-cpu
    restart: always
    
    # 端口映射:左边是服务器访问端口,右边是容器端口
    # 你可以通过 http://服务器IP:8880 访问
    ports:
      - "8880:8880"
      
    environment:
      - LANG=C.UTF-8
      - USE_GPU=false
      - DEVICE=cpu
      # 尝试自动下载模型(注意:国内服务器可能会因为连不上 HuggingFace 而下载失败)
      - DOWNLOAD_MODEL=true 
      
    # 资源限制(可选,4核8G机器可以不限制,或者给它留足空间)
    deploy:
      resources:
        limits:
          cpus: '4.0'
          memory: 4G
          
    # 挂载目录:强烈建议挂载,以便手动上传模型文件,避免每次重启都重新下载
    volumes:
      - ./weights:/app/api/src/models  # 将模型权重映射到本地

在服务器里,小陶部署的是CPU版本,因为云服务器没有GPU。内容示例如下:

部署的是CPU版本

选择拉取后的镜像创建容器,注意端口!注意端口!

镜像创建容器

服务在正常运行:

服务在正常运行

测试服务

打开某个文件夹路径,点开终端,输入下面内容:

curl -X POST http://127.0.0.1:8880/v1/audio/speech \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kokoro",
    "input": "Hello wood, you are now generating voice successfully.",
    "voice": "af_heart",
    "response_format": "mp3",
    "speed": 1.0
  }' \
  --output test_audio.mp3

会产生一个mp3文件:

mp3文件测试

点开听听,就知道目前是测试成果了!

分类: 暂无分类 标签: Kokoro TTSDocker部署宝塔面板TTS教程AI语音合成开源TTS文本转语音

评论

暂无评论数据

暂无评论数据

目录