For the complete documentation index, see llms.txt. This page is also available as Markdown.

Whisper Transcription

在 Clore.ai GPU 上使用 OpenAI Whisper 转录音频和视频

在 CLORE.AI GPU 上使用 OpenAI 的 Whisper 转录音频和视频文件。

服务器要求

参数
最低
推荐

内存

8GB

16GB+

显存

4GB(小型)

10GB+(large-v3)

网络

200Mbps

500Mbps+

启动时间

约 1-2 分钟

-

Whisper 是什么?

OpenAI Whisper 是一个语音识别模型,可以:

  • 转录 99 种语言的音频

  • 翻译成英语

  • 生成时间戳

  • 处理嘈杂音频

模型大小

模型
显存
速度
质量
备注

tiny

1GB

~32x realtime

基础

最快,准确率最低

base

1GB

~16x realtime

适合快速任务的良好平衡

small

2GB

~6x realtime

更好

推荐用于大多数场景

medium

5GB

~2x realtime

很高

高准确率,中等速度

large-v3

10GB

~1x realtime

最佳

最高准确率

large-v3-turbo

6GB

~8x realtime

最佳

比 large-v3 快 8 倍,质量相近

💡 推荐: 使用 large-v3-turbo 以获得最佳速度/质量平衡。其准确率与 large-v3 相当,速度快 8 倍,且显存需求更低。

使用 large-v3-turbo

使用 Faster-Whisper:


WhisperX:增强替代方案

用于 词级时间戳, 说话人分离,以及 最高快 70 倍 处理,请考虑使用 WhisperX:

➡️ 查看完整 WhisperX 指南 以了解说话人分离和高级功能。

快速部署(推荐)

使用预构建的 Faster-Whisper 服务器即可立即部署:

Docker 镜像:

端口:

无需命令 - 服务器会自动启动。

验证是否正常工作

部署后,找到你的 http_pub URL 在 我的订单 并测试:

通过 API 转录

完整 API 参考(Faster-Whisper-Server)

端点

端点
方法
描述

/v1/audio/transcriptions

POST

转录音频(兼容 OpenAI)

/v1/audio/translations

POST

将音频翻译成英语

/v1/models

GET

列出所有可用模型

/v1/models/{model_name}

GET

获取特定模型信息

/api/ps

GET

列出当前已加载的模型

/api/ps/{model_name}

GET

检查特定模型是否已加载

/api/pull/{model_name}

POST

下载并加载模型

/health

GET

健康检查端点

/docs

GET

Swagger UI 文档

/openapi.json

GET

OpenAPI 规范

列出可用模型

响应:

Swagger 文档

在浏览器中打开以进行交互式 API 测试:

转录选项

参数
类型
描述

file

文件

要转录的音频文件

model

字符串

要使用的模型(默认: Systran/faster-whisper-large-v3)

language

字符串

强制指定语言(例如, en, ja, ru)

response_format

字符串

json, text, srt, vtt, verbose_json

temperature

浮点数

采样温度(0.0-1.0)

timestamp_granularities[]

数组

wordsegment 用于时间戳

响应格式

JSON(默认):

详细 JSON:

SRT:

替代方案:手动安装

如果你需要更多控制,可使用手动安装部署:

Docker 镜像:

端口:

命令:

手动安装需要 3-5 分钟。上面的预构建镜像更适合更快启动。

基本用法(SSH)

带时间戳转录

上传音频文件

Python API

Faster-Whisper(推荐)

Faster-Whisper 速度快 4 倍,显存占用更低:

语言选项

翻译成英语

命令行:

字幕生成

SRT 格式

VTT 格式

词级时间戳

说话人分离

谁说了什么(需要 pyannote):

REST API 服务器

创建一个转录 API:

性能基准

模型
GPU
1 小时音频

large-v3

RTX 3090

~5 分钟

large-v3

RTX 4090

~3 分钟

large-v3

A100

~2 分钟

medium

RTX 3090

~2 分钟

内存高效处理

对于非常长的音频:

下载结果

故障排查

  • 使用更小的模型(medium 而不是 large)

  • 使用 compute_type="int8" 用于 faster-whisper

  • 处理更短的音频片段

http_pub URL 上出现 HTTP 502

服务仍在启动中。等待 1-2 分钟后重试:

准确率差

  • 使用更大的模型

  • 指定语言: --language English

  • 为 faster-whisper 增大 beam_size

处理缓慢

  • 确保使用 GPU: nvidia-smi

  • 使用 faster-whisper 而不是原版

  • 启用 VAD 以跳过静音

成本估算

CLORE.AI 市场的典型费率:

GPU
显存
每日价格
适合用于

RTX 3060

12GB

$0.15–0.30

小型/中型模型

RTX 3090

24GB

$0.30–1.00

large-v3

RTX 4090

24GB

$0.50–2.00

large-v3,快速

A100

40GB

$1.50–3.00

批处理

价格以美元/天计。费率因提供商而异——请查看 CLORE.AI 市场 以获取当前费率。

最后更新于

这有帮助吗?