Whisper Transcription
在 Clore.ai GPU 上使用 OpenAI Whisper 转录音频和视频
在 CLORE.AI GPU 上使用 OpenAI 的 Whisper 转录音频和视频文件。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
服务器要求
内存
8GB
16GB+
显存
4GB(小型)
10GB+(large-v3)
网络
200Mbps
500Mbps+
启动时间
约 1-2 分钟
-
Whisper 是什么?
OpenAI Whisper 是一个语音识别模型,可以:
转录 99 种语言的音频
翻译成英语
生成时间戳
处理嘈杂音频
模型大小
tiny
1GB
~32x realtime
基础
最快,准确率最低
base
1GB
~16x realtime
好
适合快速任务的良好平衡
small
2GB
~6x realtime
更好
推荐用于大多数场景
medium
5GB
~2x realtime
很高
高准确率,中等速度
large-v3
10GB
~1x realtime
最佳
最高准确率
large-v3-turbo
6GB
~8x realtime
最佳
比 large-v3 快 8 倍,质量相近
💡 推荐: 使用
large-v3-turbo以获得最佳速度/质量平衡。其准确率与large-v3相当,速度快 8 倍,且显存需求更低。
使用 large-v3-turbo
使用 Faster-Whisper:
WhisperX:增强替代方案
用于 词级时间戳, 说话人分离,以及 最高快 70 倍 处理,请考虑使用 WhisperX:
➡️ 查看完整 WhisperX 指南 以了解说话人分离和高级功能。
快速部署(推荐)
使用预构建的 Faster-Whisper 服务器即可立即部署:
Docker 镜像:
端口:
无需命令 - 服务器会自动启动。
验证是否正常工作
部署后,找到你的 http_pub URL 在 我的订单 并测试:
如果收到 HTTP 502,请等待 1-2 分钟——服务仍在启动中。
通过 API 转录
完整 API 参考(Faster-Whisper-Server)
端点
/v1/audio/transcriptions
POST
转录音频(兼容 OpenAI)
/v1/audio/translations
POST
将音频翻译成英语
/v1/models
GET
列出所有可用模型
/v1/models/{model_name}
GET
获取特定模型信息
/api/ps
GET
列出当前已加载的模型
/api/ps/{model_name}
GET
检查特定模型是否已加载
/api/pull/{model_name}
POST
下载并加载模型
/health
GET
健康检查端点
/docs
GET
Swagger UI 文档
/openapi.json
GET
OpenAPI 规范
列出可用模型
响应:
Swagger 文档
在浏览器中打开以进行交互式 API 测试:
转录选项
file
文件
要转录的音频文件
model
字符串
要使用的模型(默认: Systran/faster-whisper-large-v3)
language
字符串
强制指定语言(例如, en, ja, ru)
response_format
字符串
json, text, srt, vtt, verbose_json
temperature
浮点数
采样温度(0.0-1.0)
timestamp_granularities[]
数组
word 或 segment 用于时间戳
响应格式
JSON(默认):
详细 JSON:
SRT:
替代方案:手动安装
如果你需要更多控制,可使用手动安装部署:
Docker 镜像:
端口:
命令:
基本用法(SSH)
带时间戳转录
上传音频文件
Python API
Faster-Whisper(推荐)
Faster-Whisper 速度快 4 倍,显存占用更低:
语言选项
翻译成英语
命令行:
字幕生成
SRT 格式
VTT 格式
词级时间戳
说话人分离
谁说了什么(需要 pyannote):
REST API 服务器
创建一个转录 API:
性能基准
large-v3
RTX 3090
~5 分钟
large-v3
RTX 4090
~3 分钟
large-v3
A100
~2 分钟
medium
RTX 3090
~2 分钟
内存高效处理
对于非常长的音频:
下载结果
故障排查
CUDA 内存不足
使用更小的模型(medium 而不是 large)
使用
compute_type="int8"用于 faster-whisper处理更短的音频片段
http_pub URL 上出现 HTTP 502
服务仍在启动中。等待 1-2 分钟后重试:
准确率差
使用更大的模型
指定语言:
--language English为 faster-whisper 增大 beam_size
处理缓慢
确保使用 GPU:
nvidia-smi使用 faster-whisper 而不是原版
启用 VAD 以跳过静音
成本估算
CLORE.AI 市场的典型费率:
RTX 3060
12GB
$0.15–0.30
小型/中型模型
RTX 3090
24GB
$0.30–1.00
large-v3
RTX 4090
24GB
$0.50–2.00
large-v3,快速
A100
40GB
$1.50–3.00
批处理
价格以美元/天计。费率因提供商而异——请查看 CLORE.AI 市场 以获取当前费率。
最后更新于
这有帮助吗?