直接对接每一个语音模型厂商需要维护多套API密钥、计费规则和接口文档,接入成本较高。通过一个支持多模型聚合的中转站,只需配置统一的Base URL和API Key,就能在Whisper、Deepgram、SenseVoice等模型之间自由切换。千聚AI中转站提供兼容OpenAI调用方式的语音转文字接口,让原有代码改动最小,更适合需要快速集成多个语音模型的项目。
第一步:注册账号并获取API Key
- 访问 千聚AI中转站官网,完成手机号或邮箱注册。
- 登录后进入“API Key”管理页面,创建一个新Key并复制保存。注意:Key只显示一次,请妥善保管。
- 在“Token购买”页面按需充值Token。语音转文字模型按音频时长计费,不同模型费率不同,具体价格可前往官网查看实时信息。
第二步:配置Base URL与模型名称
千聚的Base URL地址固定统一,语音转文字接口路径与OpenAI格式一致。以下为Python调用示例,只需替换三个变量:
api_key = “sk-你的千聚API Key”
base_url = “https://api.token88.cc/v1”
model = “whisper-1” # 也可使用sensevoice或其他模型
第三步:编写语音转文字调用代码
使用OpenAI Python SDK即可完成调用,无需额外安装库:
from openai import OpenAI
client = OpenAI(api_key=api_key, base_url=base_url)
with open(“audio.mp3”, “rb”) as f:
transcript = client.audio.transcriptions.create(
model=model,
file=f
)
print(transcript.text)
返回结果即为识别文本,支持多种音频格式。如需切换模型,仅需修改model参数,例如将“whisper-1”改为“sensevoice-1”。
常见语音转文字模型对比
| 模型名称 | 适用场景 | 特点 |
|---|---|---|
| whisper-1 | 通用中英文、多语种 | 稳定性高,社区生态成熟 |
| sensevoice-1 | 中文优化、长音频 | 中文识别表现更佳 |
| deepgram-1 | 实时流式转写 | 低延迟,适合即时场景 |
模型列表和Token价格会随厂商调整,请以 立即访问千聚 官网的实时信息为准。
Token与余额管理建议
千聚提供统一的余额管理页面,所有模型消耗均从同一账户扣减,方便预算控制。建议在调用前先通过官网查看各模型的Token单价,根据音频量选择合适档位。语音转文字模型通常按“每分钟音频”扣费,不同模型费率不同,统一管理能有效降低多平台切换成本。
开始你的第一次调用
完成以上三步,你已经学会了通过千聚中转站快速调用语音转文字模型。如果遇到模型名称不生效或返回错误,先确认Base URL末尾是否带“/v1”,再检查API Key权限和Token余额。
下一步行动:
访问 千聚AI中转站官网 查看完整模型列表,购买Token后获取API Key,立即开始你的语音转文字开发吧。