ASR API 参考
Shisa ASR API 通过单个 JSON 请求将 base64 编码的音频转录为文本。本页介绍端点、请求参数、成功响应和错误处理。
端点
POST https://api.shisa.ai/asr/srt/audio_llm
使用带有 ASR 专用 shsk: 前缀的 bearer 令牌进行认证:
Authorization: Bearer YOUR_API_KEY
请求正文为 JSON,服务器会从音频的二进制头自动检测音频格式。
请求参数
| 参数 | 类型 | 是否必需 | 说明 |
|---|---|---|---|
audio | string | 必需 | base64 编码的音频数据(WAV、OGG、MP3 或 FLAC)。 |
language | string | 可选 | 语言代码(例如 "ja"、"en")。省略以进行自动语言检测(LID)。 |
hotwords | string[] | 可选 | 用于提高特定领域术语识别准确性的单词/短语数组。 |
temperature | float | 可选 | 采样温度。值越低,输出越确定。默认值: 0.0。 |
top_p | float | 可选 | 核采样参数。控制输出的多样性。默认值: 0.85。 |
frequency_penalty | float | 可选 | 对频繁出现的 token 进行惩罚以减少重复。默认值: 0.5。 |
repetition_penalty | float | 可选 | 对 token 重复进行惩罚;高于 1.0 的值会抑制重复。默认值: 1.05。 |
vad | integer | 可选 | 语音活动检测模式。默认值: 1。 |
备注
只有 audio 是必需的。语言会自动检测,调优参数使用合理的默认值——您可以发送快速开始中所示的最小请求,并仅在需要时添加参数。
成功响应
成功的请求返回一个 JSON 对象,包含转录文本、检测到或指定的语言以及置信度分数:
{
"text": "こんにちは、シサAIです。",
"language": "ja",
"confidence": 0.98
}
| 字段 | 说明 |
|---|---|
text | 从音频转录出的文本。 |
language | 检测到或指定的语言代码。 |
confidence | 转录置信度分数,从 0 到 1。 |
错误处理
错误返回一个 JSON 对象,包含一个 HTTP 风格的 code 和一条人类可读的 error 消息:
{
"code": 400,
"error": "No audio data provided"
}
401 认证错误
当 API 密钥缺失、无效或已过期时返回。请检查您的 Authorization 标头是否包含带 shsk: 前缀的有效令牌。
{
"context": ["authMiddleware"],
"code": 104,
"name": "ErrAuthenticationFailed",
"error": "Authentication error: Invalid token"
}
错误代码
| Code | 原因 | 错误消息 |
|---|---|---|
| 400 | 缺少 audio 字段或音频解码为空 | No audio data provided |
| 400 | 未进行 base64 编码或 base64 解码失败 | Invalid base64 audio data |
| 400 | 不支持的音频格式 | Unsupported audio format |
| 500 | 转录服务未就绪 | Transcription service not available |
| 500 | 后端故障 | Transcription failed: ... |