音频格式与语言
Shisa ASR接受多种常见格式的base64编码音频,并可以自动识别所说的语言。本页列出支持的格式,演示如何将音频编码为base64,并介绍语言选择。
支持的音频格式
将原始的 base64 编码音频数据传入 audio 字段。服务器会从二进制头自动检测格式——您无需自行声明格式。
| Format | MIME type | Detection |
|---|---|---|
| WAV | audio/wav | RIFF header |
| OGG | audio/ogg | OggS header |
| MP3 | audio/mpeg | ID3 tag or MPEG sync bytes |
| FLAC | audio/flac | fLaC header |
将音频编码为 base64
将任何受支持的文件转换为 base64,然后将其直接嵌入您的请求中:
# Encode any supported format to base64
base64 -w0 audio.ogg # Linux
base64 -i audio.ogg # macOS
# Use in a curl request
curl -s -XPOST 'https://api.shisa.ai/asr/srt/audio_llm' \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{ "audio": "'$(base64 -w0 audio.ogg)'" }'
语言检测(LID)
当您省略language参数时,当前ASR后端会检测所说的语言,并在响应中返回其代码。若要跳过检测并固定语言,请显式设置language(例如"ja"或"en")。
可用语言由选定后端决定;路由器不发布固定、完整的语言目录,也不据此验证。对于测试部署之外的语言,请在生产依赖前验证其行为。常见代码包括:
| Code | Language |
|---|---|
ja | Japanese |
en | English |
zh | Chinese |