跳到主要内容

音频​格式​与​语言

Shisa ASR​接受​多​种​常见​格式​的​base64​编码​音频,​并​可以​自动识别所​说​的​语言。​本页列​出​支持​的​格式,​演示​如何​将​音​频​编码​为​base​64,​并​介绍​语言​选择。

支持​的​音频​格式

将​原始​的​ base64 ​编码​音频数​据​传入​ audio ​字段。​服务器​会​从​二进制头​自动​检测​格式​——​您​无​需​自行声明​格式。

FormatMIME typeDetection
WAVaudio/wavRIFF header
OGGaudio/oggOggS header
MP3audio/mpegID3 tag or MPEG sync bytes
FLACaudio/flacfLaC header

将​音频​编码​为​ base64

将​任何​受​支持​的​文件​转换​为​ base​64,​然后​将​其​直接​嵌入​您​的​请求​中:

# Encode any supported format to base64
base64 -w0 audio.ogg # Linux
base64 -i audio.ogg # macOS

# Use in a curl request
curl -s -XPOST 'https://api.shisa.ai/asr/srt/audio_llm' \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{ "audio": "'$(base64 -w0 audio.ogg)'" }'

语言​检测​(LID)

当​您​省​略language参数​时,​当​前​ASR后​端会​检测​所​说​的​语言,​并​在​响应​中返​回其​代码。​若要​跳过​检测​并​固定​语言,​请​显式​设置language(例如"ja""en")。

可​用​语言​由​选定​后​端​决定;​路​由​器​不​发布​固定、​完整​的​语言​目录,​也​不​据​此验证。​对于​测试​部署​之外​的​语言,​请​在​生产​依赖​前验证​其​行为。​常见​代码​包括:

CodeLanguage
jaJapanese
enEnglish
zhChinese

后续​步​骤