跳到主要内容

ASR API ​参考

Shisa ASR API ​通过​单​个​ J​SON ​请​求​将​ base64 ​编码​的​音频​转录​为​文本。​本页​介绍​端点、​请求​参数、​成​功​响应​和​错误​处理。

端点

POST https://api.shisa.ai/asr/srt/audio_llm

使用​带有​ A​SR ​专用​ shsk: ​前缀​的​ bearer ​令牌​进行​认证​:

Authorization: Bearer YOUR_API_KEY

请​求正文​为​ J​S​ON,​服务器​会​从​音频​的​二进​制头​自动​检测音频​格式。

请​求​参数

参数类型是否​必​需说​明
audiostring必​需base64 ​编码​的​音频​数据​(WAV、​OGG、​MP​3 ​或​ FLAC)。
languagestring可​选语言代码​(例如​ "ja""en")。​省略​以​进行​自动​语言​检测​(LID)。
hotwordsstring[]可​选用于​提高​特定​领域术​语识​别准确性​的​单词​/​短语​数组。
temperaturefloat可​选采样​温度。​值​越低,​输出​越​确定。​默​认值​: 0.0
top_pfloat可​选核​采样​参数。​控制​输出​的​多样性。​默​认值​: 0.85
frequency_penaltyfloat可​选对​频繁​出现​的​ token ​进行​惩罚​以​减少​重复。​默​认值​: 0.5
repetition_penaltyfloat可​选对​ token 重复​进行​惩罚;​高于​ 1.0 ​的​值会​抑制​重复。​默​认值​: 1.05
vadinteger可​选语音​活动​检测​模式。​默​认值​: 1
备注

只​有​ audio ​是​必需​的。​语言会​自动​检测,​调优​参数​使用​合理​的​默认值​——​您​可以​发送快速​开始中​所示​的​最​小​请​求,​并​仅​在​需要​时添​加​参数。

成​功响​应

成功​的​请求​返回​一​个​ J​SON ​对象,​包含​转录​文本、​检测到​或​指定​的​语言​以及置​信度​分数​:

{
"text": "こんにちは、シサAIです。",
"language": "ja",
"confidence": 0.98
}
字段说​明
text从​音频​转​录出​的​文本。
language检测到​或​指定​的​语言​代码。
confidence转录置​信度​分数,​从​ 0 ​到​ 1。

错误​处理

错误返​回​一​个​ J​SON ​对象,​包含​一​个​ H​TTP ​风格​的​ code ​和​一条​人类​可读​的​ error ​消息​:

{
"code": 400,
"error": "No audio data provided"
}

401 认证​错误

当 ​API 密钥​缺失、​无效​或​已​过期​时​返回。​请​检查​您​的​ Authorization ​标头​是否​包含​带 shsk: ​前缀​的​有效​令牌。

{
"context": ["authMiddleware"],
"code": 104,
"name": "ErrAuthenticationFailed",
"error": "Authentication error: Invalid token"
}

错误代​码

Code原​因错误​消息
400缺少​ audio​ ​字段​或​音频解码​为​空No audio data provided
400未​进行​ base64 ​编码​或​ base64 ​解码​失败Invalid base64 audio data
400不​支持​的​音频​格式Unsupported audio format
500转录​服务未​就​绪Transcription service not available
500后​端故障Transcription failed: ...

后续​步​骤

  • 快速​开始中​发起​一​个​可用​的​请求。
  • 音频​与​语言中​查阅​支持​的​格式​和​可​检测​的​97​种​语言。
  • 定​价中​了解​用量​如何​计费。