跳到主要内容

Shisa ASR

Shisa ASR​是​一​款​针对​日语​优化、​能​流畅​处理​英语、​专为​生产​工作​负载​而​构建​的​语音识别​(语音​转文字)​A​PI。​它​通过​单​个​JSON​请​求​将​口​语​音频​转换​为​准确​文本,​可以​自动​检测​所​说​的​语言,​并​允许​您​通过​自定​义​词​汇​增强​对​特定​领域​术语​的​识别。

POST https://api.shisa.ai/asr/srt/audio_llm

发送​ base64 ​编码​的​音频​(WAV、​OGG、​MP​3 ​或​ FLAC),​即​可​接​收转录​文本、​检测到​的​语言​和​置信度​分数。​只​有​ audio ​字段​是​必需​的​——​语言会​自动​检测,​调优​参数​使用​合理​的​默​认值。

为什么​选择​ Shisa ASR

  • 日语​优先​设计 — ​针对​日语​(含​地区​口音)​优化,​同时​流畅​支持​英语。
  • 实时​流式​传输 —​ 实时​处理​音​频流,​实现​实时​转录​和​即时​结果。
  • 语音​活动​检测 — ​可​在​启用​VAD时​返​回单​一​转录,​也​可​将​批​处理​音频拆分为​带时间​戳​的​语音​片段。
  • 企业​级​安全 —​ ​有关​数​据​处理​方式,​请​参阅 Shisa ​平台​上​的隐私​政策
  • 自定​义​词​汇 — ​通过​ hotwords 添​加行业​特定术语、​品牌​名称​和​自定​义​短语,​以​提高​准确性。

用​例

  • 呼叫​中心​分析 — ​自动​转录​客户​服务​电话,​用于​质量​保证、​合规、​坐席​培训​和​客户​情感​分析。
  • 会议​笔​记 — ​将​会议、​访谈​和​讨论​转换​为​可​搜索、​可​操作​的​文本​文档。
  • 字幕​和​说明​文字 — ​为​视频、​直播​和​广播实时​或​批处理生​成​准确​的​字幕。

后续​步​骤

  • 快速​开始 — ​使用​ c​u​rl、​Py​thon ​或​ JavaScript ​进行​您​的​首次​转录。
  • API ​参考 — ​请​求​参数、​响应​字段​和​错误​处理。
  • 音频​与​语言 — ​支持​的​格式​和​语言​选​择​行为。
  • 定​价 — ASR ​用量​如何​计费。