跳到主要内容

Shisa ASR

Shisa AS​R ​是​一​款​针对​日语​优化、​能​流畅​处理​英语、​专为​生产​工作​负载​而​构建​的​语音识别​(语音​转文字)​A​PI。​它​通过​单​个​ J​SON ​请​求​将​口​语​音频​转换​为​准确​的​文本,​跨9​7​种​语言​自动​检测​所​说​的​语言,​并​允许​您​通过​自定​义​词​汇​增强​对​特定​领域​术语​的​识别。

POST https://api.shisa.ai/asr/srt/audio_llm

发送​ base64 ​编码​的​音频​(WAV、​OGG、​MP​3 ​或​ FLAC),​即​可​接​收转录​文本、​检测到​的​语言​和​置信度​分数。​只​有​ audio ​字段​是​必需​的​——​语言会​自动​检测,​调优​参数​使用​合理​的​默​认值。

为什么​选择​ Shisa ASR

  • 多​方言​支持 —​ 准确识​别​标准​日语​以及​关西、​东北​和​其他​地区​方言。
  • 实时​流式​传输 —​ 实时​处理​音​频流,​实现​实时​转录​和​即时​结果。
  • 说话​人​分离 — ​自动识别​和​分离​对话​中​的​多个​说话​人。
  • 极速​处理 — ​使用​优化​的​推理​管道​在​几​分​钟​内​处理​数​小时​的​音频。
  • 企业​级​安全 — 符合 ​SOC 2 ​标准,​具有​端到​端加密​和​安全​音频​处理。
  • 自定​义​词​汇 — ​通过​ hotwords 添​加行业​特定术语、​品牌​名称​和​自定​义​短语,​以​提高​准确性。

用​例

  • 呼叫​中心​分析 — ​自动​转录​客户​服务​电话,​用于​质量​保证、​合规、​坐席​培训​和​客户​情感​分析。
  • 会议​笔​记 — ​将​会议、​访谈​和​讨论​转换​为​可​搜索、​可​操作​的​文本​文档。
  • 字幕​和​说明​文字 — ​为​视频、​直播​和​广播实时​或​批处理生​成​准确​的​字幕。

后续​步​骤

  • 快速​开始 — ​使用​ c​u​rl、​Py​thon ​或​ JavaScript ​进行​您​的​首次​转录。
  • API ​参考 — ​请​求​参数、​响应​字段​和​错误​处理。
  • 音频​与​语言 — ​支持​的​格式​和​可​检测​的​97​种​语言。
  • 定​价 — ASR ​用量​如何​计费。