Shisa ASR
Shisa ASR是一款针对日语优化、能流畅处理英语、专为生产工作负载而构建的语音识别(语音转文字)API。它通过单个JSON请求将口语音频转换为准确文本,可以自动检测所说的语言,并允许您通过自定义词汇增强对特定领域术语的识别。
POST https://api.shisa.ai/asr/srt/audio_llm
发送 base64 编码的音频(WAV、OGG、MP3 或 FLAC),即可接收转录文本、检测到的语言和置信度分数。只有 audio 字段是必需的——语言会自动检测,调优参数使用合理的默认值。
为什么选择 Shisa ASR
- 日语优先设计 — 针对日语(含地区口音)优化,同时流畅支持英语。
- 实时流式传输 — 实时处理音频流,实现实时转录和即时结果。
- 语音活动检测 — 可在启用VAD时返回单一转录,也可将批处理音频拆分为带时间戳的语音片段。
- 企业级安全 — 有关数据处理方式,请参阅 Shisa 平台上的隐私政策。
- 自定义词汇 — 通过
hotwords添加行业特定术语、品牌名称和自定义短语,以提高准确性。
用例
- 呼叫中心分析 — 自动转录客户服务电话,用于质量保证、合规、坐席培训和客户情感分析。
- 会议笔记 — 将会议、访谈和讨论转换为可搜索、可操作的文本文档。
- 字幕和说明文字 — 为视频、直播和广播实时或批处理生成准确的字幕。