Shisa ASR
Shisa ASR 是一款针对日语优化、能流畅处理英语、专为生产工作负载而构建的语音识别(语音转文字)API。它通过单个 JSON 请求将口语音频转换为准确的文本,跨97种语言自动检测所说的语言,并允许您通过自定义词汇增强对特定领域术语的识别。
POST https://api.shisa.ai/asr/srt/audio_llm
发送 base64 编码的音频(WAV、OGG、MP3 或 FLAC),即可接收转录文本、检测到的语言和置信度分数。只有 audio 字段是必需的——语言会自动检测,调优参数使用合理的默认值。
为什么选择 Shisa ASR
- 多方言支持 — 准确识别标准日语以及关西、东北和其他地区方言。
- 实时流式传输 — 实时处理音频流,实现实时转录和即时结果。
- 说话人分离 — 自动识别和分离对话中的多个说话人。
- 极速处理 — 使用优化的推理管道在几分钟内处理数小时的音频。
- 企业级安全 — 符合 SOC 2 标准,具有端到端加密和安全音频处理。
- 自定义词汇 — 通过
hotwords添加行业特定术语、品牌名称和自定义短语,以提高准确性。
用例
- 呼叫中心分析 — 自动转录客户服务电话,用于质量保证、合规、坐席培训和客户情感分析。
- 会议笔记 — 将会议、访谈和讨论转换为可搜索、可操作的文本文档。
- 字幕和说明文字 — 为视频、直播和广播实时或批处理生成准确的字幕。