ASR 快速开始
本指南将引导您完成针对 Shisa ASR 的首次转录。您需要一个 API 密钥——在 Shisa 平台中创建一个。新账户包含**$10 的免费额度**。
1. 获取您的 API 密钥
注册 Shisa AI 账户,并从 Shisa 平台获取您的 API 密钥。将其带上 shsk: 前缀,放入 Authorization 标头中:
Authorization: Bearer YOUR_API_KEY
注意
Shisa API 密钥以 shsk: 开头。请将完整密钥(包含 shsk: 前缀)放入 Authorization: Bearer YOUR_API_KEY 请求头。令牌缺失或格式不正确会返回 401 错误。
提示
请勿将 API 密钥纳入源代码管理。在实际应用中,应从环境变量(例如 SHISA_API_KEY)中读取它。
2. 准备您的音频
API 接受 WAV、OGG、MP3 或 FLAC 格式的 base64 编码音频。请先将任何受支持的文件编码为 base64:
base64 -w0 audio.ogg # Linux
base64 -i audio.ogg # macOS
3. 发起请求
将 base64 编码的音频放入 audio 字段,向端点发送 POST 请求。
curl
curl -s -XPOST 'https://api.shisa.ai/asr/srt/audio_llm' \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"audio": "'$(base64 -w0 audio.ogg)'"
}'
Python
import base64
import requests
# Read and encode audio file
with open("audio.ogg", "rb") as f:
audio_data = base64.b64encode(f.read()).decode("utf-8")
url = "https://api.shisa.ai/asr/srt/audio_llm"
headers = {
"Authorization": "Bearer YOUR_API_KEY",
"Content-Type": "application/json"
}
payload = {
"audio": audio_data
}
response = requests.post(url, headers=headers, json=payload)
response.raise_for_status()
print(response.json())
JavaScript
async function transcribeAudio(audioFile) {
// Read file and convert to base64
const fileBuffer = await audioFile.arrayBuffer();
const base64Audio = btoa(
new Uint8Array(fileBuffer).reduce(
(data, byte) => data + String.fromCharCode(byte),
''
)
);
const response = await fetch('https://api.shisa.ai/asr/srt/audio_llm', {
method: 'POST',
headers: {
'Authorization': 'Bearer YOUR_API_KEY',
'Content-Type': 'application/json'
},
body: JSON.stringify({
audio: base64Audio
})
});
if (!response.ok) {
throw new Error(`API request failed: ${response.status}`);
}
return await response.json();
}
// Example usage with file input
document.querySelector('#audioInput').addEventListener('change', async (e) => {
const file = e.target.files[0];
if (file) {
const result = await transcribeAudio(file);
console.log('Transcription:', result);
}
});
备注
只有 audio 字段是必需的。语言会自动检测,调优参数使用合理的默认值。要指定特定语言或添加领域术语,请参阅 API 参考。
4. 读取响应
API 返回一个 JSON 响应,包含转录文本、检测到的语言和置信度分数:
{
"text": "こんにちは、シサAIです。",
"language": "ja",
"confidence": 0.98
}