多语种语音识别 · 字幕与歌词时间轴一键提取
response_format=srt / vtt 得到字幕文件正文;请求 verbose_json
得到 segments(整句字幕行)与 words(词级时间戳)。两次各一次请求,结果都能下载。
爱柯语音识别 是一套多语种语音识别接口,覆盖吉尔吉斯语、俄语、哈萨克语、乌兹别克语与英语, 适合字幕生成、通话与会议记录初稿、语音内容检索等场景。
1767ж → бири миң жети жүз алтымыш жетинчи жыл)。response_format=srt / vtt 直接返回字幕文件正文;
verbose_json 额外返回 segments(整句字幕行)与 words(词级时间戳)。
断行规则为「停顿 ≥ 0.6 秒、或单行超 42 字符 / 7 秒」。本站为测试用途,单次识别限 25 MB / 60 分钟以内的音频。