爱

爱柯语音识别 · 接口测试台

多语种语音识别 · 字幕与歌词时间轴一键提取

连接中… 额度 —
1

音频输入

≤ 25 MB / ≤ 60 分钟
♪
拖入音频文件,或点击选择
wav / mp3 / m4a / ogg / flac / webm
2

请求参数

按需调整
3

测试场景

每次识别都会统计耗时、音频时长与实时率,并自动核对输出形态是否符合规范。
4

字幕 / 歌词提取

字幕识别独有
请求 response_format=srt / vtt 得到字幕文件正文;请求 verbose_json 得到 segments(整句字幕行)与 words(词级时间戳)。两次各一次请求,结果都能下载。
5

识别结果

尚未发起请求
◍ 先选好音频,再点「单次识别」或任一测试场景。
i

这个接口是什么

爱柯语音识别 是一套多语种语音识别接口,覆盖吉尔吉斯语、俄语、哈萨克语、乌兹别克语与英语, 适合字幕生成、通话与会议记录初稿、语音内容检索等场景。

  • 语种自动判断:不需要指定 language,一段音频里混说两种语言也能识别,无需事先切分。
  • 输出形态:全小写、不含标点,数字展开为文字(如 1767ж → бири миң жети жүз алтымыш жетинчи жыл)。
  • 速度:约音频时长的 1/100,长音频由服务端自动切分拼接。
  • 纯静音 / 纯噪声返回空文本,不会凭空生成内容。
  • 字幕与时间戳:response_format=srt / vtt 直接返回字幕文件正文; verbose_json 额外返回 segments(整句字幕行)与 words(词级时间戳)。 断行规则为「停顿 ≥ 0.6 秒、或单行超 42 字符 / 7 秒」。
  • 时间戳精度约 40 毫秒,来自模型内部帧对齐,不是 forced alignment—— 适合做字幕,不适合精准音画同步或卡拉 OK 逐字高亮。
  • 「爱柯字幕识别」支持字幕文件与词级时间戳;「爱柯语音识别」只返回文本, 但输出标点与大小写、数字保持原样。两者的差异在「双模型横向对比」里会并排显示。

本站为测试用途,单次识别限 25 MB / 60 分钟以内的音频。