AIFLOWBRIDGE · XUNFEI

多模态识别中心

分别上传录音、PDF、DOCX 或图片;也支持麦克风实时转写。手机端会按文件类型打开对应的文件选择器。

图片识别无需访问令牌;其他能力需要令牌。
手机端分类型上传

选择识别功能

录音文件转文字

支持 WAV、MP3、M4A、AAC、FLAC、OGG、AMR、WMA、MP4 等;一次最多 10 个。

PDF 文档识别

一次最多 10 个;每份最多 100 页,不支持带密码或权限加密的 PDF。

Word 文档识别

一次最多 10 个 DOCX;提取正文、表格,并自动识别文档中的图片。

图片文字识别

支持 JPG、JPEG、PNG、BMP,一次最多 10 个。手机端无需访问令牌。

已知说话人

注册声纹

上传一段只有该说话人发声的 10–60 秒未压缩 WAV。注册后,实时转写会尝试把“说话人 1/2”显示为姓名;不注册也会自动盲分。

输入访问令牌后刷新列表。

实时 WebSocket

麦克风实时语音转文字

开始后会将 16kHz PCM 音频流实时发送给讯飞,自动区分说话人;已注册声纹时优先显示姓名。