跳到内容

免费工具

语音转文字

按下麦克风开始说话,文字会随着你的话语实时出现,支持35种语言,使用的是浏览器自带的语音识别引擎。无需注册,本站不保存任何内容。

  • 在浏览器中运行
  • 不存储任何内容
  • 无需注册

将文件拖到这里

支持 MP3、M4A、WAV、OGG/OPUS、AAC、FLAC 和 WEBM 格式

使用方法

语音转文字,三步完成

01

选择语言,按下麦克风

浏览器会请求一次麦克风权限。可选35种语言。

02

边说边看文字浮现

临时识别的词先显示为灰色,每句话说完后就会定形为正式文字。

03

复制或下载

在文本框中编辑,然后复制文字或保存为.txt。本站不会保存任何内容。

用说话的速度打字

大多数人说话时每分钟130到150个词,但打字每分钟只有40个词左右。口述功能弥补了这个差距——无论是脑海中直接输出的初稿、一封邮件、通话后的记录,还是手指打起来太长的消息。这个页面能在你说话的同时把语音转换成可编辑的文字,无需注册,也无需安装任何东西。

工作原理

该页面使用的是浏览器自带的语音识别功能——Web Speech API。在Chrome和Edge中,这是谷歌的引擎;在Mac、iPhone和iPad上的Safari中,这是苹果的引擎。音频从你的麦克风传到该引擎,文字随即返回;本站从不接收音频,也不保存任何内容。文字会保留在页面上的文本框中(草稿会保存在浏览器自身的存储中,因此刷新页面不会丢失),完成后你可以复制或下载。Firefox没有语音识别引擎,所以那里显示的是提示文字,而不是麦克风按钮。

获得干净的文字

  • 开始前先选择语言——选择器里列出了35种语言,引擎会按你选的那种语言来识别。
  • 用完整的句子说话;引擎会根据你的停顿和语调添加标点,这在完整短语上比单个词效果更好。
  • 想让标点精确落在你想要的位置,可以直接说出标点的名称:"逗号"、"句号"、"换行"在Chrome的大多数语言中都能识别。
  • 长时间沉默后引擎会自动暂停,页面会重新启动它,你只需继续说话。
  • 文本框就是普通的文本区域:点击任意位置即可手动修正某个词。

它做不到的事

实时口述只能处理你现在正在说的话。它无法转录文件、他人的录音,或已经发生过的会议,而且在Chrome中需要联网。如果要处理录音文件,可以使用本站的文件工具——任意音频的前5分钟免费。如果时长更长,或者需要带说话人标签的转录稿、摘要和可搜索的资料库,SozAI应用可以录制和导入任意长度的音频,前30分钟免费。

答案

语音转文字常见问题

哪些浏览器支持实时语音转文字?

桌面端和Android上的Chrome、Edge,以及Mac、iPhone和iPad上的Safari都支持。Firefox没有语音识别引擎,所以该页面会显示提示文字,而不是麦克风按钮。

我的语音会被发送到别处吗?

会发送到浏览器自带的语音识别引擎——Chrome和Edge使用谷歌的引擎,Safari使用苹果的引擎——这正是浏览器将语音转换成文字的方式。语音不会发送到本站,本站也不会保存关于这次会话的任何信息。

离线也能用吗?

Chrome的语音识别需要联网。如果在系统设置中为某语言开启了离线口述功能,Safari可能会在设备本地完成识别;否则它同样需要联网。

支持哪些语言的口述?

共35种,包括英语、西班牙语、葡萄牙语、法语、德语、意大利语、荷兰语、波兰语、俄语、乌克兰语、哈萨克语、土耳其语、阿拉伯语、希伯来语、印地语、印度尼西亚语、马来语、越南语、泰语、日语、韩语和中文。请在按下麦克风之前先选好语言。

为什么说一会儿它就会停下来?

引擎在一段静默之后会结束当前会话,在某些手机上大约一分钟左右也会结束。页面会自动重新启动它,直到你按下停止键,文字才会持续不断地生成。

它能转录录音或别人说的话吗?

不能。它只识别当下麦克风收到的声音。如果要转录文件,请使用本站的音频工具——前5分钟免费——或使用SozAI应用来处理带说话人标签的完整录音。

怎样添加标点和换行?

引擎主要根据你的停顿自动添加大部分标点。在Chrome的大多数语言中,说出"逗号"、"句号"或"换行"可以把它们精确地放在你想要的位置;Safari则会自行插入标点。

关闭标签页后我的文字还保留吗?

草稿会保存在这台设备浏览器自身的存储中,重新打开页面就能恢复。它从不会发送到本站。使用"清除"按钮即可删除它。

完整录音,而非仅前几分钟

在 App 中录制或导入任意时长的录音:说话人标注、时间戳、摘要,以及100+种语言的翻译。

获取 App — 免费

iOS 和 Android 均可免费使用,含30分钟转录时长,无需绑卡。