说实话,每次语音转文字我都想砸手机。
背景噪音一多,它就开始胡言乱语。
但今天,OpenAI 放出了两个新模型。
有一个被称作GPT-4o-Live-Transcribe, 还有一个名为GPT-4o-Transcribe。
名字很长,但关键是——它说它听懂了口音。
官方没说具体数字。
但根据以往套路,大概率是按分钟计费。
比 Whisper 贵一点?还是便宜?
我猜,贵,但值得。
毕竟它连“华南吴彦祖”这种梗都能识别。
官方说,在22种语言上,错误率从40%降到19%。
几乎砍了一半。
九种语言的真实场景测试,错误率只有8.98%。
你想想,以前开会录音转文字,满屏的“嗯嗯啊啊”。
现在可能真的能看了。

GPT-4o-Live-Transcribe 是用于直播的, GPT-4o-Live-Transcribe 是用于会议的。
你说一句,它转一句,延迟低到几乎感觉不到。
GPT-4o-Transcribe 是给录好的音频用的。
播客、采访、录音笔,丢进去,等它吐出来。
医生说“心肌梗死”,它不会写成“心机梗死”。
程序员说“API接口”,它不会写成“A片接口”。
这就很离谱了,以前这些词全是坑。
没有上下文,语义准确率41.6%。
给了上下文,直接飙到45.2%。
别小看这3.6%,在长对话里,差一点就是天壤之别。
如果你是做播客、做会议纪要、做字幕的。
别犹豫,直接上API。
如果你只是偶尔语音输入,等它集成到App里。
但说实话,8.98%的错误率,已经比很多人类打字员强了。
至少它不会嫌你说话慢。
相关标签: # OpenAI # 转录模型 # GPT-Live-Transcribe # GPT-Transcribe # 上下文理解