首页 AI实时资讯内容详情

OpenAI 引入两种转录模型:低延迟、更好理解上下文

2026-08-03 2 暗号导航联盟

这玩意儿能听懂我说话吗?

说实话,每次语音转文字我都想砸手机。

背景噪音一多,它就开始胡言乱语。

但今天,OpenAI 放出了两个新模型。

有一个被称作GPT-4o-Live-Transcribe, 还有一个名为GPT-4o-Transcribe。

名字很长,但关键是——它说它听懂了口音。

价格到底贵不贵?

官方没说具体数字。

但根据以往套路,大概率是按分钟计费。

比 Whisper 贵一点?还是便宜?

我猜,贵,但值得。

毕竟它连“华南吴彦祖”这种梗都能识别。

口音问题真的解决了吗?

官方说,在22种语言上,错误率从40%降到19%。

几乎砍了一半。

九种语言的真实场景测试,错误率只有8.98%。

你想想,以前开会录音转文字,满屏的“嗯嗯啊啊”。

现在可能真的能看了。

实时转录和异步转录有啥区别?

联系上下文理解迷蒙的意思_延迟转化模型_

GPT-4o-Live-Transcribe 是用于直播的, GPT-4o-Live-Transcribe 是用于会议的。

你说一句,它转一句,延迟低到几乎感觉不到。

GPT-4o-Transcribe 是给录好的音频用的。

播客、采访、录音笔,丢进去,等它吐出来。

专业术语它也能搞定?

医生说“心肌梗死”,它不会写成“心机梗死”。

程序员说“API接口”,它不会写成“A片接口”。

这就很离谱了,以前这些词全是坑。

有上下文加持,准确率飙升

没有上下文,语义准确率41.6%。

给了上下文,直接飙到45.2%。

别小看这3.6%,在长对话里,差一点就是天壤之别。

所以,我该不该用?

如果你是做播客、做会议纪要、做字幕的。

别犹豫,直接上API。

如果你只是偶尔语音输入,等它集成到App里。

但说实话,8.98%的错误率,已经比很多人类打字员强了。

至少它不会嫌你说话慢。

相关标签: # OpenAI # 转录模型 # GPT-Live-Transcribe # GPT-Transcribe # 上下文理解