> 自媒体 > (AI)人工智能 > 能听懂语音的ChatGPT来了:10小时录音扔进去,想问什么问什么
能听懂语音的ChatGPT来了:10小时录音扔进去,想问什么问什么
来源:机器之心Pro
2023-06-03 14:46:04
423
管理

机器之心报道

编辑:张倩

类 ChatGPT 模型的输入框里可以粘贴语音文档了。

大型语言模型(LLM)正在改变每个行业的用户期望。然而,建立以人类语音为中心的生成式人工智能产品仍然很困难,因为音频文件对大型语言模型构成了挑战。

将 LLM 应用于音频文件的一个关键挑战是,LLM 受其上下文窗口的限制。在一个音频文件能够被送入 LLM 之前,它需要被转换成文本。音频文件越长,绕过 LLM 的上下文窗口限制的工程挑战就越大。但工作场景中,我们往往需要 LLM 帮我们处理非常长的语音文件,比如从一段几个小时的会议录音中抽取核心内容、从一段访谈中找到某个问题的答案……

最近,语音识别 AI 公司 AssemblyAI 推出了一个名为 LeMUR 的新模型。就像 ChatGPT 处理几十页的 PDF 文本一样,LeMUR 可以将长达 10 小时的录音进行转录、处理,然后帮用户总结语音中的核心内容,并回答用户输入的问题。

试用地址:https://www.assemblyai.com/playground/v2/source

LeMUR 是 Leveraging Large Language Models to Understand Recognized Speech(利用大型语言模型来理解识别的语音)的缩写,是将强大的 LLM 应用于转录的语音的新框架。只需一行代码(通过 AssemblyAI 的 Python SDK),LeMUR 就能快速处理长达 10 小时的音频内容的转录,有效地将其转化为约 15 万个 token。相比之下,现成的、普通的 LLM 只能在其上下文窗口的限制范围内容纳最多 8K 或约 45 分钟的转录音频。

LeMUR 解锁了一些惊人的新可能性,在几年前,我认为这些都是不可能的。它能够毫不费力地提取有价值的见解,如确定最佳行动,辨别销售、预约或呼叫目的等呼叫结果,感觉真的很神奇。—— 电话跟踪和分析服务技术公司 CallRail 首席产品官 Ryan Johnson

LeMUR 解锁了什么可能性?

将 LLM 应用于多个音频文本

LeMUR 能够让用户一次性获得 LLM 对多个音频文件的处理反馈,以及长达 10 小时的语音转录结果,转化后的文本 token 长度可达 150K 。

转录之后的界面如下:

在页面右侧,我们可以要求 LeMUR 总结采访内容或回答问题。LeMUR 基本可以轻松地完成任务:

不过,LeMUR 似乎目前还不支持中文。感兴趣的读者可以去尝试一下。

0
点赞
赏礼
赏钱
0
收藏
免责声明:本文仅代表作者个人观点,与本站无关。其原创性以及文中陈述文字和内容未经本网证实,对本文以及其中全部或者 部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。 凡本网注明 “来源:XXX(非本站)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对 其真实性负责。 如因作品内容、版权和其它问题需要同本网联系的,请在一周内进行,以便我们及时处理。 QQ:617470285 邮箱:617470285@qq.com
相关文章
解除时间限制,深度绑定ChatGPT的必应搜索能彻底击败谷歌吗?..
界面新闻记者 | 李京亚界面新闻编辑 | 微软创始人比尔·盖茨本周一表示,..
重磅!ChatGPT正式发布App,可在苹果应用商店下载,安卓版也不远了..
每经编辑:毕陆名在手机上也能玩ChatGPT了!当地时间周四(5月18日),人..
GPT-4发布比上一代强在哪?幻觉和偏见显著减少
在震惊科技行业的AI聊天机器人ChatGPT发布近四个月后,OpenAI公司又发布..
ChatGPT 之父 Sam Altman:GPT-4 是人类迄今最复杂的软件
整理 | 邓晓娟 责编 | 梦依丹出品 | CSDN(ID:CSDNnews)3月20日,OpenA..
史上最糟 AI 诞生!他用亿条恶臭帖子,训练出口吐芬芳的聊天机器人..
「过来聊一会儿。」「你个大撒比~」调皮的语气掩盖不了骂人的本质,这只..
ChatGPT流量下滑、大模型热度骤降,科技大厂蹭了个寂寞?..
火了大半年的大模型,争议也逐渐多了起来。先是作为弄潮儿的ChatGPT被爆..
海外 | 通用汽车探索在车辆中使用ChatGPT,称聊天机器人将无处不在..
文:懂车帝原创 常思玥[懂车帝原创 行业] 日前,据外媒报道,通用汽车正..
谷歌、ChatGPT、百度聊天机器人大pk,人类准备好迎接AI天下了吗..
此外,皮查伊还表示,Bard将能“利用网络信息提供新鲜、高质量的回复”,..
一天内3玩家入局,ChatGPT概念持续引关注,机构:注意“降温”风险..
本文共2177字阅读完约4分钟金融投资报记者 陈雨禾A股上市公司昆仑万维(3..
关于作者
锦阳(普通会员)
文章
486
关注
0
粉丝
0
点击领取今天的签到奖励!
签到排行

成员 网址收录40335 企业收录2981 印章生成194840 电子证书832 电子名片53 自媒体26195

@2022 All Rights Reserved 浙ICP备19035174号-7
0
0
分享
请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索