Alexa 做了一次人工智能大脑移植,现在它有多聪明?
本文信息来源:nytimes
亚马逊用了好几年时间克服技术难题,利用新的人工智能技术重塑其语音助手。

这几年我一直在等着 Alexa 的人工智能进化。
我做了十多年忠实的 Alexa 用户,Alexa 是为亚马逊家庭设备和智能音箱提供语音助手的技术。我在房子里散布着五个支持 Alexa 的音箱,虽然我并不把它们用来做什么复杂的事情——播放音乐、设定计时器和查询天气基本就是全部——但它们在擅长的事情上表现不错。
但自从 2023 年 ChatGPT 增加了能以流畅对话方式回答问题的 AI 语音模式以来,显而易见 Alexa 需要一次“脑部移植”——围绕与 ChatGPT 及其他产品相同的大型语言模型(L.L.M.)构建的新 AI 系统。基于大型语言模型的系统比旧系统更聪明、更通用。它们能处理更复杂的请求,使其成为下一代语音助手的明显选择。
亚马逊也承认。过去几年里,该公司一直在加紧升级 Alexa 内部的人工智能。这是一场艰难的推进。替换语音助手内部的 AI 技术并不像换一个新模型那么简单,Alexa 的改造据报道在此过程中因内部斗争和技术挑战而被推迟。大型语言模型也并非与此类产品完全契合,这类产品不仅需要与大量既有服务和数以百万计的支持 Alexa 的设备配合运行,还需要可靠地完成基本任务。
但终于,全新的 Alexa —— 被称为 Alexa+ —— 来了。它是一次大规模且雄心勃勃的改造 ,试图将生成式人工智能聊天机器人的对话能力与旧版 Alexa 擅长的日常任务结合起来。
Alexa+ 已通过早期体验计划向测试人员开放了几个月,现在正在更广泛地部署。上周我在购买了一台兼容设备(Echo Show 8,配备八英寸屏幕)并注册升级版后收到了它。(Prime 会员将免费获得 Alexa+,非 Prime 会员则需每月支付 19.99 美元。)
《纽约时报》 最近宣布与亚马逊达成许可协议,允许亚马逊在其人工智能系统(包括 Alexa+)中使用时报内容。《纽约时报》还起诉了 ChatGPT 的制造商 OpenAI 和微软,指控其在训练人工智能系统时涉嫌侵犯版权。
两步进,一步退
对同是 Alexa 粉丝的我来说,有好消息也有坏消息。
好消息是,新的 Alexa+ 确实比旧版更有趣,合成语音更逼真,语调也更接近人类。(有八种声音可选;我使用的是默认设置,一种轻快的女性声音。)
我也很喜欢 Alexa+ 的一些新功能,比如预订餐厅座位、生成长篇故事并朗读给我三岁的孩子听。

新的 Alexa 在处理多步骤请求方面也更出色。“为厨房设置三个定时器,分别为 15、25 和 45 分钟”以及“为圣地亚哥的一日游写一份行程并发到我的邮箱”是两个对我有效的示例指令。
Alexa+ 也不要求每次对话都说唤醒词,因此你可以来回交谈或追问,这是一个不错的改变。
坏消息是,尽管具备了新功能,Alexa+ 仍然漏洞百出、不可靠,我无法推荐。在我的测试中,它不仅落后于 ChatGPT 的语音模式和我试用过的其他人工智能语音助手,而且在一些基本任务上明显不如原来的 Alexa。
有一次早晨我让 Alexa+ 取消一个闹钟——这是我以前对旧版 Alexa 屡次无障碍的请求——它却干脆无视了我。
当我把一篇研究论文发到 alexa@alexa.com,以便在我洗碗时听 Alexa+ 对其进行总结时,我收到一条错误信息,称无法找到该文档。

Alexa+ 也编造了一些事实并犯了些莫名其妙的错误。当我让它查找 Wirecutter 推荐的方形刨丝器并把它加入我的亚马逊购物车时,它回答说“根据 Wirecutter,最好的方形刨丝器是 OXO Good Grips 方形刨丝器。”而 Wirecutter 的实际方形刨丝器推荐是 Cuisipro 4 面方形刨丝器。幸好我在下单前发现了这个错误。当我请 Alexa+ 指导我在笔记本电脑上安装新的 A.I. 模型时,它卡住了并开始重复说,“哦,不,我的线路混乱了。”
我无法使用亚马逊宣传的一些新的 Alexa+ 功能,比如进入房间时触发多项动作的“例行程序”功能。(我本想让 Alexa+ 在早晨用鼓舞人心的演讲和高音量的《虎之眼》来迎接我,但一位亚马逊发言人称,感应存在的功能尚未启用。)
负责 Alexa 和 Echo 的亚马逊副总裁 Daniel Rausch 本周在一次播客采访中告诉我,随着 Alexa+ 更广泛地推出并且更多功能上线,许多这些缺陷很快就会得到修复。
“我们还有一些棱角要打磨,”他说。
Alexa,给我写 500 字关于厨房计时器的历史
Rausch 先生说,把生成式人工智能模型整合进 Alexa 的最大挑战在于它们本质上是不同类型的系统。
他说,旧版 Alexa 建立在一套复杂的基于规则的确定性算法网络之上。设定计时器、在 Spotify 上播放歌曲、关掉客厅的台灯——所有这些功能都需要调用不同的工具并连接不同的接口,而且都必须逐一编程。
添加生成式人工智能到 Alexa,迫使亚马逊重建许多这些流程,Rausch 先生说。他表示,大型语言模型是“随机的”,意味着它们基于概率而非一套严格的规则运行。这使得 Alexa 更有创造力,但可靠性下降。

这也让语音助手变慢。Rausch 先生回忆起一次早期内部演示,Alexa+播放一首歌用了超过 30 秒,他形容这是“令人痛苦的”延迟,这促使团队重新思考他们的方法。
“当这些模型遵循一套深层指令时,响应会很慢,”他说。“我们在要求它们做一件相当难的事。”
另一项需要克服的挑战是生成式人工智能的冗长,Rausch 先生说。最初,当工程师将 Alexa 接入大型语言模型时,系统有时会给出冗长的回答,或引入不必要的复杂性。Alexa+ 可能会在用户请求设置一个 10 分钟厨房定时器时,给出一篇关于厨房定时器历史的 500 字论文。
Rausch 先生说,解决办法是花了好几年时间将 70 多个 AI 模型——其中一些是亚马逊的专有模型,另一些来自外部供应商,如 Anthropic 的 Claude——整合到一个基于语音的界面中,并配以一个编排系统,将用户的请求路由到最适合处理该请求的模型。
“当它运行得非常好时,神奇之处在于让这些新的与 Alexa 交谈的方式与那些可预测的结果或行为接口化,”他说。
学习一门新语言
还有其他障碍。Rausch 先生说,其中之一是许多长期用户已经学会了“用 Alexa 的语言”说话,把他们日常的请求表述成那些他们知道系统能理解的熟悉指令。
但 Alexa+以更流畅的方式处理语言。用户可以像与人类交谈一样与它对话——不需要那种机器人式的简化语——这可能需要一些重新适应。
我认为许多缺陷会被逐步修复,大多数用户也会适应与 Alexa+交流的新方式。我也倾向于对亚马逊适当宽容一些,因为把基于大型语言模型的技术构建进一个可靠的语音助理似乎是一个棘手的技术问题,而且也没人真正解决过这个难题。(苹果多年来一直在努力为 Siri 进行人工智能升级,显然也没做到。)
我也不认为 Alexa+ 的局限性就说明生成式人工智能模型本质上不可靠,或永远无法作为个人语音助手发挥作用。归根结底,我认为把生成式人工智能与旧有的传统系统结合起来非常困难——这是许多公司(无论是否来自科技行业)现在都在用血的教训学到的——要把所有问题都解决需要时间。
现在,我打算把我的设备降级回较旧、智能较低的 Alexa 版本,把测试新版的工作留给别人。无论对人工智能还是人类,有时候原始智力的重要性不及你如何使用它。