TranscribeGlass 可以几乎实时为对话添加字幕,并且很快将能够翻译语言,还能告诉你与你交谈的人何时感到社交尴尬。
[audio wav="https://recodex.ai/wp-content/uploads/2025/07/转录眼镜:为世界加上字幕.wav"][/audio]
本文信息来源:wired

照片:TranscribeGlass 提供
我意识到这些智能眼镜上的 AI 确实运作得相当不错,是在它告诉我,谈话中另一个人才是那个社交尴尬的人时。
TranscribeGlass 是一款智能眼镜 ,它的目标正如其名:将口语对话转录出来,并将字幕投射到你眼前的镜片上。它主要面向聋人和听力障碍群体,帮助那些难以读唇或在嘈杂环境中难以分辨对话的人。
大多数面部计算设备都笨重且沉重,但这款眼镜很轻,只有 36 克。TranscribeGlass 之所以能保持轻盈,是因为将大部分主要计算功能交给了配套应用程序(目前仅支持 iOS)。镜框中没有摄像头、麦克风或扬声器,只有一个小型波导投影仪,位于一侧镜框边缘,可以将 640 x 480p 的图像投射到镜片上。这种分辨率刚好足以让文字在直接投射到你视野时清晰可读,为手机麦克风捕捉到的对话加上字幕。
在应用程序中,字幕可以在佩戴者的视野内任意移动,范围为30度视场内的任何位置。你可以通过更改设置来调整每次显示的文本行数,从一整面文字墙到一次只显示一个单词。眼镜的电池续航时间大约为八小时。镜框售价约为377美元,另外每月需支付20美元的订阅费以使用转录服务。
目前眼镜中已经可以显示字幕,但 TranscribeGlass 的 24 岁创始人 Madhav Lavakare 还计划推出其他功能。正在测试阶段的功能包括实时翻译语言的设置,以及分析说话者语调的功能。
眼镜下课
正如 Lavakare 告诉我(以及 《纽约客》 在四月的报道),他在想帮助一位听力障碍的朋友参与那些没有考虑到他需求的对话时,萌生了这个产品的想法。身为耶鲁大学高年级学生的 Lavakare 认为,眼镜是实现这一目标的最佳途径。如果他能把它们做对。而且,你懂的,还要让它们看起来比市面上一些其他眼镜更酷。
“谷歌眼镜刚出来的时候,我简直着迷了,”Lavakare 说。
“哦,”我说,“所以你是个 Glasshole?”
“是的,是的!”他笑着说,“然后我就在想,为什么大家这么叫我?”
当我们交谈时,我所戴眼镜的屏幕上会弹出文字。它们以一种类似《黑客帝国》的绿色字体出现在我的视野中,像雨点一样流淌。它对对话的转录效果相当不错,虽然把“Glasshole”拆成了“Glass Hole”,说实话这样反而更有趣。
尽管 Lavakare 的智能眼镜比 Google Glass 更接近普通眼镜,但它们看起来仍然像智能眼镜。屏幕在玻璃上的波导处有一丝微光,旁观者可以隐约看到,而我戴上时也能明显察觉到。
除了那些小小的不满之外,这项服务本身几乎运作得令人惊叹。在旧金山一个热闹的联合办公空间里,周围有许多对话正在进行,Lavakare 和 Transcribe 的首席技术官 Nirbhay Narang 与我交谈时,我戴着这副眼镜。大多数转录内容语法正确,并用不同的说话者标签标明了是谁在说话。实际上,这一切都运行得非常快、非常好,文字弹出的速度之快,以至于随着对话的进行和新文本几乎同时出现,我很难及时阅读。转录内容有时也有些模糊,一时难以聚焦。不过,只要稍加练习,很难不认为这对听力障碍人士来说会非常有用。
TranscribeGlass 有一些竞争对手。像 Even realities 和 XRAI 这样的公司生产的眼镜外观更炫酷,并且提供更多功能,比如逐步导航和聊天机器人互动。但 Lavakare 表示,正是有限的功能让他的眼镜与众不同。
“所有这些智能眼镜都已经存在,但还没有人找到一个很好的应用场景,”Lavakare 说。“我们认为我们真的找到了一个对终端用户来说极其有价值的应用场景。”
他说,这款眼镜无法播放音乐,也不能用 AI 来回答问题,但只要能把一件事做好——帮助人们听懂周围正在说什么——就足以让人们愿意佩戴它。Lavakare 将错过周围对话的感觉比作一种社交隔离。
话虽如此,他确实希望在眼镜中加入其他对话功能,目标是增强你从聊天潜台词中获取的信息。即将推出的一个功能是语言翻译。
Narang 和我进行了一次简短的对话来测试翻译能力。他用印地语和我交流,而我用英语和他说话。在我的眼镜上,我能看到他对我说的话被翻译成英文显示在屏幕上。当我用英语回应时,印地语文本会出现在他的手机应用上。这项服务似乎也能很好地运行,尽管有些词语被翻译错了。这也是为什么这个功能还没有推送给 TranscribeGlass 目前的几百位用户。

更多功能即将推出
还有其他功能正在开发中。Lavakare 希望让用户可以选择将口语翻译成更接近视觉语言(如美国手语)所使用的语法结构,这种语言的名词、动词和时态顺序通常与英语口语不同。如果将这种翻译完全交给 AI,而大多数聋人其实已经能够很好地阅读英语,这可能会导致一些不准确或误解。Lavakare 也承认这种出错的可能性,并表示他已经与美国聋人学校的聋人教育者进行了交流,力求做到准确。
“手语的语法实际上与英语语法非常不同,”Lavakare 说,“这也是为什么这项功能还处于实验阶段。”
他还在测试一项更具争议的功能——仅通过语音语调识别说话者的情绪。情绪追踪在 AI 领域是一个充满争议的话题,尽管人们似乎总是忍不住要把它加入智能眼镜中。虽然 TranscribeGlass 尚未发布在对话中记录情绪的功能,但团队正在测试,目标是很快推出。考虑到在对话理解中,察觉一个人如何说话往往和知道他们说了什么一样重要,这项功能的确有其合理性。
拉瓦卡雷让我试用一下,他在我戴着眼镜的时候打开了这个功能。
“看这个,”他说。然后又说:“嘿,Boone,最近怎么样?”
他的话出现在屏幕上。我刚要回答,一个带有情感标签的对话框出现在他的语句旁边:[尴尬]
我笑着说:“哦不,我们真的那么尴尬吗?”然后我的话上方弹出了标签:[愉快]。现在我的话旁边出现了我的名字,这是平台在 Lavakare 之前提到我的名字时识别出来的。我一说完话,它就把我的对话标签改成了 [尴尬]。
嗯。也许这东西真的有用。