谷歌推出SL2T AI模型,实现实时手语翻译
谷歌DeepMind推出了SL2T,这是一种手语到文本(SL2T)的AI模型,为听障和重听用户提供实时手语功能。该技术率先在Gboard和Live Transcribe中推出,支持Pixel 11设备,初期提供美国手语(ASL)到英语的翻译服务。根据2026年8月12日的一篇博客公告,更多手语和设备支持将在不久后推出。
SL2T解决了一个常被忽视的无障碍问题。尽管AI已经改变了口语语言处理,但却未能惠及全球约7000万使用200多种手语之一的人群。传统挑战如手语的复杂性和对同步身体动作的依赖,使得机器翻译困难重重。SL2T旨在通过利用大规模多语言数据和创新的用户导向设计来克服这些障碍。
SL2T的工作原理及其独特之处
该模型处理了超过10万小时的数据,涵盖50多种手语,其中ASL约占数据集的25%。与早期依赖中间注释(称为“词汇注释”)的方法不同,SL2T直接从姿势标志位置翻译为文本。这避免了词汇和语法上的限制,提供了更加自然的结果。在像FLEURS-ASL这样的基准测试中,SL2T实现了零样本BLEURT得分70,显著优于之前的模型。
隐私是一个关键关注点。SL2T不会将原始视频流传输到服务器上,而是通过名为MediaPipe Holistic的设备端模型提取手语者动作的几何坐标。这些坐标用于翻译,确保用户视频数据会被立即丢弃。
实际应用
SL2T允许听障用户直接通过手语与手机互动,用于网页搜索、消息发送和文档撰写等任务,为打字提供了一种更快、更自然的替代方式。在对话场景中,Live Transcribe让用户可以使用手语而不是打字来回应,弥合了听障与健听社区之间的沟通差距。早期测试者表示,用ASL手语交流比用英语打字更加直观和高效。
挑战与下一步
尽管取得了进步,SL2T仍然存在一些局限性。它在处理罕见手语、快速拼读以及模糊的语法结构时表现较弱。诸如时态解释等依赖上下文的任务也依然具有挑战性。谷歌已解决了如减少延迟、确保对左撇子用户的公平性以及改善单手手语表现等实际问题。
谷歌DeepMind强调了与听障社区合作的承诺。该公司成立了AI手语顾问委员会(AISLAC),以指导技术的伦理部署,并与听障专家共同撰写了影响报告。这种参与式方法旨在确保技术符合目标用户的需求。
展望未来
尽管SL2T的发布是一个重要的里程碑,但它仅代表谷歌在无障碍领域雄心的开端。团队计划将SL2T扩展到更多手语,并探索手语生成能力。最终目标是实现手语处理与口语/书面语言AI的平等。目前,用户可以在Pixel 11设备上免费体验SL2T,更多设备支持将在不久后推出。
谷歌的这一举措凸显了AI正在超越传统语言模型,开始关注未被充分服务的社区。随着无障碍逐渐成为AI开发的一个核心关注点,像SL2T这样的技术可能为包容性创新树立典范。