香港中文大学机械与自动化工程学讲座教授徐扬生早在十余年前便展示了智能眼镜的原型,该眼镜能够通过增强现实(AR)技术将实时翻译的文字叠加在用户视野中,帮助旅行者理解路标、菜单和公交线路。这一概念在当时极具前瞻性,但受限于当时的计算能力和机器学习算法,翻译准确度和实时性有限。近年来,随着深度学习和自然语言处理(NLP)的飞速发展,智能翻译眼镜已从实验室走向商业化,成为人工智能在可穿戴设备领域的典型应用。
徐扬生教授在机器人与智能控制领域有深厚造诣,其团队开发的智能眼镜早期方案采用了头戴式显示器和嵌入式摄像头,通过图像识别与云端翻译引擎配合,实现多语言互译。虽然原始原型体积较大,但为后续研究奠定了基础。如今,诸如Google Glass Enterprise Edition、微软HoloLens以及初创公司如MyManu Clik、Timekettle WT2等产品,已将翻译眼镜的体积缩小至普通眼镜大小,并实现了接近同声传译级别的实时翻译。
目前主流翻译眼镜的技术原理包括:语音识别模块采集用户或对话者的语音,通过端侧或云端语音转文本(ASR)引擎转为文字;机器翻译引擎(如基于Transformer架构的神经网络翻译模型)将源语言文本转换为目标语言;AR或骨导扬声器将翻译结果以文字或语音形式呈现给用户。关键挑战在于:低延迟(需小于200毫秒以适应自然对话节奏)、多语言支持(尤其对小语种的优化)、以及隐私保护(端侧处理优于云端)。例如,Mymanu Clik支持37种语言对译,并配备专属应用进行离线翻译,大幅提升了旅行实用性。
从学术角度看,智能翻译眼镜属于多模态人机交互和情境感知计算的研究范畴。其核心在于如何融合视觉、听觉与语言信息,在无干扰的前提下提供准确的翻译辅助。未来,随着边缘计算芯片的发展(如高通骁龙XR2平台)和更轻量化的NLP模型,翻译眼镜有望实现完全离线运行,并支持手势或眼动交互。徐扬生教授早期提出的“智能帽”与“智能鞋”,虽然未大规模商用,但同样启发了后来的人机界面设计思路。总体而言,智能翻译眼镜已从概念验证走向实用化,正逐渐改变跨语言交流的方式。