Copied


适用于macOS的Gemini应用新增语音驱动的AI工具

realtime news   Jul 29, 2026 17:15 1 Min Read


谷歌的适用于macOS的Gemini应用引入了强大的新自然语言功能,用户现在可以仅通过语音与桌面环境互动。这一更新于2026年7月29日宣布,使得通过语音命令执行任务如转录、摘要甚至图像编辑成为可能。这一推出延续了谷歌将Gemini定位为领先桌面AI助手的努力。

通过这次更新,用户可以长按Fn键直接在任何应用中进行语音输入。语音输入功能会自动将语音转录为精炼的文本,去除填充词并处理句中修正。例如,用户可以无须担心手动清理就可以口述笔记或电子邮件,因为应用会无缝地将文本集成到需要的地方。

除了转录功能,Gemini现在通过其“推理”模式提供了上下文感知的功能。一旦启用,应用可以根据屏幕上的内容执行更复杂的任务。用户可以突出显示文件、文档或图像,并请求执行诸如总结文档或重写文本的操作。例如,用户可以说:“将这些笔记总结为一封执行邮件”,或者“将这个设计转换为暗模式版本”,应用会实时执行精确的编辑和输出。

此次更新还包括语音驱动的图像生成和编辑功能,这使得Gemini成为ChatGPT和Claude Desktop等工具的多模态AI竞争对手。用户可以参考本地资产,通过简单的语音指令构想视觉效果或对设计进行迭代。

Gemini于2026年4月15日首次在macOS上发布,并不断扩展其功能。早期更新引入了Gemini Spark,这是一种更具能动性的助手,能够实时更新并改进工作流程自动化,还包括诸如截图到分析的快捷方式等界面增强功能。该应用针对运行macOS 15(Sequoia)或更高版本的Apple Silicon Mac进行了优化,至少需要8GB的内存以确保流畅运行。

这些改进强调了谷歌创建一个完全整合的桌面AI体验的战略,该体验减少了上下文切换,并支持用户直接从桌面处理复杂的工作流程。最新的语音功能使Gemini成为一个更主动的工具,符合对生产力导向的AI助手日益增长的需求。

这些新的语音功能正在全球范围内以英语推出,未来更新预计将支持更多语言。用户可以在Gemini官方网站下载该应用并探索这些功能。

随着桌面AI工具市场竞争加剧,谷歌在语音驱动的工作流程和多模态输入等功能上的投资,使得Gemini成为一个强有力的竞争者。随着用户对无缝、上下文感知的AI助手的期望不断提高,竞争产品需要不断跟上步伐。


Read More