AI News · AI新情报

谷歌 Workspace 推出语音交互功能:在 Gmail、Docs 与 Keep 里直接说话完成任务

谷歌在 Workspace 中推出语音交互能力,用户可在 Gmail、Docs 和 Keep 中直接通过自然语言语音指令完成邮件撰写、文档编辑与笔记创建等任务。该功能基于 Gemini 模型,支持多轮对话与上下文理解,标志着办公套件从键盘输入向多模态交互的转变。

谷歌 Workspace 推出语音交互功能:在 Gmail、Docs 与 Keep 里直接说话完成任务
AI辅助整理:本文基于下方列出的公开原始来源改写,不代替原文。

核心摘要: 谷歌在 Workspace 中推出语音交互能力,用户可在 Gmail、Docs 和 Keep 中直接通过自然语言语音指令完成邮件撰写、文档编辑与笔记创建等任务。该功能基于 Gemini 模型,支持多轮对话与上下文理解,标志着办公套件从键盘输入向多模态交互的转变。

业务背景

企业办公软件在过去几年经历了从本地安装到云端协作的迁移,但交互方式仍以键盘输入为主。随着生成式 AI 成熟,用户开始期待用更自然的语言与软件交互,而不仅仅是输入关键词搜索。

谷歌 Workspace 拥有超过 30 亿用户(来源未披露具体统计口径),是企业和个人日常办公的核心工具。如何让 AI 能力真正融入这些高频场景,而不是停留在独立的聊天窗口,是谷歌面临的关键产品课题。

问题与挑战

传统办公任务中,撰写邮件、整理会议纪要、记录灵感等操作需要切换多个窗口并依赖打字输入,在移动场景或双手被占用时效率低下。

此前的 AI 助手多以文字对话形式存在,用户需要先打开对话框、输入指令、等待生成,再复制粘贴到目标应用,流程依然割裂。

AI 如何落地

谷歌将语音交互直接嵌入 Gmail、Docs 和 Keep 的编辑界面。用户点击麦克风图标后,可以用口语化指令说出任务,例如“给张总写一封邮件,确认下周二的会议时间”。

系统基于 Gemini 模型理解语义,并直接在当前文档或邮件上下文中执行操作。在 Docs 中,用户可以说“把这一段改成更正式的语气”;在 Keep 中,可以说“创建一个购物清单,包含牛奶和鸡蛋”。

该功能支持多轮对话,用户可以在一次会话中连续下达多个相关指令,系统会结合上下文进行修改和调整。

实施步骤

谷歌在官方博客中说明,该功能将逐步向 Workspace 用户开放,首先面向 Gemini Enterprise 或 Business 版本的英文用户(来源未披露具体时间表)。

企业管理员无需额外部署,功能在后台自动更新。用户只需在应用设置中确认麦克风权限已开启。

谷歌建议用户从简单的任务开始尝试,例如用语音快速记录想法或口述邮件草稿,再逐步尝试更复杂的编辑指令。

结果证据与边界

谷歌官方博客展示了功能演示,但未披露具体的效率提升数据或企业客户案例。

目前该功能仅支持英文,且对网络环境和麦克风硬件有一定要求。在嘈杂的开放办公环境中,识别准确率可能受到影响。

来源未披露该功能在数据隐私方面的具体处理机制,企业需关注语音数据的存储与使用政策。

可复制动作

企业可以筛选出适合语音交互的岗位,如外勤销售、仓库管理员、现场工程师,为他们提供支持语音输入的设备。

建议 IT 部门与业务部门共同设计 5-10 个高频任务场景,用统一的指令模板测试语音助手的完成质量,形成最佳实践手册。

在推广初期,应将语音交互定位为辅助工具而非替代方案,保留键盘输入作为兜底,逐步培养用户习惯。

证据与边界

  • 谷歌官方博客于 2026 年 9 月 2 日发布该功能说明。
  • 功能覆盖 Gmail、Docs 和 Keep 三款应用,基于 Gemini 模型。
  • 来源未披露具体的企业客户测试数据或效率提升百分比。

企业今天可以做什么

企业 IT 部门可以关注 Workspace 管理后台中语音功能的开关选项,先在特定部门(如销售、现场服务)小范围试点,收集员工对识别准确率和任务完成质量的反馈。同时,应更新内部 AI 使用指南,明确语音指令涉及的数据处理范围。对于依赖文档创作和大量邮件沟通的团队,可以设计几个典型任务场景(如“给客户写一封约下周会议的邮件”)来测试效果,再决定是否全量推广。

资料来源

公众号原题:New voice features in Gmail, Docs and Keep · 查看公众号原文

你的企业,AI最该先改哪一段?

带着一个真实业务问题,先做一次增长诊断。

获取增长诊断