谷歌发布Gemini Agent:支持调用Claude,打造拥有独立身份的办公AI同事
2026/10/09 08:16阅读量 6
Google Cloud正式发布Gemini Agent,定位为可长期运行、覆盖各类工作任务的通用办公智能体。该Agent具备跨应用工具调用能力,并创新性地引入“Coworker”概念,赋予AI独立的邮箱、日历及企业身份以参与团队协作。此外,系统支持多模型动态编排,可根据任务需求在Gemini与Anthropic的Claude之间自动选择底层模型,兼顾效果、速度与成本。
事件概述
Google Cloud于2026年10月9日发布《Welcome to Gemini at Work 2026》长文,正式推出Gemini Agent。该产品旨在成为覆盖各类工作任务的通用办公智能体,强调“给予目标而非指令”的工作原则,能够自行规划任务、跨应用调用工具,并在必要时协调多个子Agent协作完成复杂工作。
核心功能与机制
1. Coworker Agent:赋予AI独立职场身份
谷歌提出“Coworker Agent”概念,允许企业为Gemini创建具有明确工作职责的长期存在身份。其核心特征包括:
- 独立账号体系:配置独立的Google Workspace账号、企业邮箱、日历及Google Drive存储空间,并可出现在公司通讯录中。
- 协作集成:团队成员可通过Google Chat邀请其加入群聊或在文档中@它,操作记录留痕,便于企业管理和追踪。
2. 四层记忆机制
为实现对业务习惯和团队协作方式的深度理解,Gemini Agent构建了四种记忆类型:
- 会话记忆 (Session Memory):保存当前任务的上下文,确保长时间跨度任务中的步骤连续性。
- 语义记忆 (Semantic Memory):从文档阅读、人际交流及Agent协作中积累知识,构建结构化知识库(如产品信息、团队职责、内部术语)。
- 程序性记忆 (Procedural Memory):记录工作流程与方法论,甚至支持Agent自主编写Skills(技能包),将经验固化供后续任务复用。
- 情景记忆 (Episodic Memory):记录过往完成的工作及执行经历,使Agent能像新员工一样通过“入职培训”逐渐熟悉用户环境。
3. 多模型编排与动态路由
Gemini Agent打破了必须使用自家模型的局限,具备强大的底层模型调度能力:
- 多模型支持:现阶段可在Google自家的Gemini系列与Anthropic的Claude系列之间进行动态选择,未来计划支持更多闭源及开源模型。
- Smart Routing:根据任务复杂度、对速度的要求及成本预算,自动选择最优模型。简单任务使用低成本模型,复杂任务调用高性能模型,同一项目中也可组合不同模型完成不同环节。
- 数据与上下文保留:即使底层模型发生切换,Agent积累的上下文、Skills和企业数据得以保留,确保工作流程的延续性,避免推倒重来。
行业竞争格局
此次发布标志着谷歌正式加入办公Agent市场的激烈竞争,与OpenAI和Meta形成“三国杀”态势:
- Google (Gemini Agent):侧重于企业级办公场景,深度融合Google Workspace生态,强调Agent在企业组织架构中的身份融入及跨应用协作。
- OpenAI (Dots):提供7×24小时运行的云端电脑,连接超4000个应用,侧重围绕用户个人持续工作,目前正探索面向企业岗位的专业版试点。
- Meta (Muse):更偏向个人生活场景,利用庞大的社交用户基础,帮助用户处理购物、旅行预订等日常琐碎事务。
其他更新
除Gemini Agent外,谷歌还宣布Gemini全面进入Google Workspace,支持开放Skills、Tools与企业连接器,并推出了针对数据分析、金融和法律领域的专业Agent,同时增强了Agent的安全治理与成本控制能力。
