如果你用过 ChatGPT 之类的 AI 助手,一定有过这种体验:问个问题它能答,但让它去帮你把一份表格整理好、发邮件、再在 Slack 里同步给同事,它就抓瞎了。传统会话式 AI 只能“聊”,不能“做”。谷歌这次在 Gemini at Work 2026 上发布的 Gemini agent,就是冲着这个痛点来的——它试图做一个真正能“干活”的通用工作代理,而不是一个只能回答问题的聊天框。
Gemini agent 的核心是“目标驱动”:你给它一个目标,比如“把上季度销售数据整理成报告并发给管理层”,它自己规划步骤、调用工具、连接你的系统,最后把做完的东西放回你的文档或收件箱里。它不只是一个模型,而是一整套架构。
先看它的能力边界。Gemini agent 可以回答问题、处理知识工作、生成图片和媒体、编写并运行代码——全部在同一个 agent 和同一个 API 里完成。你给它的是“目标”而不是“指令”,它像一个能自主决策的下属。它可以作为你的个人助理,也可以作为团队里的一个成员,比如扮演一个项目管理者,或者财务部门的分析师角色。这意味着它不再是一个被动的问答工具,而是一个能参与业务流程的“数字员工”。
这个 agent 的架构有几个关键设计原则,值得仔细看看。
**统一 Agent 与无处不在的访问**:Gemini 是单一 agent,但可以从任意设备访问——Web、iOS、Android、Windows、Mac,甚至命令行、Google Workspace、Microsoft 365、Slack 这些渠道。它还可以作为 headless agent(无界面代理)嵌入到第三方应用里。你不需要专门打开一个网页才能用。
**持久化执行**:它运行在云端,无论你用什么设备访问,它都保持一份统一的记忆、上下文和“个人化图谱”。这意味着你不需要重新向它解释背景,也不会出现“我是在哪台电脑上让它干这个的”这种混乱。耗时几小时甚至几天的工作,在你合上电脑后它依然在后台跑,回来时结果已经就绪。这解决了当前 AI 工具最大痛点之一——没有持续状态。
**多 agent 编排**:Gemini 不是单打独斗。它能动态创建一组“子代理”——临时的、任务专用的代理,每个都有自己的身份标识,来处理多步骤任务。这些子代理可以并行或串行工作,持续数小时甚至数天。更高级的是“同事代理”(coworker agent),它像一个有持久角色和固定职责的团队成员,有自己的 @agents.company.com 邮箱、独立存储,并且只能访问你或团队成员明确提供的上下文。这种设计把 agent 从“工具”提升到了“协作者”的层级。
**深度上下文**:Gemini 天生就了解你的工具、数据和工作历史。它跟你交互越多,越懂你的工作方式。团队可以创建专属项目来进一步优化它使用的上下文、技能和工具。这解决了一个关键问题——AI 能否真正融入企业知识体系。
**模型选择灵活性**:最反直觉的一点是,Gemini agent 本身不绑定单一模型。它底下可以切换不同的模型——目前支持 Gemini 系列和 Anthropic 的 Claude,未来会加入更多私有和开源模型。它会根据任务自动选择最合适的模型:最难的任务用最强大的模型,简单任务用轻量模型,既提高准确率又降低成本。而且模型排行榜每几个月就变一次,保持选择开放意味着你的上下文、技能和数据不会因为换模型而重建。这个思路很像“模型路由”,但由 agent 自动完成。
驱动这些能力的是三件套:工具、技能和上下文。
- **工具和工具注册表**:Gemini 能安全连接到你公司已有的软件——协作工具(Confluence、Microsoft Office、Teams、Slack、Workspace)、开发工具(Git、Jira)、企业平台(Salesforce、ServiceNow)、数据库(BigQuery、Databricks、Postgres、Snowflake)甚至你桌面上的文件。它还支持标准化的 MCP(Model Context Protocol,一种让 AI 系统连接外部数据与工具的统一协议),可以连接公司内外任何 MCP 服务器。企业还可以用自己的工具注册表,让团队构建并发布工具给全公司用。
- **技能和技能注册表**:技能是可复用的指令、知识或工作流,以模块化提示词的形式存储,教 agent 如何执行特定多步骤任务。Gemini 自带一个庞大的技能库,团队可以发布自定义技能到公司共享注册表,你也能构建个人技能。它会自动选择合适的技能和工具,并从每次执行里学习,持续提升一致性还节省 token。
安全和治理是这次发布的重头戏。Gemini agent 在安全架构上做了四层:身份与策略管理、授权与权限控制、安全沙箱、网络网关。企业里用 AI 最怕的就是权限失控——agent 凭啥访问你的财务系统?谷歌的做法是把 agent 的访问权限严格绑定到你的身份体系里,让 agent 只能在你授权的范围内操作,并支持实时花钱上限和智能路由来控制成本。

显示的是数据分析技能——业务用户用自然语言提问就能得到可执行的运营洞察,这背后是新的数据与分析技能,让非技术团队也能直接查数。

展示的是规模化数据:近 500 家谷歌云客户每家的 token 处理量都超过一万亿,80% 的客户在用 AI 产品,90% 的财富 100 强公司用 Gemini Enterprise。这个数据说明 AI 已经从实验转入生产系统。

是 Gemini agent 的架构示意图,展示统一 agent 如何连接个人工作流、业务系统和治理控制。

展示了同事代理(coworker agent)的协作模型——它有自己的身份、邮箱和存储,像真正的团队成员一样参与多日项目。
早期客户已经开始受益。运动品牌 On 测试了动态模型选择能力来加快上市速度;Shopify 已验证多模型策略服务数百万商家;PayPal 每周路由 1000 万个多模型请求。这些案例证明,多模型路由和 agent 编排不是纸上谈兵,而是真实生产环境里已经被大规模验证的方案。
对开发者来说,这个发布的启发在于:AI 应用的下一步不是“更强的聊天”,而是“能执行的 agent”。而做一个可落地 agent,关键在于上下文持久化、工具连接、多模型路由和权限治理——这些都不是单一模型能解决的。如果你正在构建类似系统,直接参照 Gemini agent 的这几条架构原则:把模型当作可替换的计算单元,把工具和技能做成注册表,让 agent 拥有独立的持久记忆,并把安全策略嵌入到 agent 生命周期里。要注意的坑是:agent 的权限边界必须严格与企业身份体系对齐,否则失控的自动化比高效更危险。另外,模型路由本身需要精心设计,简单任务用大模型是浪费,复杂任务用弱模型会出错。这套思路几乎适用于所有企业级 AI 应用的架构设计。
内容与图片版权归原作者所有 · 原文: https://cloud.google.com/blog/products/ai-machine-learning/welcome-to-gemini-at-work-2026/