贝有科技

BEIYOO·AI 简报:Gemini Agent 开始按“员工身份”上岗,企业 AI 进入治理阶段

返回 AI 简报#3922026-10-10
BEIYOO·AI 简报:Gemini Agent 开始按“员工身份”上岗,企业 AI 进入治理阶段 封面图

Share

分享本期简报

手机端可调起系统分享;桌面端可复制链接或扫码后转发。

本期重点
  • Google 发布 Gemini Agent:可在云端持续执行任务,并用身份、权限和预算约束企业智能体。
  • Anthropic 开放 OSS Scanner,让开源维护者免费扫描代码漏洞并提交可复核报告。
  • JetBrains 发布 Mellum 2.1,以 12B MoE、2.5B 激活参数服务本地编码智能体。
  • 豆包 Work 上线无限画布,把检索、写作、图像生成与资料组织放进同一工作空间。
  • 犹他州批准 Nolla 在沙盒中试点有限病种 AI 处方,首批处方须由两名医生复核。
  • VoxMem 用 177 小时真实音频检验长程记忆,揭示语音智能体在跨会话检索上的短板。

企业智能体的竞争正在从‘能不能完成任务’,转向‘以什么身份调用哪些系统、花多少钱、出了问题如何追溯’。模型能力仍是底座,但真正决定能否进入生产环境的,是身份、权限、预算、审计和人工接管组成的治理闭环。

Deep Read

今日深读

Gemini Agent 的真正信号:企业开始给 AI 发工牌

Google 把 Gemini Agent 定义为能够在云端持续运行、跨应用调用工具并协调其他智能体的数字同事。更重要的是,它不再只以一个聊天窗口存在,而是拥有可管理的身份、权限和支出边界。

这意味着企业采购 AI 的问题正在改变:过去比较回答质量和单次任务成功率,现在还要判断它能访问什么、代表谁行动、预算如何控制、过程能否审计。没有这些控制面,再聪明的智能体也很难进入财务、采购、客户服务等关键流程。

对国内团队而言,值得先做的不是复制一个万能助手,而是挑选一条高频流程,明确最小权限、单任务预算、失败回退和人工审批点,再逐步扩大自动化范围。

By The Numbers

数字看板

70–80

个协作智能体

Google 披露 DBS 已在企业流程中部署的智能体规模

2.5B

激活参数

Mellum 2.1 每次推理激活量,模型总参数为 12B

3,196

个评测实例

VoxMem 覆盖 34,743 次会话与 177 小时音频

Action Item

企业能抄的作业

给准备上线的智能体补一张“工牌”

  1. 1列出它必须访问的系统、数据和工具,默认拒绝未声明权限。
  2. 2为单次任务设置费用、时长和调用次数上限,并记录每一步操作。
  3. 3把付款、发布、删除和对外沟通设为人工确认,预先定义失败回退。

News Briefing

今日快讯

今日快讯

1. Google 推出 Gemini Agent,企业智能体开始拥有身份、权限与预算

标签:企业智能体 / Google Cloud / 治理

摘要:Google 在 Gemini at Work 2026 发布 Gemini Agent,将其定位为可在云端持续运行、跨应用调用工具并协调其他智能体的“数字同事”。平台同时提供智能体身份、第三方模型接入、支出控制与可观测能力;这说明企业 Agent 的竞争重点已从单纯的模型回答质量,延伸到权限边界、费用管理和全过程审计。

来源:Google Cloud 官方发布

2. Anthropic 推出 OSS Scanner,为开源项目提供免费漏洞扫描

标签:代码安全 / 开源 / Claude

摘要:Anthropic 发布面向开源维护者的 OSS Scanner,可使用 Claude 分析代码库、寻找潜在漏洞,并生成包含证据与修复建议的报告。工具将扫描结果交给维护者复核,而不是直接把模型判断当成最终结论;这类“模型发现、人工确认”的协作方式,比追求无人值守更适合安全等高风险场景。

来源:Anthropic Cyber Mission · OSS Scanner 官方页面

3. JetBrains 发布 Mellum 2.1,主打本地编码智能体

标签:代码模型 / 本地部署 / 开源

摘要:JetBrains 发布 Mellum 2.1,这是一款总参数 12B、每次推理激活 2.5B 参数的 MoE 代码模型,并以 Apache 2.0 许可证开放。模型针对真实代码仓库中的智能体任务进行强化学习训练,官方称单请求速度提升约 1.6 倍;其方向不是做全能聊天模型,而是以更低部署成本支撑补全、编辑和工具调用。

来源:JetBrains 官方博客

4. 豆包 Work 上线无限画布,把资料、写作与图像生成放进同一空间【中国】

标签:AI 办公 / 多模态 / 工作空间

摘要:豆包 Work 新增无限画布,可在同一空间中摆放文档、网页、图片和生成结果,并调用 Seedream 5.0 Flash 进行图像创作。产品价值不只是“画布更大”,而是减少检索、整理、写作和视觉生成之间的来回切换;真正的检验点将是多人协作、版本追踪与企业资料权限能否同步跟上。

来源:火山引擎 Seedream 5.0 官方文档 · 产品动态

5. VoxMem 用 177 小时真实音频检验语音智能体的长程记忆

标签:语音模型 / 长上下文 / 评测

摘要:研究团队发布 VoxMem,包含 3,196 个评测实例、34,743 次会话和 177 小时音频,并覆盖 8K 至 64K 上下文长度。它关注的不是单轮语音识别,而是智能体能否在多次通话中准确记住人物、事实和时间关系;结果提醒产品团队,能“听懂当下”并不等于能可靠地“记住过去”。

来源:arXiv 论文

6. Anthropic 用 Claude Science 补齐首张完整紫外全天图

标签:AI for Science / 天文学 / 科研智能体

摘要:Anthropic 与科研团队公布首张完整紫外全天图,其中约三分之一的空白区域由 Claude Science 辅助预测,并为结果标注不确定性。项目把模型用于资料整合、方法选择和缺失区域推断,但明确保留可验证的数据来源与置信边界;相比展示“AI 会做科研”,这种可复核的产出更接近科研工具的真实门槛。

来源:Anthropic 官方研究

7. 快手处置 2,544 条 AI 篡改视频,平台治理进入批量执行阶段【中国】

标签:内容治理 / AIGC / 平台规则

摘要:快手黑板报披露,平台针对 AI 篡改、仿冒公众人物和误导性合成内容开展专项治理,处置相关视频 2,544 条。随着生成成本下降,平台治理已经不能只依靠用户举报,而要把来源标识、检测、申诉和复核连成流程;对企业内容团队而言,素材授权与生成记录也会成为发布前的基本合规材料。

来源:北京日报转引快手黑板报

8. 犹他州允许 Nolla 试点 AI 处方,但首批处方必须由医生复核

标签:医疗 AI / 监管沙盒 / 人工审核

摘要:美国犹他州在监管沙盒中批准 Nolla 开展有限范围试点:仅面向成年人的轻中度痤疮,并限于外用药物。项目有效期为 2026 年 10 月 5 日至 2027 年 10 月 5 日,首批 100 张处方还需两名犹他州医生复核;这不是“AI 医生全面独立开药”,而是一个病种、药物和监督条件都被严格限定的实验。

来源:犹他州官方授权清单 · 犹他州官方公告

9. OpenAI 集中公开数学进展,陶哲轩提醒评审能力不能被发布速度甩开

标签:数学推理 / 科研出版 / 评审

摘要:OpenAI 集中发布多项 AI 辅助数学研究,并公开其使用模型推进证明与验证的工作方式。数学家陶哲轩随后强调,大规模输出会把压力转移到同行评审与结果核验上;争议的关键并非简单判断“AI 会不会数学”,而是证明链条、作者责任和社区验证机制能否承受更高的产出速度。

来源:OpenAI 官方说明 · 陶哲轩个人博客

10. OpenAI 年化收入出现两种口径:当前约 500 亿美元,年底目标 700 亿美元

标签:商业化 / 收入口径 / 模型公司

摘要:最新报道将 OpenAI 当前年化收入估计在约 500 亿美元,同时称公司预计 2026 年底可超过 700 亿美元。两组数字分别对应当前运行水平与年底目标,且不同报道对“年化”计算方法存在争议;观察模型公司的商业化速度时,应同时核对时间点、是否包含一次性收入以及订阅和 API 的确认口径。

来源:Axios 对收入口径的核查 · Bloomberg 报道转引

11. 美国民调显示 64% 成年人认为 AI 发展过快

标签:社会态度 / AI 治理 / 民调

摘要:AP-NORC 调查显示,64% 的美国成年人认为 AI 发展速度过快,约八成受访者希望政府优先确保人类能够保持控制。公众担忧不只来自失业,也包括隐私、错误决策和责任归属;企业在上线面向员工或客户的 AI 功能时,需要把退出机制、人工通道和数据用途讲清楚,而不能只展示效率收益。

来源:AP-NORC 官方调查 · 美联社报道

12. 豆包测试生活缴费入口,AI 助手向真实交易环节靠近【中国】

标签:生活服务 / 支付 / 智能体

摘要:部分用户端观察显示,豆包开始测试水费、电费和燃气费查询缴纳入口,用户需手动绑定户号并确认支付,目前并非自动扣费。若这一能力扩大,AI 助手将从信息查询进一步进入交易流程;产品设计必须把城市覆盖、账户绑定、金额确认和异常退款写进清晰的交互链路。

来源:产品观察报道 · 行业报道

BEIYOO 判断

企业 Agent 正在获得类似员工的“组织身份”。它可以持续执行任务、调用工具和协调其他智能体,但也因此必须接受与员工相近的权限、预算和审计约束。下一阶段的竞争,不是把对话框做得更聪明,而是把行动边界做得更清楚。

今日深读:Gemini Agent 的真正信号,是企业开始给 AI 发工牌

Google 此次发布最值得关注的,并不是又多了一个智能体名称,而是它把身份、权限、预算和可观测性放进同一套企业控制面。Agent 一旦能跨系统行动,就必须回答“代表谁、能做什么、最多花多少、如何追责”。

这也改变了企业 AI 项目的验收方式。除了任务完成率,还应检查越权率、人工接管率、失败恢复时间和单任务成本。只有这些指标能够被稳定记录,智能体才可能从演示环境进入真实业务。

对准备落地的团队,最稳妥的起点是一条边界清晰的流程:只开放必要工具,限制单次费用,把高风险动作留给人工确认,并保留完整操作日志。先让一个 Agent 可信地做好一件事,比让一个万能助手偶尔做对十件事更有价值。

企业能抄的作业

  1. 给智能体列权限白名单:明确可读、可写、可对外发送的系统和字段。
  2. 设置成本与时间护栏:为单任务限定调用次数、费用和最长执行时间。
  3. 标出人工审批点:付款、发布、删除和对外承诺必须确认后执行。
  4. 保留审计证据:记录模型版本、工具调用、输入输出和最终操作人。

有类似的场景想推进?

先把目标、边界和验收方式聊清楚,再决定怎么开始。