贝有科技

BEIYOO·AI 简报:Agent 进入执行层,企业要先管好接口

返回 AI 简报#3602026-08-21
BEIYOO·AI 简报:Agent 进入执行层,企业要先管好接口 封面图

Share

分享本期简报

手机端可调起系统分享;桌面端可复制链接或扫码后转发。

本期重点
  • Claude Platform 将 Computer Use、Skills API 与 Files API 推向正式可用,Agent 的软件操作、组织知识和文件交付开始在同一平台闭环。
  • OpenAI Codex App Server 公开线程、回合、工具、审批与事件流接口,编码 Agent 的核心不再只是生成代码,而是管理一套可嵌入的执行生命周期。
  • Qwen-UI-Agent 面向移动端、电脑端和网页操作,并公布 MobileWorld 82.1% 的 GUI-only 成绩;企业需要为真机执行同步设计设备身份、权限和回滚。
  • 豆包用 200 多个技能与连接器沉淀工作方法,Mistral 用多步检索处理复杂文档:组织知识正在从“放进知识库”转向“带着步骤执行”。
  • LFM2.5 DSpark 通过投机解码提升吞吐,SenseNova U1.5 Lite 将统一多模态压到 8B 规模,执行型 Agent 的成本与端侧部署门槛继续下降。
  • Hyundai 工会围绕 AI 岗位安全发起罢工,多家科技公司面临语音训练诉讼:Agent 扩大执行范围的同时,劳动协商与数据授权也必须前置。

Agent 的竞争正在从“谁回答得更聪明”转向“谁能安全地完成更多动作”。执行框架、真机操作、Skills、Files 和连接器已经逐步齐备,模型本身反而更容易替换。企业真正需要建设的是一层可治理的执行面:统一身份、最小权限、审批规则、完整日志、失败回滚和人工接管。接口如果没有制度,自动化越强,风险只会传播得越快。

Deep Read

今日深读

Agent 技术栈正在补齐,真正的门槛转向“执行制度”

Anthropic 宣布 Computer Use、Skills API 与 Files API 在 Claude Platform 正式可用:Agent 可以看见并操作软件,按需加载团队技能,并持续读写文件。OpenAI 的 Codex App Server 已公开线程、回合、工具调用、审批和事件流等接口;Qwen-UI-Agent 把执行范围推进到移动端、电脑端和网页真机;豆包则用技能与连接器把个人工作方法和企业系统接到同一工作流。

这几条新闻拼出了一套逐渐完整的 Agent 技术栈:执行框架负责管理会话与工具,GUI Agent 负责操作没有 API 的界面,Skills 固化组织方法,Files 与连接器提供上下文和业务数据。过去,企业常把 Agent 项目理解为“换一个更强模型”;现在更关键的问题是,哪些系统允许进入、哪些动作允许执行、什么情况必须人工确认,以及失败后如何恢复。

能力开放得越快,制度越不能靠口头约定。每一个可执行接口都应带上身份、最小权限、参数校验、审批条件、操作日志和回滚方式;高风险动作还要有独立的人工接管路径。Agent 的商业价值来自更短的任务链,而企业的可持续优势来自把这条链变成可审计、可复制、可停止的执行系统。

By The Numbers

数字看板

200+

豆包工作任务模式已上架的技能与连接器数量,办公方法开始被封装为可复用组件。

82.1%

Qwen-UI-Agent 27B 在其公布的 MobileWorld GUI-only 基准成功率,真机操作成为新的模型能力维度。

1 TB

Claude Files API 单组织存储上限,同时官方称速率限制提高至原来的 5 倍。

Action Item

企业能抄的作业

建立一张“Agent 可执行面”清单

  1. 1列出 Agent 可能接触的系统、文件与动作,按“只读、可写、可外发、可交易”四级标注风险,并为每项指定业务责任人。
  2. 2为所有可写动作补齐身份校验、参数白名单、审批条件、操作日志和回滚方案,禁止用一个全局账号贯穿全部流程。
  3. 3选择一个低风险高频流程做一周试点,记录完成率、人工接管率与失败恢复时间,并至少演练一次撤销或回滚。

News Briefing

今日快讯

Claude 把 Computer Use、Skills API 与 Files API 推向正式可用

标签:企业 Agent / 平台能力

Anthropic 宣布 Computer Use、Skills API 与 Files API 在 Claude Platform 正式可用,并新增读取网页结构的 Browser Use 工具。Computer Use 支持单回合连续执行多个动作,Skills 可上传和版本化团队方法,Files API 则支持跨请求复用输入和下载 Agent 产物。三者组合后,企业构建的不再是单次问答,而是一条包含软件操作、知识调用和文件交付的完整任务链。


OpenAI Codex App Server 公开 Agent 执行生命周期接口

标签:编码 Agent / 开源框架

OpenAI 的开源 Codex 仓库已公开 App Server 协议,覆盖线程、回合、消息、工具调用、文件修改、审批、Skills 与事件流,并支持生成与当前版本匹配的 TypeScript 或 JSON Schema。AIbase 将其概括为 Codex Harness 核心能力进一步开放。对企业而言,价值不只在于接入一个编码模型,而是可以围绕稳定接口构建自己的界面、权限控制、任务观察与恢复机制。


Qwen-UI-Agent 把多模态执行推进到真实设备

标签:GUI Agent / 真机操作

阿里团队开源 Qwen-UI-Agent,覆盖移动端、电脑端、网页与深度搜索等 GUI 操作场景。其官方页面公布,27B 模型在 MobileWorld 的 GUI-only 成功率为 82.1%,并进一步提供真机评测口径。基准成绩不能直接代表企业软件中的稳定性,但真机执行会迫使产品同时解决设备身份、敏感界面、误触确认和失败回退。


豆包用技能与连接器沉淀办公工作流

标签:办公 Agent / 连接器

据 AIbase 报道,豆包工作任务模式新增技能、连接器和工作伙伴三类能力,平台已上架 200 多个技能与连接器,并支持用户保存自己的周报格式等工作方法。技能把“怎么做”封装为可复用步骤,连接器则负责接入办公系统和数据。企业采用类似机制时,应把技能版本、数据范围和动作权限纳入统一治理,避免个人自动化演变成不可追溯的影子流程。


Mistral 用多步检索处理复杂长文档

标签:Agentic Search / 企业知识

Mistral 推出面向复杂文档的 Agentic Search 方案,通过查询拆解、迭代检索与交叉验证替代一次性向量检索。AIbase 引述的厂商测试称,特定复杂文档任务准确率可提升至 86%,这一数字仍需结合数据集和评测方法理解。更具普遍性的变化是,企业知识系统正在从“找到相似段落”转向“按问题反复取证并保留引用链”。


LFM2.5 DSpark 用投机解码降低 Agent 推理等待

标签:推理优化 / 部署成本

Liquid AI 与 Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型检查点,覆盖 1.2B、2.6B 与 8B-A1B 等规格,用于投机解码。AIbase 汇总的测试数据显示,GPU 端最高提速约 3.18 倍,端侧设备也获得不同程度加速;实际收益仍取决于目标模型、硬件和请求形态。对执行型 Agent 来说,减少每一步工具调用前后的等待,往往比单次回答跑分更直接地改善完成率和成本。


SenseNova U1.5 Lite 把统一多模态能力压到 8B

标签:多模态模型 / 轻量部署

商汤开源 8B 级统一多模态模型 SenseNova U1.5 Lite,面向图像生成、编辑和复杂排版等任务,并强调对主体、空间关系、文字与风格等多重约束的处理。厂商展示结果仍需在真实业务素材上复测,但 8B 规模使本地部署和专用场景微调更具可行性。企业应把品牌一致性、文字准确率和审核成本纳入评估,而不是只看示例图质量。


Grok Build 向更多用户开放自然语言应用构建

标签:应用生成 / Vibe Coding

HuggingNews 汇总称,Grok Build 结束测试并向更多 X Premium 用户开放,覆盖网页与移动端的应用或小游戏生成。自然语言构建正在从生成代码片段延伸到可运行应用,但“能生成”不等于“可发布”。企业仍需补上代码审查、身份与权限配置、数据处理说明、依赖许可证和上线责任人。


Adobe Firefly 把音乐、语音与音效并入创作流程

标签:生成音频 / 内容生产

据 AIbase 报道,Adobe Firefly 的音频工具进一步覆盖音乐、语音和音效,并进入桌面与移动端的视频创作流程。Adobe 此前已公开 Generate Soundtrack、Generate Speech 与生成音效等能力,并把商业使用与授权风险作为产品卖点。企业内容团队采用时,仍应记录模型来源、授权条款、素材版本和人工审核,确保“生成可用”不被误解为“自动拥有全部权利”。


SAP 与 Team Liquid 将队内语音转成可分析数据

标签:语音智能 / 垂直应用

SAP 与电竞战队 Team Liquid 开发语音智能应用,对训练和比赛中的多声道交流进行分离、转写、发言人识别与情绪分析,再转为结构化数据支持战术复盘。这类产品的价值不是通用聊天,而是把高频、短暂且难检索的现场沟通变成可查询记录。落地时需要明确参与者知情、保存期限、情绪标签的误差边界,以及分析结果能否用于人员评价。


Hyundai 工会罢工把 AI 岗位安全推上谈判桌

标签:岗位转型 / 劳动协商

HuggingNews 汇总称,Hyundai Motor 工会围绕 AI 自动化、岗位安全和相关承诺发起十年来首次全天罢工。具体谈判条款仍应以公司与工会后续公告为准,但它提示企业:AI 流程改造不只是技术部署,也会改变岗位数量、技能要求和绩效评价。培训、转岗路径和使用边界如果不提前协商,效率项目很容易转化为组织阻力。


多家科技公司面临语音训练数据诉讼

标签:训练数据 / 版权治理

HuggingNews 报道,多家科技公司在芝加哥面临与语音数据训练有关的诉讼,争议涉及录音使用、授权与补偿。案件事实和责任划分仍有待司法程序确认,但语音 Agent 的数据链比文本更敏感:声音可能同时涉及版权、人格权与生物识别特征。企业采购语音模型时,应要求供应商说明训练数据来源、授权范围、删除机制和索赔责任。

有类似的场景想推进?

先把目标、边界和验收方式聊清楚,再决定怎么开始。