贝有科技

BEIYOO·AI 简报:智能体开始碰真实系统,先验收再放权

返回 AI 简报#3652026-08-28
BEIYOO·AI 简报:智能体开始碰真实系统,先验收再放权 封面图

Share

分享本期简报

手机端可调起系统分享;桌面端可复制链接或扫码后转发。

本期重点
  • Anthropic 发布 MHS 研究预览,模型与物理设备的连接开始讨论统一控制方式;实体动作必须有分级权限与人工接管。
  • 腾讯混元开源 Hy4 preview,770B 总参数与 1M 上下文把开源旗舰模型的能力与部署成本同时推到企业选型桌面。
  • Qoder 将智能体能力从编程延伸至云端任务、工具调用与协作工作台;企业需要为账号、预算和日志设定默认边界。
  • Google 的 Gemini Omni 1.1 Flash 进入 Preview,支持最高 4K 的视频生成与编辑;高分辨率不等于可直接发布。
  • Google 搜索 AI 模式连接航班追踪与酒店预订,消费与服务型智能体正走向真实交易流程。
  • OpenAI、Anthropic、微软、Google、亚马逊等机构联名强调 AI 网络安全风险,模型能力扩展必须同步建设访问与异常防线。

今天的变化不是又多了几个模型,而是智能体开始更直接地触发真实系统:运行云端任务、处理支付和预订、生成可发布素材,甚至对接物理设备。企业的关键动作应从“接入一个更强模型”转为“为每种动作设计验收门槛”。先清楚定义哪些动作可自动完成、哪些必须确认、哪些必须可回退,AI 才能从试用工具变成可信的生产力。

Deep Read

今日深读

智能体的能力边界,正在从电脑屏幕延伸到真实系统

Anthropic 以研究预览形式发布模型硬件标准(MHS),希望为模型与物理设备之间提供统一的控制和通信方式。无论这一标准最终采用范围如何,它都反映了同一方向:智能体不再只生成内容,也开始连接浏览器、云服务、工具链和设备。

一旦 AI 能触发真实动作,企业的评估单位就不能只看“回答是否聪明”。它还要被拆成可读取的数据、可调用的工具、可提交的动作,以及发生异常时的停止与回退机制。权限越接近现实业务,验证越该前置。

腾讯混元开源 Hy4 preview、Qoder 扩展云端智能体能力、Google 发布支持 4K 的 Gemini Omni 1.1 Flash,也在推动模型从能力展示走向工作流交付。真正拉开差距的,将是把模型能力封装为可控、可审计、可复用流程的组织能力。

By The Numbers

数字看板

770B / 49B

腾讯混元开源 Hy4 preview:总参数 770B、每 token 激活约 49B,并提供 1M 上下文;大模型选型要同时评估部署资源与真实任务完成率。

4K

Gemini Omni 1.1 Flash 以 Preview 形式提供最高 4K 视频生成与编辑能力;内容团队应同时核验成片质量、素材权利与审批链路。

2831 亿元

百度披露截至 2026 年 6 月底的现金及投资规模,并将于 9 月 1 日完成香港双重主要上市转换;AI 全栈投入持续受到资本与业务现金流的双重检验。

Action Item

企业能抄的作业

给一个智能体流程补上“先验收再执行”

  1. 1选一个已经能调用工具的智能体流程,把它拆成读取、生成、修改、提交四类动作,并标记每类动作触及的系统和数据。
  2. 2为付款、发布、删除、对外发送、设备控制等不可逆动作设置二次确认、人工接管与失败回退,不让模型一次性拥有全量权限。
  3. 3在每周复盘中记录成功率、异常类型、人工接管次数与单次任务成本;用真实交付数据决定扩大还是收缩授权范围。

News Briefing

今日快讯

Anthropic 发布 MHS 研究预览,探索模型控制物理设备的统一接口

标签:具身智能 / 安全治理

Anthropic 发布模型硬件标准(MHS)研究预览,目标是让大模型驱动的智能体以更统一的方式连接和操控物理设备。报道提到该项目已向首批科研实验室和先进制造场景开放预览。

模型进入真实环境后,风险来自每一次实际动作。企业若要试点,应先限定设备、操作范围和异常停止条件,并保留人工接管。


腾讯混元开源 Hy4 preview:770B 参数、1M 上下文

标签:开源模型 / 企业部署

腾讯混元开源 Hy4 preview 与 FP8 权重。项目资料显示,该模型总参数为 770B、激活参数约 49B,提供 1M 上下文,并给出 vLLM、SGLang 等部署路径。

大模型体量提升会同步放大推理资源和运维复杂度。企业应在真实业务集上比较任务完成率、延迟、并发与总成本,而不是只比较参数规模。


Qoder 扩展云端智能体能力,工具调用进入可管理工作台

标签:智能体工作流 / 工程效率

Qoder Cloud Agents 的更新支持浏览器使用、云端任务执行与技能组合,智能体可在受控环境中完成网页交互和云服务流程。其产品文档也提供服务账号额度和沙箱计费等管理能力。

这类平台的价值不只在于自动化,还在于把身份、预算、工具和运行环境纳入统一管理。团队应先为服务账号设额度上限,再扩大自动执行范围。


Gemini Omni 1.1 Flash 进入 Preview,支持 4K 视频生成与编辑

标签:视频生成 / 内容生产

Google Cloud 文档显示,Gemini Omni 1.1 Flash Preview 于 8 月 27 日发布,面向视频、图像与文本任务,支持音视频编辑和最高 4K 分辨率的视频输入输出能力。

内容生产门槛进一步下降,但可发布性仍取决于脚本事实、素材授权、品牌一致性与成片审核。把这些环节保留在流程里,才能避免高分辨率放大低质量风险。


Google 搜索 AI 模式连接机票追踪与酒店预订

标签:智能体工作流 / 服务入口

Google 搜索 AI 模式扩展至航班追踪和酒店预订等服务场景,连接的合作平台数量进一步增加。搜索入口正在从信息检索界面变成能够协助完成交易决策的任务入口。

涉及价格、库存和订单的智能体流程,应清楚标识数据更新时间、推荐依据与最终确认人,避免用户把建议误当成已执行结果。


116 家机构联名强调 AI 网络安全风险

标签:AI 安全 / 风险治理

OpenAI、Anthropic、微软、Google、亚马逊等 116 家机构联名呼吁重视 AI 时代的网络安全风险,并推动更可信的访问与防御机制。模型能力提升也会降低攻击自动化与规模化的门槛。

企业上线智能体时,需把提示注入、越权调用、敏感数据外发和账号滥用纳入威胁建模,而不是只在上线后补救。


百度将完成香港双重主要上市转换

标签:AI 商业化 / 资本市场

百度宣布将于 9 月 1 日完成从香港第二上市到双重主要上市的转换。报道披露,截至 2026 年 6 月底其现金及投资为 2831 亿元,转换不涉及新增发行或融资。

AI 全栈布局最终仍需经受资金效率和商业兑现检验。对企业买方而言,供应商稳定性、产品持续性和退出方案应成为采购评估的一部分。


英伟达暂停以融资换云业务分成的计划

标签:算力商业化 / 平台治理

英伟达暂停一项面向 AI 云服务商的融资计划;报道称该计划原拟以信用支持换取云业务收入分成,并因潜在监管顾虑而调整。该消息仍属于商业安排层面的市场报道。

算力合作越深入,采购方越应看清价格、锁定期、资源优先级和数据迁移条款,避免把技术依赖转换成难以退出的商业依赖。


Midjourney V8.2 加强指令编辑与画布扩展

标签:AIGC 内容 / 设计工作流

Midjourney V8.2 更新图像编辑能力,强调按指令微调与画布扩展。生成工具逐步从一次性出图走向可迭代的设计工作流。

设计团队可把 AI 用在草图、延展和多方案探索,但应保留品牌素材库、版本记录和最终授权审核,确保生产效率不会牺牲可控性。


蚂蚁与中金推出金融增强大模型 Ling-3.0-flash-Fin

标签:行业模型 / 金融智能

蚂蚁集团与中金公司推出金融增强大模型 Ling-3.0-flash-Fin,聚焦金融任务的知识与推理能力。垂直模型的发展,说明通用能力正被进一步封装到有行业规则的业务场景。

金融、法务和医疗等高风险场景仍需把数据来源、结论依据、人工复核与责任主体写进系统流程,不能把模型输出直接当作专业结论。


微博处置 AI 炮制的聊天记录谣言

标签:AI 治理 / 内容可信

微博通报,一则涉及公众人物的聊天记录被认定为 AI 炮制,相关造谣账号受到永久关闭处置。低成本生成内容使伪造证据、误导传播和品牌风险更容易扩散。

企业面对外部 AI 内容时,需要建立核验、回应和留证流程;面对内部沟通,也应避免把未经核实的截图或生成材料当作决策依据。

有类似的场景想推进?

先把目标、边界和验收方式聊清楚,再决定怎么开始。