News Briefing
今日快讯
Anthropic 披露 Claude 已“主导”26% 模型研发工作,但尚无完全自主任务
标签:前沿模型 / 研发自动化
摘要: Anthropic 发布内部测量方法称,截至 2026 年 8 月,Claude 在其 26% 的模型研发工作中达到“主导”级别:可从高层提示完成任务的大部分端到端工作,但仍有人类监督;超过九成工作至少属于人机协作级别。公告同时明确,在被测研发工作中没有完全自主的任务。这个口径提醒团队,不要把“自动化覆盖率”误传成人力天数或无人值守能力;应区分辅助、协作、主导与自主,并把每一级对应的审批和监控写清楚。
Anthropic 与 Accenture 启动嵌入式独立评估,双方计划五年各投至少 10 亿美元
标签:AI 安全 / 独立评估
摘要: Anthropic 宣布与 Accenture 合作,由其专业 AI 业务 Faculty 组建嵌入式评估团队,进入 Anthropic 的研发环境开展模型评估、红队测试、对齐评估和防护测试。双方预计未来五年各投入至少 10 亿美元建设相关能力;这项合作为非排他安排,Anthropic 还计划与更多评估方协作。与发布前一次性测评相比,嵌入式评估把观察点放进训练与部署过程,也要求更清楚地处理访问权限、独立性和报告机制。
Anthropic 向生命科学机构开放验证计划,以分级准入换取更适配的研发能力
标签:生命科学 AI / 访问治理
摘要: Anthropic 推出 Life Sciences Verification Program(LSVP)测试版,面向经核验的生命科学团队开放更适合药物发现、临床开发和制造等工作的模型能力。项目将访问分为 Standard Use 与 High-risk Use:后者按单个项目授权、每六个月续期,并要求更严格核验;对被标记活动相关数据要求留存 30 天用于离线监测。高敏感行业的可用性不必只能靠“一刀切拦截”,但更宽访问必须与组织身份、用途声明、审查和事故处置一起设计。
Claude 联合 Adaptyv Bio 发起蛋白设计竞赛,计划实验验证逾 5,000 个方案
标签:科研 AI / 蛋白设计
摘要: Anthropic 表示正与 Adaptyv Bio 发起蛋白设计竞赛,计划对社区提交的超过 5,000 个设计进行实验验证,涵盖跨物种反应性、pH 敏感性、肽-MHC 特异性和 GPCR 等挑战;Anthropic 还将提供最高 100 万美元 Claude 额度,Modal 与 Twist Bioscience 分别提供算力和 DNA 支持。这里的重点不只是生成更多候选分子,而是把模型输出接回实验验证。企业引入科研智能体时,应把可验证的实验或人工复核安排在工作流里,而不是只比较生成数量。
欧盟 AI Board 第九次会议聚焦 AI Act 执行、AI 事件与网络安全
标签:AI 政策 / 合规治理
摘要: 欧盟委员会披露,AI Board 于 9 月 17 日召开第九次会议,讨论欧盟及国际 AI 政策进展、委员会的执法活动与优先事项、AI Act 落地,以及网络安全与 AI 行动计划;摩尔多瓦首次以观察员身份参会。监管讨论正在从原则性框架走向执行协同和事件能力。面向欧洲客户的团队应提前把风险分级、模型与数据记录、供应商责任和事故响应纳入交付,不要等到审计时再从系统日志中拼材料。
Google Labs 推出家庭协作智能体 CC,最多支持六位成员共享事务
标签:智能体产品 / 权限协作
摘要: Google Labs 宣布试验性家庭智能体 CC,帮助成员管理日程、任务、餐食计划和报名表等事务;用户可邀请最多六位成员选择性共享信息,产品目前面向美国年满 18 岁、使用个人 Google 账号的人开放或候补。多用户智能体把“代办”扩展为共享工作流,也会同时放大日历、位置、购买和消息等数据的授权复杂度。产品团队应将成员可见范围、代办确认和撤销机制设计为默认能力。
Reuters:美国 Federal Register 曾短暂使用 Qwen 检索法规意见,后下线该功能
标签:公共采购 / 模型供应链
摘要: 路透社 9 月 17 日报道,美国国家档案馆运营的 Federal Register 网站曾提供基于阿里 Qwen 的工具,供用户检索拟议法规的公众意见;据报道,该功能在社交媒体关注后于当天被下线。报道涉及的模型来源与美国监管环境叠加,使公共信息检索也成为供应链审查议题。无论模型来自哪里,组织采购或接入外部模型前都应明确数据是否出境、提示词和检索内容如何留存、供应商变更如何通知,以及在争议出现时能否快速切换。
SafeSeal 发布可验证 LLM 文本水印方案,报告检测率 95.10%
标签:内容溯源 / 知识产权
摘要: 纽约州立大学研究基金会发布 SafeSeal 技术介绍:方案以命名实体识别保护关键实体,并通过语境相关的同义替换嵌入水印;发布方报告其 BERTScore 为 0.981、实体相似度 0.962、水印检测率 95.10%。这些指标来自发布方说明,仍需要独立复现与真实攻击测试。对企业而言,水印可成为内容溯源的一层证据,但不应替代访问控制、版权授权、版本记录和人工核验。
Gemini API 更新 Antigravity Agent 预览版,工具调用参数与文件操作接口发生变化
标签:开发者工具 / API 迁移
摘要: Google 在 Gemini API 更新记录中发布 Antigravity Agent 09-2026 预览版,并说明其替代 05-2026 版本;远程沙箱中只读取文本输出的应用可仅更新代理字符串,而本地工具调用和函数调用解析场景需要适配 PascalCase 参数及新的行范围文件编辑接口。智能体 API 的升级常常不是简单换模型名,工具协议变化可能直接影响自动化稳定性。团队应为调用适配层做版本锁定、契约测试和灰度回退,避免在生产任务中直接切换。
Arrive AI 与 DXC 合作,把自主配送能力延伸到企业制造场景
标签:具身智能 / 企业物流
摘要: Arrive AI 在 9 月 18 日发布消息称,将与 DXC 合作,把其自主配送基础设施能力扩展到企业级制造场景。此类落地把 AI 从软件工作流延伸到无人机、机器人、自动移动设备与人工配送交接的物理链路,关键不只在调度算法,还在身份验证、交接证据、异常处置与设备状态。制造企业评估具身智能项目时,应先定义一段可控的交接闭环,再扩展到更长的园区或供应链流程。
