贝有科技

BEIYOO·AI 简报:OpenAI 研究组织,Agent 总运行量达人工 3.1 倍

返回 AI 简报#3712026-09-07
BEIYOO·AI 简报:OpenAI 研究组织,Agent 总运行量达人工 3.1 倍 封面图

Share

分享本期简报

手机端可调起系统分享;桌面端可复制链接或扫码后转发。

本期重点
  • OpenAI 披露:按标准 8 小时工作日折算,其研究组织 Agent 总运行量为人类总劳动量的 3.1 倍;企业需要把并发任务的预算、上下文和验收纳入管理。
  • Anthropic 表示 Claude 用 11 天完成费马大定理的端到端形式化,展示多智能体协作在“可验证产物”上的潜力。
  • 科大讯飞发布星火 X2.5,以 293B-A30B MoE 架构强化代码和 Agent 能力;国产算力上的模型交付继续推进。
  • 腾讯微信视觉团队开源 WeMM-Embedding,多模态嵌入服务日调用量称达十亿级;企业检索和多模态索引的基础层正在下沉。
  • 千问开放平台新上 10 余个金融服务 Agent,覆盖证券、基金、期货与保险;高敏感行业的入口扩张需要同步配套权限与人工复核。
  • Anthropic 15 亿美元版权和解开始进入分配阶段,生成式 AI 的训练数据治理仍会直接影响内容方、平台与模型公司。

今天的核心不是又多了一个模型,而是智能体开始被当作“可调度产能”来管理:OpenAI 用运行量和实验速度观察研发,Anthropic 则把长链协作压进可机检的证明。企业若只把 Agent 当聊天工具,很难得到可复制的效率;若直接放开并发,又会把错误、成本和数据暴露同步放大。下一步应当把任务拆解、并发上限、上下文来源、验收标准和人工接管连成一条运营链,先让一条流程稳定地多跑起来,再扩大使用范围。

Deep Read

今日深读

OpenAI:研究组织的 Agent 总运行量已达人工 3.1 倍

OpenAI 在最新研究披露中称,截至 8 月中旬,按标准 8 小时工作日折算,整个研究组织的智能体总运行量为人类总劳动量的 3.1 倍;中位研究员按 API 价格计算的日推理用量超过 600 美元。这是组织汇总的运行时长口径,并不表示每一位研究员都获得了固定的 3.1 倍产能。

当多个 Agent 同时写代码、跑实验、排查基础设施时,组织的瓶颈会从“有没有人会调用模型”转移到任务拆解、上下文交接、算力预算和结果验收。Anthropic 用多智能体在 11 天内完成费马大定理的 Lean 形式化,正好说明了:长链任务的价值取决于可验证的中间产物与协作脚手架,而非一次性回答。

企业不必照搬研究机构的高并发模式。更实际的做法是选一条可复核的工作流,规定每个 Agent 的输入、输出、预算与人工验收点;把并发扩张建立在可追踪、可回滚的交付物上。

By The Numbers

数字看板

3.1倍

按标准 8 小时工作日折算,OpenAI 研究组织的 Agent 总运行量为人类总劳动量的 3.1 倍;这是组织级汇总口径。

11天

Anthropic 表示 Claude 在多智能体协作下,用 11 天完成费马大定理的首个端到端 Lean 形式化证明,并由计算机检查。

293B

讯飞星火 X2.5 采用 293B-A30B MoE 架构,重点提升代码、智能体和长上下文能力,并强调国产算力训练推理。

Action Item

企业能抄的作业

给一条工作流设定“Agent 并发作业单”

  1. 1选一个可复核的任务,例如竞品资料整理、测试用例生成或售后工单分类,拆成不超过 4 个明确子任务,并为每个子任务指定输入来源与交付格式。
  2. 2同时运行的 Agent 不超过 3 个;记录各自的模型、Token 或费用、运行时长和失败原因,避免把并发当成无上限的调用次数。
  3. 3由业务负责人按统一清单验收:事实是否可追溯、结论是否可复现、哪些结果要人工改写;一周后再决定是否扩大并发。

News Briefing

今日快讯

OpenAI:研究组织 Agent 总运行量达人工 3.1 倍

标签:AI 研发 / 智能体协作

摘要: OpenAI 表示,截至 8 月中旬,按标准 8 小时工作日折算,整个研究组织的 Agent 总运行量为人类总劳动量的 3.1 倍;这是组织汇总的运行时长,不是单个研究员或单个 Agent 的效率。中位研究员的日推理用量按 API 价格计算超过 600 美元。研究人员正用并发编码 Agent 跑实验和排查基础设施,代码产出与实验次数均在增长;企业要把并发 Agent 与预算、任务边界和验收机制一起管理。


Claude 用 11 天完成费马大定理的端到端形式化

标签:科学智能体 / 可验证 AI

摘要: Anthropic 表示,Claude 在多智能体协作下用 11 天写出费马大定理的首个端到端、经 Lean 检查的形式化证明。项目产生约 1300 万行 Lean 代码,并通过图结构任务分解和中间定理复用来支撑协作。它提示企业:长任务不是让一个模型“想得更久”,而是要有可验证中间产物、明确依赖关系和可恢复的协作机制。


讯飞发布星火 X2.5,强化代码与 Agent 能力

标签:国产大模型 / 开发者工具

摘要: 科大讯飞发布星火 X2.5,采用 293B-A30B MoE 架构,重点提升代码、智能体、数学和理解能力,并称训练和推理基于国产算力完成。端侧 4B 与 1.7B 模型已先行开源,支持最长 100 万 Token 上下文。企业评估模型时,应把模型能力、部署位置、上下文长度和实际任务成本放在同一张对比表里。


微信视觉团队开源 WeMM-Embedding 多模态嵌入模型

标签:多模态检索 / 开源生态

摘要: 腾讯微信视觉团队开源 WeMM-Embedding,支持文本和图像等多模态输入,并提供 2B、4B、9B 多个版本;相关服务日调用量称已达十亿级。嵌入模型决定了资料能否被召回、相似内容能否被聚合,是企业知识库和视觉检索的底层能力。上线前应以自己的文档、图片和业务查询做召回质量测试,而非只看公开榜单。


千问开放平台新增 10 余个金融服务 Agent

标签:行业智能体 / 金融服务

摘要: 千问开放平台新增十余个金融服务智能体,覆盖证券、基金、期货和保险等入口。金融 Agent 的价值在于压缩信息收集与服务路径,但推荐、交易和客户信息都属于高敏感动作。平台与接入企业应把适当性提示、数据权限、人工确认和留痕作为默认能力,而不是上线后的补丁。


Anthropic 15 亿美元版权和解进入分配阶段

标签:版权治理 / AI 合规

摘要: Anthropic 就版权集体诉讼达成的 15 亿美元和解金开始进入分配环节,作者与出版社之间的分配争议仍在持续。案件将训练数据的来源、授权和补偿带回商业合同与产品合规的核心位置。使用外部内容训练、检索或生成营销材料的团队,应保存内容来源、授权范围和删除机制。


Gemini 在 Android 试行悬浮气泡,降低多任务切换成本

标签:移动端 AI / 产品入口

摘要: Google 正在 Android 分阶段推出 Gemini 的“最小化”快捷入口,让全屏交互折叠为悬浮气泡,用户可在处理复杂提示词时继续使用邮件、社交或浏览器。AI 助手从独立页面变成随时可被调用的系统层入口,产品体验会更依赖上下文切换与任务恢复。移动端服务设计应保留清晰的状态提示和可控的接管入口。


中国模型周调用量继续领跑,成本与可用性成竞争变量

标签:模型市场 / 推理成本

摘要: OpenRouter 数据显示,8 月 31 日至 9 月 6 日中国模型周调用量为 56.72 万亿 Token,连续 19 周超过美国;腾讯 Hy4 preview 单周调用量增长显著。调用量不等于业务价值,但它能反映价格、可用性和开发者迁移的合力。企业应持续保留多模型评测和路由能力,避免单一供应商的成本或容量变化直接影响核心流程。


AI 生成菜单引发反感,品牌内容仍需人工把关

标签:生成式内容 / 品牌风险

摘要: 美国餐饮场景中出现 AI 生成菜单图片因食物质感怪异而引发消费者反感的案例。视觉生成能降低制作门槛,却不能替代品牌审美、食物真实性和上线前审核。面向消费者的生成内容应设定素材来源、人工审稿和小范围测试,尤其不要把高风险创意直接推到交易页面。


OpenAI 继续讨论 AI 加速研发与安全之间的张力

标签:前沿模型 / 安全治理

摘要: OpenAI 在披露研发加速数据的同时强调,自动化研究需要在人类监督下推进,并将安全、能力透明度和公众讨论视为同等重要的议题。研发速度加快会让评估、计算资源和组织决策成为更显著的瓶颈。企业引入更强的 Agent 时,也应同步升级红队测试、权限边界和事故复盘,而不是等到出现问题再补流程。

有类似的场景想推进?

先把目标、边界和验收方式聊清楚,再决定怎么开始。