贝有科技

BEIYOO·AI 简报:DeepSeek V4.1 Flash 正式发布,KV Cache 降至上一代四分之一

返回 AI 简报#3752026-09-11
BEIYOO·AI 简报:DeepSeek V4.1 Flash 正式发布,KV Cache 降至上一代四分之一 封面图

Share

分享本期简报

手机端可调起系统分享;桌面端可复制链接或扫码后转发。

本期重点
  • DeepSeek 正式发布 V4.1 Flash:552B MoE、原生视觉理解,KV Cache 的 HBM 占用降至上一代 Flash 的四分之一。
  • OpenAI 推出 Agents API,把任务、模型、工具和环境组合为可托管运行的云端 Agent。
  • ChatGPT Work 上线 Data agent,连接经批准的数据源,以自然语言产出分析、仪表板与后续动作。
  • OpenAI 推出面向金融机构的 ChatGPT for Financial Services,强调金融数据、可追溯引用和企业治理。
  • Anthropic 披露并拦截模型被用于网络攻击、监控和可能导向生物武器研究的滥用尝试。
  • Skild AI 称首次商业部署十个月后 ARR 达 1 亿美元、付费客户超 60 家,具身 AI 开始接受经营指标检验。

今天最重要的变化,是 Agent 的单位经济模型正在被重写。DeepSeek 把 KV Cache 压缩到上一代 Flash 的四分之一 HBM 占用,让长文档、多轮工具调用和高并发任务的成本边界进一步下移;OpenAI 则把 Agent、企业数据分析和金融工作流一起产品化。能力与接入门槛同时下降后,企业不应只盯每百万 Token 价格,而要看完整交付成本:数据是否可信、权限是否最小化、执行是否能被中止、结果是否能被复核。成本更低的 Agent,尤其需要更明确的边界。

Deep Read

今日深读

Agent 的成本瓶颈正在从“模型单价”转向“上下文与执行链”

DeepSeek V4.1 Flash 的重点不只是模型更换。官方披露,新架构将 KV Cache 的 HBM 占用降至上一代 Flash 的四分之一、SSD 存储降至八分之一,并用输入 8B、输出 16B 的激活规模服务 552B MoE。对于持续读取文档、工具回传和多轮规划的 Agent,缓存成本开始成为与模型能力同等重要的架构变量。

同一天,OpenAI 把 Agents API、ChatGPT Work 的 Data agent 与金融服务方案推向企业工作流。它们共同指向同一件事:模型不再只输出答案,而是连接数据源、工具、模板与长会话去完成任务。企业的竞争点随之从“接上模型”转向“能否把数据语义、权限、证据和人工复核接进执行链”。

成本下降并不等于可以无边界放权。缓存更省会让更长上下文、更多工具调用和更高并发成为常态,也会放大错误数据、越权检索与无效循环的代价。上线前应以真实任务测量每次成功交付的总成本,并为数据访问、高影响动作和异常停止设定清晰阈值。

By The Numbers

数字看板

1/4

DeepSeek 称 V4.1 Flash 的 KV Cache HBM 占用降至上一代 Flash 的四分之一。

1/8

DeepSeek 称其 KV Cache SSD 存储需求降至上一代 Flash 的八分之一。

$1亿

Skild AI 称其在首次商业部署十个月后达到 1 亿美元年化收入运行率。

Action Item

企业能抄的作业

用“单次成功交付成本”评估你的 Agent

  1. 1选一个已运行的长上下文任务,记录输入、缓存命中、工具调用、人工复核和失败重试,算出一次被业务接受的总成本。
  2. 2为数据 Agent 标注可访问的库、表、行列与文档域;先用最小数据范围验证答案和引用,再扩展连接器。
  3. 3给循环调用、预算消耗、敏感数据外发和高影响动作设置停止阈值,并将人工接管入口写进任务界面。

News Briefing

今日快讯

DeepSeek 正式发布 V4.1 Flash,压缩 Agent 的缓存成本

标签:模型 API / 推理架构

摘要: DeepSeek 正式发布 V4.1 Flash,采用 552B MoE 与因果编码器—解码器架构,官方称输入阶段激活 8B 参数、输出阶段激活 16B 参数,并支持原生视觉理解。更直接的变化是 KV Cache:官方称 HBM 占用降至上一代 Flash 的四分之一、SSD 存储降至八分之一。长文档、工具回传和多轮规划会放大缓存成本,团队应把上下文结构、缓存命中和任务总成本纳入模型评测。


DeepSeek 将逐步把 V4 Pro 请求切换至 V4.1 Flash

标签:模型迁移 / 成本治理

摘要: DeepSeek 表示 V4-Flash 与 V4-Flash-Vision-Exp 已退役,并计划自 9 月 14 日起将 V4 Pro 请求路由至 V4.1 Flash,直到 V4.1 Pro 发布。官方还保留峰谷定价,非高峰费率为高峰的一半。模型迁移不能只看供应商宣称的综合表现,企业应提前锁定一组真实任务,对比输出格式、工具调用、延迟、失败率和账单变化。


OpenAI 推出 Agents API,托管运行长会话 Agent

标签:Agent 开发 / 云端执行

摘要: OpenAI 发布 Agents API,开发者可在一次调用中指定任务、模型、工具和环境,并基于其托管的 Agent harness 运行云端 Agent。产品方向是把长会话、工具调用与执行环境从应用代码中进一步抽象出来。对企业而言,方便接入不等于责任外包:工具白名单、环境隔离、任务预算与审计日志仍应由业务系统明确配置。


ChatGPT Work 上线 Data agent,连接企业数据生成分析与仪表板

标签:企业数据 / 数据 Agent

摘要: OpenAI 推出 ChatGPT Work 的 Data agent,可连接 Redshift、BigQuery、Databricks、Snowflake、MongoDB 等经批准数据源,并将自然语言问题转为分析、交互式仪表板和后续动作。官方称查询会沿用已连接账户的表、行和列权限。企业部署时仍要先统一指标口径、数据血缘和引用规则;没有共同语义层,回答再流畅也可能把不同定义的指标混在一起。


OpenAI 发布 ChatGPT for Financial Services

标签:金融 AI / 可追溯分析

摘要: OpenAI 面向合格金融机构发布 ChatGPT for Financial Services,结合 GPT-6 Astra、金融数据与研究、建模、客户材料等工作流,并强调对数字和结论提供细粒度引用。产品还提供访问控制、数据连接管理与工作区日志导出能力。金融团队应把它定位为分析和材料制作的辅助层,而非投资建议替代品;关键判断仍需独立复核、授权与留档。


Anthropic 披露并拦截多类模型滥用尝试

标签:AI 安全 / 滥用治理

摘要: Anthropic 在最新威胁情报披露中称,其拦截了利用模型支持网络攻击、监控和可能导向生物武器研究的尝试。报道同时强调,这些案例不是典型使用情形,而是该公司识别到的显著、新型威胁活动。对开放工具能力的企业,风险控制不能只依赖模型拒答,还要结合身份核验、异常模式监测、人工升级和事后追踪。


美国参议院关注 OpenAI Agent 涉及 Hugging Face 的事件

标签:Agent 安全 / 外部监管

摘要: 报道显示,美国参议员正就 OpenAI Agent 涉及 Hugging Face 的安全事件寻求更多信息。外部监管的关注点正在从“模型说了什么”延伸到 Agent 如何绕过控制、如何连接第三方环境,以及供应商如何披露和修复。企业接入浏览器、代码仓库或 SaaS 工具前,应做单独的第三方访问评审,而不是把它视作普通聊天功能。


Skild AI 称 ARR 达 1 亿美元,付费客户超过 60 家

标签:具身 AI / 商业化

摘要: Skild AI 表示,在首次商业部署十个月后,其年化收入运行率达到 1 亿美元,付费客户超过 60 家,覆盖搬运、配送、巡检、安保、餐饮、仓储、工厂和数据中心等场景。公司与 NVIDIA、富士康合作,把 Skild Brain 部署在双臂设备上用于 Blackwell 系统精密装配。具身 AI 正从实验演示进入收入、客户数和具体工序的检验阶段,试点应优先选择边界清晰、人工接管方便的流程。


NVIDIA 展示 Skild S1:单段视频可教会机器人新任务

标签:机器人学习 / 现场部署

摘要: NVIDIA 介绍 Skild AI 的 S1 机器人基础模型,主打从单段演示视频学习新任务;在一项盆栽测试中,团队称从记录演示到硬件自主执行用了 11 分钟。这样的展示降低了现场示教门槛,但不代表所有工序都能直接复制。企业评估时应分别测量任务成功率、环境变化下的稳定性、停机恢复时间和人工安全边界。


围绕高能力 AI 的“停止机制”讨论升温

标签:AI 治理 / 应急控制

摘要: 围绕高能力 AI 的安全讨论持续升温,研究者、企业和政策制定者开始讨论如何建立更可操作的停止、限制和应急响应机制。宏观监管的具体路径仍有分歧,但对企业有一个直接启发:不要等待行业统一规则才准备停机能力。生产系统应预置密钥轮换、工具断连、任务暂停、日志保全和人工接管流程。

有类似的场景想推进?

先把目标、边界和验收方式聊清楚,再决定怎么开始。