贝有科技

BEIYOO·AI 简报:DeepSeek 推理吞吐提升 5.3 倍,国产模型竞争进入工程效率阶段

返回 AI 简报#3902026-10-08
BEIYOO·AI 简报:DeepSeek 推理吞吐提升 5.3 倍,国产模型竞争进入工程效率阶段 封面图

Share

分享本期简报

手机端可调起系统分享;桌面端可复制链接或扫码后转发。

本期重点
  • DeepSeek-V4.1-Flash 在 vLLM 社区优化后,低并发速度提升 1.9 倍、受限吞吐提升 5.3 倍,国产模型竞争继续从参数和榜单转向可部署效率。
  • 阿里云与 Sui 打通 Agent 按调用购买云资源的支付链路,预算、限额和机器身份开始进入智能体基础设施。
  • OpenAI 将 GPT-6 与 Intelligent UI 推向 ChatGPT,让模型可在回答中生成图表、表单和即时工具。
  • Claude Haiku 5.5 以 1M 上下文和更低阶梯价格切入高频分类、路由、提取与子 Agent 任务。
  • Perplexity 发布 9B 与 0.6B 多模态嵌入模型,文档与截图检索开始减少对独立 OCR 流程的依赖。
  • Ai2、Unsloth、Datology 与 LlamaIndex 分别推进字节级模型、本地决策训练、确定性数据加载和 OCR 模型路由,模型工具链继续下沉。

今天值得国内团队关注的,不是又多了几个模型名称,而是模型能力正快速被推理内核、路由、数据加载、文档解析与支付机制重新包装。DeepSeek-V4.1-Flash 的吞吐提升说明,同一权重经过工程优化也能显著改变单位任务成本;阿里云的 Agent 支付则提醒企业,模型一旦能够自主采购资源,预算与权限必须成为系统能力。选型时应把模型分数与端到端时延、并发吞吐、调用成本和可审计性放在同一张表里。

Deep Read

今日深读

今日深读:国产模型的下一场竞争,是同一份能力能否更便宜、更稳定地跑起来

vLLM 与 Inferact 在三周内围绕 DeepSeek-V4.1-Flash 优化 CUDA Graph、官方内核和通信融合,在 150 TPS 约束下把吞吐提升到初始版本的 5.3 倍。这类改进不会改变模型权重,却会直接改变每台机器能承载的业务量。

对国内企业而言,模型评测不应只记录一次性准确率。真实工作流还需要统计首 token 延迟、完整任务耗时、并发下降曲线、失败重试、显存占用和工具调用成功率,才能比较云 API、自建推理和混合路由。

阿里云与 Sui 的 Agent 支付实验则把成本治理推到执行层。未来 Agent 可能自行购买云资源或调用外部服务,但每笔消费仍应绑定任务、预算、授权人和可撤销凭证,避免自动化把小额错误放大成持续支出。

By The Numbers

数字看板

5.3×

DeepSeek-V4.1-Flash 在 150 TPS 约束下的吞吐提升。

1M

Claude Haiku 5.5 的上下文窗口。

9B / 0.6B

Perplexity 新开放的两档多模态嵌入模型规模。

Action Item

企业能抄的作业

给国产模型做一次端到端推理基准

  1. 1选取 30 至 50 个真实脱敏任务,同时测试云 API 与自建推理。
  2. 2记录准确率、首 token 延迟、完整耗时、并发吞吐、显存和失败重试。
  3. 3把检索、OCR、工具调用和人工接管时间计入单任务总成本。
  4. 4为 Agent 外部调用设置单次预算、累计上限、白名单和紧急停用开关。

News Briefing

今日快讯

DeepSeek-V4.1-Flash 在 vLLM 上实现 5.3 倍吞吐提升【中国】

标签:国产大模型 / 推理优化 / 开源生态

摘要:Inferact 与 vLLM 团队披露,DeepSeek-V4.1-Flash 发布后三周内,通过 SWA bounded replay、CUDA Graph、DeepSeek 官方内核以及通信融合等优化,低并发速度提升约 1.9 倍,在 150 TPS 约束下的吞吐提升 5.3 倍。变化来自推理栈而不是新权重,说明国产模型的生产竞争已经进入内核、调度和部署效率阶段。企业复测时应使用自己的上下文长度、并发量与 Agent 工具调用链,避免直接套用实验环境的峰值数字。


阿里云与 Sui 打通 Agent 按调用购买云资源【中国】

标签:阿里云 / 智能体基础设施 / 支付治理

摘要:Sui 与阿里云宣布合作,让 Agent 能按次购买云计算资源,并通过稳定币结算,同时允许用户设置预算和消费上限。它展示了 Agent 从“调用工具”走向“自主采购执行资源”的基础设施形态,也把机器身份、支付授权和费用归因带入同一条链路。企业若采用类似机制,应把每笔消费绑定具体任务与授权人,并设置白名单、累计限额、异常熔断和可撤销凭证。


OpenAI 推出 GPT-6 Intelligent UI,回答开始直接生成交互工具

标签:基础模型 / AI 产品 / 交互界面

摘要:OpenAI 将 GPT-6 向 ChatGPT 更广泛用户开放,并推出 Intelligent UI,使回答能够组合文本、图表、地图、按钮、表单和可直接操作的小工具。系统通过原生组件库与流式编译器边生成边呈现界面,模型由此从输出内容进一步进入界面组织和轻应用生成。企业应把生成界面视为可执行软件:数据来源、输入校验、权限、无障碍和错误恢复仍需要产品侧负责。


Claude Haiku 5.5 发布,低价小模型瞄准高频 Agent 子任务

标签:基础模型 / 小模型 / 成本

摘要:Anthropic 发布 Claude Haiku 5.5,提供 1M token 上下文、最高 128K 输出,并针对分类、路由、提取和子 Agent 等高频任务定价。官方起步价为每百万输入 token 0.10 美元、输出 0.50 美元,但超过 100K 的长提示会进入更高价格档。团队选型时应同时测量输出长度和缓存命中率,因为“单价更低”并不必然等于完整任务成本更低。


Perplexity 开放两档多模态嵌入模型,PDF 与截图可直接进入检索

标签:嵌入模型 / 多模态检索 / 开源模型

摘要:Perplexity 发布 9B 与 0.6B 两档多模态嵌入模型,采用文本和图像共享的嵌入空间,并强调对 PDF、截图和复杂页面的检索能力。9B 版本面向更高质量的上下文检索,0.6B 版本则适合成本和延迟敏感场景。企业评测时应将文字段落、表格、截图和扫描件混合在同一测试集,并检查证据定位,而不是只看单一召回率。


Ai2 的 Bolmo 字节级模型研究登上 Nature,分词器不再是唯一入口

标签:模型研究 / 字节级模型 / 开源

摘要:Ai2 公布 Bolmo 字节级语言模型研究的 Nature 正式版本,并开放新的检查点,让既有模型能够通过“byteification”改造为直接处理字节序列。字节级方法有望改善罕见字符串、拼写变化和多语言字符的处理,但训练与推理效率仍需与成熟 tokenizer 路线比较。对代码、日志、OCR 噪声和混合语言任务较多的团队,这是一条值得单独建立评测集的技术路线。


Unsloth 将决策模型本地训练压到 4GB 显存

标签:本地训练 / 决策模型 / 低成本实验

摘要:Unsloth 发布本地训练决策模型的流程,展示在约 4GB 显存环境中微调 Qwen3.5 0.8B,并将三个决策基准的聚合准确率从 20.7% 提升至 74.3%。这降低了工单分类、路由和规则判定等窄任务的实验门槛,但小样本提升仍可能依赖特定基准。企业应先锁定标签定义、错误成本和留出测试集,再决定是否用本地微调替代通用 API。


Datology 开源 Zephon,让多 GPU 数据加载保持确定性

标签:训练基础设施 / 数据工程 / 开源

摘要:Datology 开源 Zephon,用于文本和多模态训练的数据加载,并强调在 GPU 数量、算子并行度或执行后端变化时保持全局批次顺序一致。它解决的是一个容易被忽略的实验问题:训练资源变化可能悄悄改变数据顺序,从而污染消融结论。模型团队可将确定性加载、断点恢复和数据版本指纹纳入训练验收,避免把基础设施波动误判为算法收益。


LlamaIndex 推出 OpenDocRouter,用统一 API 切换 OCR 与文档模型

标签:文档智能 / OCR / 模型路由

摘要:LlamaIndex 推出 OpenDocRouter,以统一 API 接入闭源与开源文档解析模型,并为不同模型保存版本化提示词、处理流程和参数。服务还提供版面框、统一元素类型以及质量与成本基准,方便在 MinerU、PaddleOCR、Claude、Gemini、GPT 等路线之间切换。企业仍需用发票、合同、表格和印章等真实文档复测,并审查文件留存、数据出域与失败页计费。


Google 向公众开放 SynthID Detector,跨厂商 AI 内容开始统一验证

标签:内容治理 / AI 水印 / 多模态

摘要:Google 将 SynthID Detector 向公众开放,用于检查图片、视频和音频中是否包含 SynthID 水印,并支持 Google 及 OpenAI、NVIDIA、Kakao 等合作方内容。官方称 SynthID 已覆盖超过 1800 亿张图片和视频,以及累计 24 万年的音频内容。水印检测适合作为来源证据之一,但压缩、裁剪和二次编辑可能影响结果,内容审核仍需结合元数据、发布链路与人工判断。


Epoch AI 的 InnovationEval 提醒:研究型 Agent 仍难稳定产生新方法

标签:AI 评测 / 研究智能体 / 能力边界

摘要:Epoch AI 推出 InnovationEval,测试 Agent 能否复现与近期人类后训练创新相当的方法改进;初步结果显示,现有 Agent 的表现仍不理想。这个评测把“会总结论文”和“能提出并验证新方法”区分开来,也提醒企业不要把检索型研究助手包装成自主研发系统。更稳妥的应用是让 Agent 负责文献整理、实验脚本和候选假设,再由研究人员决定验证路径与结论。


Karotte 强化学习框架开源,百万次运行经验被封装为训练工具

标签:强化学习 / 开源框架 / 模型训练

摘要:Preference Model 团队开源 Karotte 强化学习框架,并称相关组件已用于超过百万次训练运行。将任务环境、奖励、采样和训练循环沉淀为统一框架,有助于减少实验脚手架差异,但“运行次数”本身不代表结果质量。采用前应核对许可证、分布式恢复、日志可追踪性和奖励作弊测试,并从可复现的小规模任务开始。

有类似的场景想推进?

先把目标、边界和验收方式聊清楚,再决定怎么开始。