News Briefing
今日快讯
DeepSeek-V4.1-Flash 在 vLLM 上实现 5.3 倍吞吐提升【中国】
标签:国产大模型 / 推理优化 / 开源生态
摘要:Inferact 与 vLLM 团队披露,DeepSeek-V4.1-Flash 发布后三周内,通过 SWA bounded replay、CUDA Graph、DeepSeek 官方内核以及通信融合等优化,低并发速度提升约 1.9 倍,在 150 TPS 约束下的吞吐提升 5.3 倍。变化来自推理栈而不是新权重,说明国产模型的生产竞争已经进入内核、调度和部署效率阶段。企业复测时应使用自己的上下文长度、并发量与 Agent 工具调用链,避免直接套用实验环境的峰值数字。
阿里云与 Sui 打通 Agent 按调用购买云资源【中国】
标签:阿里云 / 智能体基础设施 / 支付治理
摘要:Sui 与阿里云宣布合作,让 Agent 能按次购买云计算资源,并通过稳定币结算,同时允许用户设置预算和消费上限。它展示了 Agent 从“调用工具”走向“自主采购执行资源”的基础设施形态,也把机器身份、支付授权和费用归因带入同一条链路。企业若采用类似机制,应把每笔消费绑定具体任务与授权人,并设置白名单、累计限额、异常熔断和可撤销凭证。
OpenAI 推出 GPT-6 Intelligent UI,回答开始直接生成交互工具
标签:基础模型 / AI 产品 / 交互界面
摘要:OpenAI 将 GPT-6 向 ChatGPT 更广泛用户开放,并推出 Intelligent UI,使回答能够组合文本、图表、地图、按钮、表单和可直接操作的小工具。系统通过原生组件库与流式编译器边生成边呈现界面,模型由此从输出内容进一步进入界面组织和轻应用生成。企业应把生成界面视为可执行软件:数据来源、输入校验、权限、无障碍和错误恢复仍需要产品侧负责。
Claude Haiku 5.5 发布,低价小模型瞄准高频 Agent 子任务
标签:基础模型 / 小模型 / 成本
摘要:Anthropic 发布 Claude Haiku 5.5,提供 1M token 上下文、最高 128K 输出,并针对分类、路由、提取和子 Agent 等高频任务定价。官方起步价为每百万输入 token 0.10 美元、输出 0.50 美元,但超过 100K 的长提示会进入更高价格档。团队选型时应同时测量输出长度和缓存命中率,因为“单价更低”并不必然等于完整任务成本更低。
Perplexity 开放两档多模态嵌入模型,PDF 与截图可直接进入检索
标签:嵌入模型 / 多模态检索 / 开源模型
摘要:Perplexity 发布 9B 与 0.6B 两档多模态嵌入模型,采用文本和图像共享的嵌入空间,并强调对 PDF、截图和复杂页面的检索能力。9B 版本面向更高质量的上下文检索,0.6B 版本则适合成本和延迟敏感场景。企业评测时应将文字段落、表格、截图和扫描件混合在同一测试集,并检查证据定位,而不是只看单一召回率。
Ai2 的 Bolmo 字节级模型研究登上 Nature,分词器不再是唯一入口
标签:模型研究 / 字节级模型 / 开源
摘要:Ai2 公布 Bolmo 字节级语言模型研究的 Nature 正式版本,并开放新的检查点,让既有模型能够通过“byteification”改造为直接处理字节序列。字节级方法有望改善罕见字符串、拼写变化和多语言字符的处理,但训练与推理效率仍需与成熟 tokenizer 路线比较。对代码、日志、OCR 噪声和混合语言任务较多的团队,这是一条值得单独建立评测集的技术路线。
Unsloth 将决策模型本地训练压到 4GB 显存
标签:本地训练 / 决策模型 / 低成本实验
摘要:Unsloth 发布本地训练决策模型的流程,展示在约 4GB 显存环境中微调 Qwen3.5 0.8B,并将三个决策基准的聚合准确率从 20.7% 提升至 74.3%。这降低了工单分类、路由和规则判定等窄任务的实验门槛,但小样本提升仍可能依赖特定基准。企业应先锁定标签定义、错误成本和留出测试集,再决定是否用本地微调替代通用 API。
Datology 开源 Zephon,让多 GPU 数据加载保持确定性
标签:训练基础设施 / 数据工程 / 开源
摘要:Datology 开源 Zephon,用于文本和多模态训练的数据加载,并强调在 GPU 数量、算子并行度或执行后端变化时保持全局批次顺序一致。它解决的是一个容易被忽略的实验问题:训练资源变化可能悄悄改变数据顺序,从而污染消融结论。模型团队可将确定性加载、断点恢复和数据版本指纹纳入训练验收,避免把基础设施波动误判为算法收益。
LlamaIndex 推出 OpenDocRouter,用统一 API 切换 OCR 与文档模型
标签:文档智能 / OCR / 模型路由
摘要:LlamaIndex 推出 OpenDocRouter,以统一 API 接入闭源与开源文档解析模型,并为不同模型保存版本化提示词、处理流程和参数。服务还提供版面框、统一元素类型以及质量与成本基准,方便在 MinerU、PaddleOCR、Claude、Gemini、GPT 等路线之间切换。企业仍需用发票、合同、表格和印章等真实文档复测,并审查文件留存、数据出域与失败页计费。
Google 向公众开放 SynthID Detector,跨厂商 AI 内容开始统一验证
标签:内容治理 / AI 水印 / 多模态
摘要:Google 将 SynthID Detector 向公众开放,用于检查图片、视频和音频中是否包含 SynthID 水印,并支持 Google 及 OpenAI、NVIDIA、Kakao 等合作方内容。官方称 SynthID 已覆盖超过 1800 亿张图片和视频,以及累计 24 万年的音频内容。水印检测适合作为来源证据之一,但压缩、裁剪和二次编辑可能影响结果,内容审核仍需结合元数据、发布链路与人工判断。
Epoch AI 的 InnovationEval 提醒:研究型 Agent 仍难稳定产生新方法
标签:AI 评测 / 研究智能体 / 能力边界
摘要:Epoch AI 推出 InnovationEval,测试 Agent 能否复现与近期人类后训练创新相当的方法改进;初步结果显示,现有 Agent 的表现仍不理想。这个评测把“会总结论文”和“能提出并验证新方法”区分开来,也提醒企业不要把检索型研究助手包装成自主研发系统。更稳妥的应用是让 Agent 负责文献整理、实验脚本和候选假设,再由研究人员决定验证路径与结论。
Karotte 强化学习框架开源,百万次运行经验被封装为训练工具
标签:强化学习 / 开源框架 / 模型训练
摘要:Preference Model 团队开源 Karotte 强化学习框架,并称相关组件已用于超过百万次训练运行。将任务环境、奖励、采样和训练循环沉淀为统一框架,有助于减少实验脚手架差异,但“运行次数”本身不代表结果质量。采用前应核对许可证、分布式恢复、日志可追踪性和奖励作弊测试,并从可复现的小规模任务开始。
