News Briefing
今日快讯
DeepSeek 发布 V3.2-Exp,以稀疏注意力下调长上下文成本【中国】
标签:国产模型 / 长上下文 / API 成本
摘要:DeepSeek 于 9 月 29 日发布实验性模型 V3.2-Exp,并同步开源。公开信息显示,该版本引入 DeepSeek Sparse Attention(DSA)机制,重点优化长文本训练与推理效率;其 API 也调整为缓存命中输入 2 元/百万 tokens、输出 3 元/百万 tokens。对企业而言,重点不是只看降价幅度,而是用真实知识库验证长上下文的召回、引用准确率和总任务成本。
OpenAI DevDay 今日开幕,开发者工具链进入集中展示窗口
标签:开发者生态 / API / 智能体
摘要:OpenAI DevDay 于 9 月 29 日在旧金山举行,官方安排包括主题演讲、API 与工具技术议程、演示和开发者交流。大型模型厂商的竞争已经不止于模型发布,能否把工具调用、评估、部署和计费做成稳定的开发者路径同样关键。企业团队可借此检查自家方案是否过度依赖单一供应商的私有接口。
腾讯开源混元图像 3.0,工业级多模态生成继续向开源侧扩散【中国】
标签:图像生成 / 开源模型 / 多模态
摘要:公开报道显示,腾讯于 9 月 28 日发布并开源混元图像 3.0,主打复杂语义理解和长文本生成能力。图像模型是否能进入电商、营销与设计流程,取决于一致性、版权素材管理、人工校对和品牌规范,而非单张样图效果。团队应把批量生产中的返工率和审核耗时作为首要验收指标。
百度千帆开源 Qianfan-VL,视觉理解瞄准 OCR 与教育等企业场景【中国】
标签:视觉语言模型 / 企业部署 / 国产算力
摘要:百度智能云千帆推出并开源 Qianfan-VL 系列,覆盖 3B、8B、70B 尺寸,公开信息称其对 OCR 与教育等高频场景做了优化,并在昆仑芯 P800 完成相关计算任务。视觉模型落地时,要优先抽检票据、表格、低清扫描件和边缘样本,避免以通用基准替代真实业务准确率。
Kimi 灰度测试 OK Computer,端到端 Agent 开始直接面对多工具协同【中国】
标签:智能体 / 工具调用 / 工作流
摘要:月之暗面近期为 Kimi 推出 Agent 模式“OK Computer”并启动灰度测试,定位是用端到端训练提升自主决策和多工具协同。Agent 一旦从问答进入执行,权限分级、操作确认、审计日志和异常回滚必须被设计成产品能力。先让它处理低风险、可撤销的任务,通常比直接授权全流程更稳妥。
阶跃推出桌面 AI 伙伴,本地文件与网页连接器带来新的治理边界【中国】
标签:桌面 Agent / 本地数据 / 权限治理
摘要:阶跃星辰发布“阶跃桌面 AI 伙伴(小跃)”,支持常驻桌面、管理本地文件与访问互联网。桌面 Agent 的价值在于缩短上下文切换,但也更接近企业的文档、账号和浏览器会话。部署前应采用最小文件范围、敏感目录排除、关键操作二次确认与可检索日志。
Vidu Q2 上线图生视频与 API,视频生产从样片走向可嵌入流程【中国】
标签:视频生成 / 内容生产 / API
摘要:生数科技发布 Vidu Q2,提供闪电与电影大片两种图生视频模式,网页版、App 和 API 同步上线。生成视频的核心挑战是角色一致性、版权素材、品牌审核和批量返工,不是单次效果展示。运营团队可先从低风险商品讲解、课程短片等场景建立提示词、审核与归档流程。
Jev 把模型输出收窄为结构化决策,高频自动化开始重新核算成本
标签:决策模型 / 推理成本 / 自动化
摘要:TypeSafe AI 推出的 Jev 不以自然语言长回复为目标,而是输出选择、评分或是非判断等结构化结果。报道提到该产品以低时延和低价格瞄准程序化高频决策,相关性能主张仍需独立测试验证。这提醒团队:并非每一步都需要最强通用模型,分类、路由和阈值判断可以单独选择更合适的模型与评测方法。
国内团队梳理递归自我改进,AI 参与研发不等于 AI 自主决定研发
标签:AI for AI / 研发效率 / 评测治理
摘要:上海交大、清华、字节跳动与上海 AI 实验室等团队近期发布预印本,尝试按 AI 是否能自主决定改进机制将递归自我改进分级。报道同时提醒,现阶段 AI 能够参与编码、调试和基础设施优化,但目标选择、结果评估与风险判断仍在人的控制下。企业引入研发 Agent 时,代码审查、变更审批、回归测试和责任归属不能被“自动化”一笔带过。
DeepSeek R1 登上《自然》封面,开源模型的可信度开始接受更严格的学术检验【中国】
标签:开源模型 / 科研评估 / 可信 AI
摘要:公开报道显示,DeepSeek-R1 近期登上《自然》封面,并被描述为经过同行评审的重要大语言模型案例。模型论文、评测和开源权重能够提高可审查性,但不能替代企业自身的数据安全和任务验证。采购或自建团队应把公开材料作为初筛,再以脱敏业务样本完成可复现验收。
