贝有科技

BEIYOO·AI 简报:AI 跨过屏幕,开源、车机与机器人开始同场交付

返回 AI 简报#3452026-07-31
BEIYOO·AI 简报:AI 跨过屏幕,开源、车机与机器人开始同场交付 封面图

BEIYOO·AI 简报 #345|2026-07-31 2026年7月31日 AI 资讯摘要,聚焦 DeepSeek 轻量智能体模型、国产多模态与语音模型、车机接入、具身协作、开源生态和 AI 政策等动态。 本期重点: 1. DeepSeek-V4-Flash 公测上线:以更少的激活参数瞄准 Agent 调用,并兼容 Responses API 与 Codex 生态;轻量模型正在把智能体成本拉回可规模化的区间。 2. MiniMax H3 与字节 Seedance 2.5 同日推进音视频生成,分别强调全模态统一、双声道输出与 30 秒叙事、可控编辑;视频 AI 开始从演示片段走向可交付的制作流程。 3. 特斯拉中国车机接入豆包大模型,阿里发布面向专业词汇与长音频的 Qwen-Audio-3.0-ASR-Flash;AI 正进入驾驶座舱、会议与客服这些高频且有边界的场景。 4. HuggingNews 报道 Google 推进 Gemini Robotics 多机器人协作;“会回答”的模型正在获得面向真实环境的物理执行接口。 5. 华为 openPangu-2.0-Pro 与 LG K-EXAONE 2.0 相继开源,东亚开源模型竞争从参数规模进一步延伸到许可证、国产硬件与工具调用能力。 6. 国家层面提出加快《人工智能法》立法,韩国也扩大主权基金对 AI 与数据中心的支持;模型竞争正在同时进入治理、能源与长期资本配置。

Share

分享本期简报

手机端可调起系统分享;桌面端可复制链接或扫码后转发。

本期重点
  • DeepSeek-V4-Flash 公测上线:以更少的激活参数瞄准 Agent 调用,并兼容 Responses API 与 Codex 生态;轻量模型正在把智能体成本拉回可规模化的区间。
  • MiniMax H3 与字节 Seedance 2.5 同日推进音视频生成,分别强调全模态统一、双声道输出与 30 秒叙事、可控编辑;视频 AI 开始从演示片段走向可交付的制作流程。
  • 特斯拉中国车机接入豆包大模型,阿里发布面向专业词汇与长音频的 Qwen-Audio-3.0-ASR-Flash;AI 正进入驾驶座舱、会议与客服这些高频且有边界的场景。
  • HuggingNews 报道 Google 推进 Gemini Robotics 多机器人协作;“会回答”的模型正在获得面向真实环境的物理执行接口。
  • 华为 openPangu-2.0-Pro 与 LG K-EXAONE 2.0 相继开源,东亚开源模型竞争从参数规模进一步延伸到许可证、国产硬件与工具调用能力。
  • 国家层面提出加快《人工智能法》立法,韩国也扩大主权基金对 AI 与数据中心的支持;模型竞争正在同时进入治理、能源与长期资本配置。

今天的共同信号是:模型能力正在跨过“屏幕里的对话”,进入更具体的交付界面。DeepSeek 把 Agent 能力压到更轻的激活规模,Qwen 解决行业语音里的术语与长上下文,Seedance 和 MiniMax 将生成视频推向更长、更可控的制作链路,车机与机器人则把模型放进了真实环境。企业应当把这一阶段理解为“接口选择”而非单纯选模型:当 AI 接入摄像头、麦克风、浏览器、车辆或机械臂时,权限、数据留存、异常暂停和人工接管必须与能力评测同步上线。

DeepSeek-V4-Flash 公测上线,以轻量激活规模瞄准智能体调用

标签:国产模型 / 智能体

摘要: DeepSeek-V4-Flash 正式版 API 开放公测。报道显示,该模型以 130 亿激活参数面向智能体任务,并支持 Responses API 格式与 Codex 相关生态适配。对多轮工具调用而言,推理成本、响应时间和失败恢复往往比单轮榜单更关键;“Flash”路线的价值就在于让高频步骤不必全部由旗舰模型承担。企业可先按任务难度分层路由,再用真实工单或流程数据验证节省是否没有牺牲完成质量。


MiniMax H3 发布,全模态音视频生成开始追求可商用的统一工作流

标签:多模态生成 / 内容生产

摘要: MiniMax 发布 H3 通用全模态模型,称其可统一理解和生成文本、图像、视频与音频,支持带双声道音频的 2K 视频输出,并计划在合规前提下开放模型权重。HuggingNews 同时列出其按分钟计费信息。多模态统一并不只意味着效果更炫:它能减少素材在多套工具之间转码、对齐和返工的成本。商业团队仍应把人物肖像、音乐版权、品牌素材授权和成片审核放在生成链路的前面。


字节发布 Seedance 2.5,30 秒叙事和可控编辑降低视频制作断点

标签:视频生成 / 创意工具

摘要: 字节 Seed 团队发布 Seedance 2.5,报道称单次生成时长提升至 30 秒,并支持多轮延长、图片、视频、音频参考及基于时间戳的定向编辑。对广告、培训和产品演示团队来说,生成式视频真正的瓶颈不是“能否出一段画面”,而是角色、镜头、物理效果和修改意见能否连续保留。试点时应以脚本锁定、版本管理、素材授权和人工终审为基础,而不是把一次生成直接当作可发布成片。


特斯拉中国车机接入豆包,座舱 AI 从信息查询走向本地服务入口

标签:车载 AI / 智能终端

摘要: 特斯拉中国分批推送车机更新,在多款车型中引入豆包大模型,用于信息查询与自然语言交互;相关功能需要符合其车载服务订阅条件。车机是高频、碎片化且安全边界清晰的 AI 界面,因此更适合先处理问答、设置和内容服务,而不应越过驾驶系统的独立控制边界。车载与物联网产品接入大模型时,应把云端调用、位置与语音数据、离线降级以及驾驶中的交互限制一并说明。


Qwen-Audio-3.0-ASR-Flash 面向长音频和专业词汇,语音 Agent 补齐数据质量环节

标签:语音 AI / 企业知识

摘要: 阿里发布 Qwen-Audio-3.0-ASR-Flash 及实时版本,强调长音频上下文、行业词库、热词定制和多语种转写能力,并给出医疗等专业场景的识别数据。语音 Agent 的质量首先取决于“听得对”:人名、术语和跨段上下文一旦错位,后续总结、检索和自动跟进都会被放大出错。企业应使用自身经授权的录音样本评测词表、说话人区分和保密要求,并明确转写稿的人工校验责任。


Gemini Robotics ER 2 支持多机器人协同,具身智能开始进入任务分工阶段

标签:具身智能 / 机器人

摘要: HuggingNews 汇总称,Google DeepMind 推出 Gemini Robotics 2,将多种模型能力用于人形机器人控制与多机器人协作。相关报道强调机器人可以在任务中持续观察进度、发现偏差后重试,并在不同设备间分工。相比单机演示,协同任务更接近仓储、巡检和产线场景,但也要求更严格的现场边界、互锁机制和故障降级。企业若评估此类技术,应先从隔离区域和低速、低风险物料流开始。


华为开源 openPangu-2.0-Pro,昇腾原生训练与推理生态继续扩展

标签:开源模型 / 国产算力

摘要: 华为开源 openPangu-2.0-Pro,公布模型权重、基础推理代码与技术报告。该模型采用混合专家架构,报道所述总参数约 5050 亿、每 Token 激活参数约 180 亿,并以昇腾 NPU 训练和推理为重点。权重与代码同步开放能降低评估和适配门槛,但企业仍需独立验证许可、硬件兼容、推理吞吐与运维成本;“可下载”不等于“可稳定交付”。


LG 开源 K-EXAONE 2.0,主权 AI 项目进入东亚开放模型竞赛

标签:开源模型 / 主权 AI

摘要: LG AI 研究院发布 K-EXAONE 2.0,采用 Apache 2.0 许可证开放,并披露其为混合注意力 MoE 架构、总参数约 7500 亿。许可证的选择使企业更容易将模型纳入商业评估,也让“主权 AI”从资金与口号走向可检视的软件资产。对跨区域运营团队而言,模型来源、许可证、语言表现、部署地点与供应商支持,应该被放进同一张选型表中比较。


中国提出加快《人工智能法》立法,应用中试与风险监测将同步推进

标签:AI 政策 / 治理

摘要: 国家发展改革委在 7 月 31 日新闻发布会上表示,将推进人工智能自主创新、应用中试基地布局、生态培育及《人工智能法》立法,并强调风险监测、预警与应急响应。对企业来说,政策不只是合规部门的待办:一旦产品进入客户、公共服务或高敏感行业,数据来源、内容安全、模型能力边界和应急流程都会影响能否规模推广。建议提前建立模型与数据台账,并用可追踪的治理流程为后续审计留出证据。


韩国扩大主权基金对 AI 与数据中心支持,算力竞争进入长期资本配置

标签:AI 基础设施 / 国际产业

摘要: HuggingNews 报道,韩国扩大主权基金的投资授权,以支持约 139 亿美元规模的 AI 与数据中心推进计划。无论具体项目最终节奏如何,国家级资金进入算力、园区与能源配置,说明 AI 竞争已不仅是企业研发预算,而是长周期基础设施投资。依赖云或自建集群的组织,应持续关注区域供给、用电、网络和硬件交期,并避免把容量计划完全建立在短期价格上。