KIMI K3 · 官方技术报告通俗拆解
2.8 万亿参数,
为什么不让它们
一起上班?
不背术语。我们动手做五个实验,看 K3 怎样读长材料、调专家、保存工作现场,以及它到底强到哪一步。
官方数字:896 个路由专家,每个 token 激活 16 个。
实验 01 / 长材料
读一份很长的材料,
每一步都要从头看吗?
两种读法跑一遍。红色格子越多,代表这一步回看的内容越多。
像平时沿省道前进,每走三段,再用卫星地图校准一次全局。
对应报告原文依据
官方报告第 2.1 节:K3 的 Hybrid Attention 采用 3 层 KDA 配 1 层 Gated MLA,最后一层一定进行全局注意力。
实验 02 / 深层传递
一句原话传六层,
最后还剩多少?
选一份卷宗,让“层层传话”和“直接查原件”同时工作。
等待上一层…
等待上一层…
等待上一层…
等待上一层…
等待上一层…
专项资金须经复核后拨付
尚未处理
尚未处理
尚未处理
尚未处理
尚未处理
专项资金须经复核后拨付
AttnRes 不是让每层记性更神,而是允许当前层回头选择早期信息,少靠“二手转述”。
对应报告原文依据
官方报告第 2.2 节:Attention Residuals 让当前层对更早的层表示做选择性检索,并通过分块设计控制开销。
实验 03 / 专家分诊
896 位专家,
该叫谁来开会?
选一项任务。Three.js 分诊台会按任务重新点亮 16 位专家。
像医院分诊:全科先接诊,再叫相关科室会诊。任务一换,上班的人也跟着换。
对应报告原文依据
官方报告第 2.3 节:K3 设有 896 个 routed experts,每个 token 激活 16 个。全模型 2.8T 总参数,推理时约 104B 参数被激活。
实验 04 / 长任务
干到一半断线,
回来还认得工作台吗?
运行任务后点“模拟断线”。再恢复时,看它从头来,还是接着做。
把“研究 AI 芯片”拆成资料、数据、代码和报告
搜索论文、企业信息和公开数据
在沙箱里清洗数据并运行脚本
发现年份口径不一致,回到来源重新核对
整理成有来源、有图表的研究初稿
真正的智能体训练,要把“计划—行动—观察—验证—调整”一整条链练出来。
对应报告原文依据
官方报告第 5.3 节:系统保存外部 KV cache 和可恢复的 microVM 沙箱状态,长 rollout 可以暂停后续接;第 4 章介绍多领域智能体强化学习。
实验 05 / 成绩单
有的项目第一,
能不能简称“全面第一”?
不能。榜单测的是不同科目,名次也不能混在一起平均。点开看各科,再下结论。
网页开发是 K3 最突出的公开成绩,官方报告统计时位列第一。
局部冠军值得肯定;把局部冠军说成全面超过所有顶尖模型,就不客观了。
对应报告原文依据
官方报告表 5:WebDev Arena #1/199、Vals Index #2/39、AA Intelligence Index #4/580、Text Arena #8/200、Agent Arena #4/37。
最后,把 47 页报告压成一句人话
K3 更像一个能连续干活的“智能办事员”, 还不是替人拍板的“责任人”。
它的进步,主要体现在能把复杂工作持续往前推;这不等于它说的每句话都正确,也不等于责任可以交给模型。