AI 技术
2 条新闻 · 9 条遗珠 · 3 篇文章 · 10 个模型追踪
收录栏目回答"我该用什么",本栏目回答"行业正在发生什么、这意味着什么"。
AI 新闻
每日追踪主流媒体与行业网站 AI 报道 — 摘要与事实核查情况见列表页
官方快讯 自动同步 · 未编辑
官方 RSS/Atom 原标题与直达链接,每小时自动更新。
正在读取官方源…
沧海遗珠
被忽视但高价值的信息 — 低关注度信源里挖出的新工具、新研究,宁缺毋滥
技术文章
原创解读 / 行业精选 / 站长专栏 — 每条事实都可回溯核验
MoE 的稀疏艺术:1.6 万亿参数的模型,为什么每个 token 只唤醒 49B
混合专家(MoE)让模型总参数量和推理计算量脱钩。本文从路由公式出发,拆解 Top-K 门控、负载均衡的辅助损失与 DeepSeek-V3 的无辅助损失方案,以及细粒度专家、共享专家、节点受限路由这些工程取舍各自的含义。
大模型推理部署解剖:PD 分离、AF 分离,和 micro-batch 流水线到底在优化什么
为什么同一个模型,自部署的吞吐和商业 API 差一个数量级?答案在部署架构。本文拆解推理两阶段的资源特征、Prefill-Decode 分离与 KV 传输、更进一步的 Attention-FFN 分离,以及 DualPipe 双向流水线如何用 micro-batch 把通信藏进计算里。
注意力的显存战争:从 MHA 到 MLA,KV Cache 是怎么被一步步压缩的
长上下文时代,推理显存的大头不是权重而是 KV Cache。本文从公式和维度出发,拆解 MHA、MQA、GQA、MLA 四种注意力变体各自的缓存账,以及 DeepSeek MLA 低秩压缩为什么能把每 token 缓存压到 1/57。
模型追踪
主流模型版本 / 价格 / 开源 / 基准结构化对比 — 数据核验日期逐行标注
| 模型 | 厂商 | 最新版本 | 上下文 | 数据核验日期 |
|---|---|---|---|---|
| DeepSeek V4 | DeepSeek(深度求索) | DeepSeek V4(V4-Pro / V4-Flash) | 100 万 token | 2026-07-24 |
| Kimi K3 | Moonshot AI(月之暗面) | Kimi K3 | 100 万 token(最大输出 1,048,576) | 2026-07-27 |
| MiniMax M3 | MiniMax(稀宇科技) | MiniMax-M3 | 1M | 2026-07-24 |
| Qwen(通义千问) | 阿里巴巴 | Qwen3.7-Max(最新快照 qwen3.7-max-2026-06-08) | 256K(262,144 tokens,媒体口径) | 2026-07-24 |
| GLM | 智谱 AI | GLM-5.2 | 1M(GLM-5.2,官方定价页口径) | 2026-07-25 |
| GPT 系列 | OpenAI | GPT-5.6(Sol / Terra / Luna) | 1M(最大输出 128K) | 2026-07-24 |
价格 / 开源与权重 / 基准成绩 / 变更时间线见 模型追踪完整对比。