模型追踪
主流模型版本 / 价格 / 开源 / 基准结构化对比 · 共 10 个模型
只收录可核验的公开事实;查不到或未经官方来源确认的字段标注"待补核",超过 30 天未复核的数据就地打 ⚠ 示警。
总览对比
| 模型 | 厂商 | 最新版本 | 发布日期 | 参数规模 | 上下文 | 模态 | 状态 | 数据核验日期 |
|---|---|---|---|---|---|---|---|---|
| GPT 系列 | OpenAI | GPT-5.6(Sol / Terra / Luna) | 2026-07-09(全面开放;6 月 26 日起限量预览) | 待补核 ⚠ | 1,050,000 token(最大输出 128K) | 文本 / 图像 / 音频 | 在役 | 2026-08-14 |
| Claude | Anthropic | Claude Opus 5(Claude Max 新默认;旗舰为 Fable 5) | 2026-07-24(Opus 5) | 待补核 ⚠ | API 1M(Fable 5 / Opus 5 / Sonnet 5,最大输出 128K;Haiku 4.5 为 200K/64K);消费端订阅 200K | 文本 / 图像 | 在役 | 2026-08-14 |
| Gemini | Gemini 3.1 Pro | 2026-02-19(preview) | 待补核 ⚠ | 1M(最大输出 65,536) | 文本 / 图像 / 音频 / 视频 | 在役 | 2026-08-11 | |
| DeepSeek V4 | DeepSeek(深度求索) | DeepSeek V4(V4-Pro / V4-Flash-0731) | 2026-04-24(系列首发);2026-07-31(V4-Flash-0731 正式版公测) | V4-Pro:1.6T(MoE,激活 49B);V4-Flash:284B(激活 13B) | 100 万 token(最大输出 384K) | 文本 | 在役 | 2026-08-14 |
| Kimi K3 | Moonshot AI(月之暗面) | Kimi K3 | 2026-07-17 | 2.8T 总参 / 104B 激活(Stable LatentMoE,896 专家每 token 激活 16 + 2 共享;93 层;词表 160K) | 1,048,576 token(最大输出默认 131,072,最大可设 1,048,576) | 文本 / 图像 / 视频 | 在役 | 2026-08-14 |
| Qwen(通义千问) | 阿里巴巴 | Qwen3.8-Max(API ID qwen3.8-max) | 2026-08-03(阿里云百炼上架;7 月下旬 Preview 阶段) | 2.4T 总参(MoE,官方口径);激活 95B(二手口径,官方未公布) | 1M(最大输入 991,808,思考模式 983,616;最大输出 131,072) | 文本 / 图像 / 视频 | 在役 | 2026-08-14 |
| GLM | 智谱 AI | GLM-5.2 | 2026-06-16 | 待补核(官方未公布;GLM-4.6 为 355B 总参 / 32B 激活,官方文档口径) | 1M(GLM-5.2;最大输出 128K) | 文本 | 在役 | 2026-08-11 |
| MiniMax M3 | MiniMax(稀宇科技) | MiniMax-M3 | 2026-06-01(发布);2026-06-12(权重开源) | 428B 总参 / 23B 激活(MSA 稀疏注意力) | 1M(官方模型页:最高 1M、保障至少 512K) | 文本 | 在役 | 2026-08-11 |
| Llama | Meta | Llama 4(Scout / Maverick;Behemoth 未发布) | 2025-04-05 | Scout:109B 总参 / 17B 激活(16 专家);Maverick:400B 总参 / 17B 激活(128 专家);Behemoth:约 2T(288B 激活,未发布) | 10M(Scout)/ 1M(Maverick) | 文本 / 图像 | 在役 | 2026-08-14 |
| Mistral | Mistral AI | Mistral Medium 3.5(新旗舰;Large 3 675B 仍为最大参数现役) | 2026-05-22(Medium 3.5);2025-12-02(Large 3) | Medium 3.5:128B(dense);Large 3:675B 总参 / 41B 激活(细粒度 MoE,另含 2.5B 视觉编码器) | 256K(Medium 3.5 与 Large 3 一致) | 文本 / 图像 | 在役 | 2026-08-14 |
数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检
价格对比
| 模型 | 国内价格 | 海外价格 | 币种与计费说明 | 数据核验日期 |
|---|---|---|---|---|
| GPT 系列 | 国内无官方直接服务;企业可走 Azure OpenAI 渠道 | Sol:$5/$30;Terra:$2/$12;Luna:$0.20/$1.20(每百万 token,输入/输出;缓存输入约为输入价 1 折;单次请求输入超 272K token 整单按 2 倍输入、1.5 倍输出计费) | 美元,OpenAI 官方 API 定价页口径(2026-08-11 核验) | 2026-08-14 |
| Claude | 国内无官方直接服务 | Fable 5:$10/$50;Opus 5:$5/$25;Opus 4.8:$5/$25;Sonnet 5:$2/$10(2026-08-10 起转为永久定价);Haiku 4.5:$1/$5(每百万 token,输入/输出) | 美元,Anthropic 官方定价页口径(2026-08-11 核验) | 2026-08-14 |
| Gemini | 国内无官方直接服务 | ≤200K 上下文:$2/$12;>200K:$4/$18(每百万 token,输入/输出;Batch 半价) | 美元,Google AI 官方定价页口径(基础档 2026-08-11 经官方模型页对比表核验;>200K 阶梯与 Batch 口径官方定价页本次不可达,沿用 07-24 核验值) | 2026-08-11 |
| DeepSeek V4 | V4-Flash:缓存命中 ¥0.02 / 未命中 ¥1 / 输出 ¥2;V4-Pro:命中 ¥0.025 / 未命中 ¥3 / 输出 ¥6(每百万 token,人民币,官方中文定价页 2026-08-11 核验) | V4-Pro:$0.435/$0.87;V4-Flash:$0.14/$0.28(每百万 token,输入/输出,缓存命中输入约为 1 折) | 国内人民币 / 海外美元双口径,DeepSeek 官方 API 文档 | 2026-08-14 |
| Kimi K3 | 输入缓存命中 ¥2 / 未命中 ¥20 / 输出 ¥100(每百万 token,人民币;充值 ¥10 起解锁,新人 15 代金券不可用于 K3) | 输入缓存命中 $0.30 / 未命中 $3.00 / 输出 $15.00(每百万 token,美元) | 国内人民币(官方 K3 定价页 2026-08-07 发布)/ 海外美元(官方博客口径),2026-08-11 核验 | 2026-08-14 |
| Qwen(通义千问) | 输入 ¥12 / 输出 ¥36(每百万 token,人民币原价;缓存命中输入 ¥1.5;Batch File 输入 ¥6 / 输出 ¥18) | 国际部署(新加坡/法兰克福/弗吉尼亚/东京):输入 $2 / 输出 $6(每百万 token;缓存命中 $0.25) | 国内人民币(阿里云百炼官方页 2026-08-11 核验)/ 海外美元(Alibaba Cloud 国际站官方页) | 2026-08-14 |
| GLM | GLM-5.2:¥8/¥28(缓存输入 ¥2);GLM-4.7:¥2–4/¥8–16(按输入/输出长度三档分档);GLM-4.7-Flash:免费;GLM-4.7-FlashX:¥0.5/¥3(每百万 token,输入/输出) | GLM-5.2 / 5.1:$1.4/$4.4(缓存输入 $0.26);GLM-4.7:$0.6/$2.2;GLM-4.7-Flash:免费(每百万 token,输入/输出) | 国内人民币(智谱开放平台官方定价页)/ 海外美元(docs.z.ai 官方定价页),2026-08-11 核验 | 2026-08-11 |
| MiniMax M3 | API:≤512K 输入 ¥2.10 / 输出 ¥8.40(永久五折,刊例 ¥4.20/¥16.80);>512K ¥4.20/¥16.80;缓存读取 ¥0.42/¥0.84(每百万 token,人民币);Token Plan 订阅:Plus ¥49 / Max ¥119 / Ultra ¥469 每月 | M3:$0.30/$1.20(每百万 token,输入/输出;输入超 512K token 后为 $0.60/$2.40;标注永久五折,刊例 $0.60/$2.40);海外 Token Plan:Plus $20 / Max $50 / Ultra $120 每月 | 国内人民币 / 海外美元,两套平台独立计费(2026-08-11 双平台官方定价页核验) | 2026-08-11 |
| Llama | 国内无官方渠道,可通过第三方平台或自部署 | 权重免费自部署;Meta 官方无 Llama API 定价(官方仅给 Maverick 推理成本估算 $0.19/M token 起);第三方托管 API:Scout $0.20–$0.50,Maverick $0.85–$1.00(每百万 token) | 美元,第三方托管平台口径,随平台浮动 | 2026-08-14 |
| Mistral | 国内无官方渠道 | Medium 3.5:$1.5/$7.5;Large 3:$0.50/$1.50(每百万 token,输入/输出;Batch 半价,缓存输入最高省 90%) | 美元,Mistral 官方定价页口径(2026-08-11 核验;文档站另有欧元口径 €0.44/€1.3) | 2026-08-14 |
数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检
开源与权重
| 模型 | 开源协议 | GitHub | HuggingFace | 魔搭 | 国内可用性 |
|---|---|---|---|---|---|
| GPT 系列 | 闭源 | GitHub ↗ | — | — | 国内不可直接访问(企业可通过 Azure OpenAI 渠道) |
| Claude | 闭源 | GitHub ↗ | — | — | 国内不可直接访问 |
| Gemini | 闭源 | GitHub ↗ | — | — | 国内无法直接访问 |
| DeepSeek V4 | MIT | GitHub ↗ | HuggingFace ↗ | 魔搭 ↗ | 国内可直接使用 |
| Kimi K3 | Kimi K3 License(自定义:MIT 式自由授权,可商用/修改/再分发;经营 Model-as-a-Service 且任意连续 12 个月总收入超 2000 万美元须另签协议;商业产品 MAU 超 1 亿或月收入超 2000 万美元须显著标注 "Kimi K3") | GitHub ↗ | HuggingFace ↗ | 魔搭 ↗ | 国内可直接使用(kimi.com / Kimi API 开放平台) |
| Qwen(通义千问) | 闭源(官方已承诺 Qwen3.8-Max 权重将首次开源,并同步开源 Qwen3.8-27B;截至 2026-08-11 ModelScope 实测相关仓库均未上线,Qwen 开放权重惯例为 Apache 2.0) | GitHub ↗ | HuggingFace ↗ | 魔搭 ↗ | 国内可直接使用 |
| GLM | MIT(官方博客明确 "no regional limits") | GitHub ↗ | HuggingFace ↗ | 魔搭 ↗ | 国内可直接使用 |
| MiniMax M3 | MiniMax Community License(自定义非标准协议,商用前需阅读条款) | GitHub ↗ | HuggingFace ↗ | 魔搭 ↗ | 国内可直接使用(minimaxi.com) |
| Llama | Llama 4 社区许可(商业使用受条款约束) | GitHub ↗ | HuggingFace ↗ | — | 无官方国内服务,可自部署 |
| Mistral | Medium 3.5:Modified MIT;Large 3:Apache 2.0(Base 与 Instruct 权重均开源) | — | HuggingFace ↗ | — | 无官方国内服务 |
数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检
基准成绩
| 模型 | SWE-Bench Pro | AA Coding Agent Index | Frontier-Bench v0.1 | Artificial Analysis Intelligence Index | ARC-AGI-2 | SWE-Bench Verified | Terminal Bench 2.1 | DeepSWE | GPQA Diamond | Terminal-Bench 2.1 | Artificial Analysis 综合排名 | SWE-bench Verified | SWE-bench Pro | Artificial Analysis Intelligence Index(开源权重) | MMLU Pro | MMLU | Pinch Bench | 数据核验日期 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT 系列 | 64.6% ↗ | 80 ↗ | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2026-08-14 |
| Claude | — | — | 45% ↗ | 61 ↗ | — | — | — | — | — | — | — | — | — | — | — | — | — | 2026-08-14 |
| Gemini | — | — | — | — | 77.1% ↗ | 80.6% ↗ | — | — | — | — | — | — | — | — | — | — | — | 2026-08-11 |
| DeepSeek V4 | — | — | — | — | — | — | 87.9 ↗ | 62.7 ↗ | — | — | — | — | — | — | — | — | — | 2026-08-14 |
| Kimi K3 | — | — | — | — | — | — | — | — | 93.5 ↗ | 88.3 ↗ | 全球第 3 ↗ | — | — | — | — | — | — | 2026-08-14 |
| Qwen(通义千问) | — | — | — | — | — | — | — | — | — | — | — | 80.4% ↗ | — | — | — | — | — | 2026-08-14 |
| GLM | — | — | — | — | — | — | — | — | — | 81.0 ↗ | — | — | 62.1% ↗ | 51 ↗ | — | — | — | 2026-08-11 |
| MiniMax M3 | — | — | — | — | — | — | — | — | — | 66.0% ↗ | — | — | 59.0% ↗ | — | — | — | — | 2026-08-11 |
| Llama | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.5 ↗ | 79.6 ↗ | — | 2026-08-14 |
| Mistral | — | — | — | — | — | 77.6% ↗ | — | — | — | — | — | — | — | — | — | — | 72.20 ↗ | 2026-08-14 |
数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检;成绩链接直达来源,悬停查看口径说明
变更时间线
| 日期 | 模型 | 变更内容 | 来源 |
|---|---|---|---|
| 2026-08-14 | GPT 系列 | 基准来源官方化:AA Coding Agent Index 归属修正为 GPT-5.6 Sol(max)(原标注 GPT-5 有误),来源由第三方博客换为 AA 官方文章;score 纯分数化,口径移入 note | 来源 ↗ |
| 2026-08-14 | Claude | Frontier-Bench v0.1 补具体分数:新 SOTA→45%(Opus 5 max effort 峰值,读自官方发布图表,anthropic.com/news/claude-opus-5);score 纯分数化,口径移入 note | 来源 ↗ |
| 2026-08-14 | DeepSeek V4 | 基准官方化:Terminal Bench 2.1 更新为 V4-Pro GA 87.9(2026-08-13 官方更新日志);原 SWE-bench Verified 80.6% 为第三方流传口径、官方从未公布,替换为官方 DeepSWE 62.7 | 来源 ↗ |
| 2026-08-14 | Kimi K3 | 基准来源官方化:AA 综合排名来源由财新报道换为 AA 官方文章,补精确分数 57.1 | 来源 ↗ |
| 2026-08-14 | Qwen(通义千问) | 修正错误分数:SWE-bench Verified 72.3%→80.4%(Qwen3.7-Max 官方发布口径,官方博客 JS 渲染无法直连,采用标注 Qwen-reported 的 Together AI 模型页,GIGAZINE/W&B 多源一致;原 72.3% 在任何官方/转引渠道均无出处) | 来源 ↗ |
| 2026-08-14 | Llama | 基准来源官方化:Scout MMLU 79.6 来源由第三方收录站换为 Meta 官方模型卡(数字一致,注明 base 5-shot 口径) | 来源 ↗ |
| 2026-08-14 | Mistral | 基准口径标注:Pinch Bench 72.20 为第三方基准(OpenClaw agent 测试),Mistral 官方未公布该成绩;来源由第三方收录站换为基准官方榜单 pinchbench.com | 来源 ↗ |
| 2026-08-11 | GPT 系列 | 来源 ↗ | |
| 2026-08-11 | GPT 系列 | 周巡检(官方模型文档直连核验):context "1M(最大输出 128K)"→1,050,000 token(三款一致,官方模型文档页口径);补缓存与超长输入计费口径;旧 GPT-5 系列(gpt-5-2025-08-07 / mini / nano / pro 快照)定于 2026-12-11 停服,官方推荐迁移至 GPT-5.6 对应层级 | 来源 ↗ |
| 2026-08-11 | Claude | 周巡检(官方定价页/文档直连核验):releaseDate 2026-07-25→2026-07-24(官方新闻列表标注 Jul 24);pricing 补 Opus 5 $5/$25(与 Opus 4.8 并列在售);context "200K(消费端)/ 500K(Enterprise 默认模型)"→API 1M/输出 128K(Haiku 4.5 200K/64K),旧值 500K 官方页面无对应口径故删除;旧款 Opus 4.1/4、Sonnet 4、Haiku 3.5 官方标注退役(Bedrock/Google Cloud 除外) | 来源 ↗ |
| 2026-08-11 | Gemini | 周巡检:releaseDate 2026-02→2026-02-19(官方公告/模型卡精确到日);benchmarks 改官方模型卡口径(ARC-AGI-2 77.1%、SWE-Bench Verified 80.6%);API 模型 ID 仍为 gemini-3.1-pro-preview;>200K 阶梯定价与 Batch 半价本次官方定价页不可达未复核,保留旧核验值 | 来源 ↗ |
| 2026-08-11 | DeepSeek V4 | 周巡检(官方中/英定价页直连核验):domestic 定价补人民币精确值(V4-Flash ¥1/¥2、V4-Pro ¥3/¥6 及缓存命中价);context 补最大输出 384K;params 经官方 arXiv 技术报告确认(另披露预训练量 Flash 32T / Pro 33T tokens);重要预警:官方定价页公告"计划近期整体上调 API 定价,预计涨幅较大",落地后需立即更新 | 来源 ↗ |
| 2026-08-11 | Kimi K3 | 来源 ↗ | |
| 2026-08-11 | Kimi K3 | 周巡检:domestic 定价落定(官方 K3 定价页 2026-08-07:¥2/¥20/¥100 及缓存分档);overseas 定价补 $0.30/$3.00/$15.00;params 补全 2.8T 总参/104B 激活等官方模型卡规格;context 精确为 1,048,576 与输出上限口径;benchmarks 补官方模型卡 GPQA Diamond 93.5 / Terminal-Bench 2.1 88.3(官方坦承整体仍逊于 Claude Fable 5 与 GPT-5.6 Sol);附带:Moonshot V1 经典系列预计 2026-08-31 全平台下线 | 来源 ↗ |
| 2026-08-11 | Qwen(通义千问) | 周巡检(站长情报"Qwen3.8 发布"核验属实):latestVersion Qwen3.7-Max→Qwen3.8-Max;params 万亿级→2.4T(官方,激活 95B 仅二手口径故注明);context 256K→1M(含输入/输出/思维链上限,官方模型页);domestic 定价落定 ¥12/¥36 及缓存/Batch 价;overseas 待补核→$2/$6(国际站);开源承诺跟进:截至今日 ModelScope 实测 Qwen3.8-Max / 3.8-27B / 3.8-Max-Preview 仓库均 404、HuggingFace 未能直连,权重尚未上线,需一周内复查;Qwen3.8 官方 benchmark 因官方博客客户端渲染未能抓取,待补核 | 来源 ↗ |
| 2026-08-11 | GLM | 周巡检(双站官方定价页直连核验):releaseDate 待补核→2026-06-16(官方 release notes 与博客一致);overseas 定价落定 $1.4/$4.4(GLM-5.2/5.1)等四档;context 补最大输出 128K;benchmarks 补官方口径 Terminal-Bench 2.1 81.0 / SWE-bench Pro 62.1%;openWeights 确认为 MIT(官方博客原话);params 官方未公布保持待补核;HF zai-org 组织页本次网络不可达未能直开复核 | 来源 ↗ |
| 2026-08-11 | MiniMax M3 | 周巡检(双平台官方定价页直连核验):releaseDate 2026-06-12→2026-06-01(官方博客"released today";06-12 为权重上架 HF/ModelScope 日,二手多源一致);domestic 定价补精确值 ¥2.10/¥8.40(永久五折)与订阅三档;overseas 补刊例价与海外订阅 $20/$50/$120;openWeights.license 细化为 MiniMax Community License(HF 模型卡元数据 license_name: minimax-community;权重本体在 HF,GitHub 仓仅文档),openWeights.url 改指 HF 模型仓;二手流传"MIT 许可证"与官方元数据矛盾,判定为错误信息不采用 | 来源 ↗ |
| 2026-08-11 | Llama | 周巡检(官方模型页/HF 模型卡核验):无新 Llama 版本——Behemoth 确认未发布且已从官方页面消失(二手称实质搁置,Meta 无正式取消声明,维持"未发布"表述);Llama 4 Scout/Maverick 参数、上下文、许可证复核无变化;注意 Meta 模型线已向 Muse 品牌扩展(闭源 Muse Spark 系列 + 开放权重 Muse Glimmer 30B,在 huggingface.co/meta-models,不属 Llama 系),暂不入本条 | 来源 ↗ |
| 2026-08-11 | Mistral | 周巡检(官方定价页/模型卡/退役表核验):latestVersion Large 3→Medium 3.5(官方模型总览将其列为 frontier-class 旗舰并置顶;Large 3 保持 GA 现役、仍为最大杯);pricing 补 Medium 3.5 $1.5/$7.5,确认 Large 3 $0.50/$1.50 不变;openWeights 区分两线许可;2026 上半年退役潮确认(Large 2.1 于 2026-05-30 退役,含 Pixtral Large / Devstral 2 / Medium 3/3.1 等);产品线更名 Le Chat→Vibe;Small 4(v26.03,Apache 2.0)发布 | 来源 ↗ |
| 2026-08-10 | Claude | 来源 ↗ |
数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检