模型追踪

主流模型版本 / 价格 / 开源 / 基准结构化对比 · 共 10 个模型

只收录可核验的公开事实;查不到或未经官方来源确认的字段标注"待补核",超过 30 天未复核的数据就地打 ⚠ 示警。

总览对比

模型 厂商 最新版本 发布日期 参数规模 上下文 模态 状态 数据核验日期
GPT 系列 OpenAI GPT-5.6(Sol / Terra / Luna) 2026-07-09(全面开放;6 月 26 日起限量预览) 待补核 ⚠ 1,050,000 token(最大输出 128K) 文本 / 图像 / 音频 在役 2026-08-14
Claude Anthropic Claude Opus 5(Claude Max 新默认;旗舰为 Fable 5) 2026-07-24(Opus 5) 待补核 ⚠ API 1M(Fable 5 / Opus 5 / Sonnet 5,最大输出 128K;Haiku 4.5 为 200K/64K);消费端订阅 200K 文本 / 图像 在役 2026-08-14
Gemini Google Gemini 3.1 Pro 2026-02-19(preview) 待补核 ⚠ 1M(最大输出 65,536) 文本 / 图像 / 音频 / 视频 在役 2026-08-11
DeepSeek V4 DeepSeek(深度求索) DeepSeek V4(V4-Pro / V4-Flash-0731) 2026-04-24(系列首发);2026-07-31(V4-Flash-0731 正式版公测) V4-Pro:1.6T(MoE,激活 49B);V4-Flash:284B(激活 13B) 100 万 token(最大输出 384K) 文本 在役 2026-08-14
Kimi K3 Moonshot AI(月之暗面) Kimi K3 2026-07-17 2.8T 总参 / 104B 激活(Stable LatentMoE,896 专家每 token 激活 16 + 2 共享;93 层;词表 160K) 1,048,576 token(最大输出默认 131,072,最大可设 1,048,576) 文本 / 图像 / 视频 在役 2026-08-14
Qwen(通义千问) 阿里巴巴 Qwen3.8-Max(API ID qwen3.8-max) 2026-08-03(阿里云百炼上架;7 月下旬 Preview 阶段) 2.4T 总参(MoE,官方口径);激活 95B(二手口径,官方未公布) 1M(最大输入 991,808,思考模式 983,616;最大输出 131,072) 文本 / 图像 / 视频 在役 2026-08-14
GLM 智谱 AI GLM-5.2 2026-06-16 待补核(官方未公布;GLM-4.6 为 355B 总参 / 32B 激活,官方文档口径) 1M(GLM-5.2;最大输出 128K) 文本 在役 2026-08-11
MiniMax M3 MiniMax(稀宇科技) MiniMax-M3 2026-06-01(发布);2026-06-12(权重开源) 428B 总参 / 23B 激活(MSA 稀疏注意力) 1M(官方模型页:最高 1M、保障至少 512K) 文本 在役 2026-08-11
Llama Meta Llama 4(Scout / Maverick;Behemoth 未发布) 2025-04-05 Scout:109B 总参 / 17B 激活(16 专家);Maverick:400B 总参 / 17B 激活(128 专家);Behemoth:约 2T(288B 激活,未发布) 10M(Scout)/ 1M(Maverick) 文本 / 图像 在役 2026-08-14
Mistral Mistral AI Mistral Medium 3.5(新旗舰;Large 3 675B 仍为最大参数现役) 2026-05-22(Medium 3.5);2025-12-02(Large 3) Medium 3.5:128B(dense);Large 3:675B 总参 / 41B 激活(细粒度 MoE,另含 2.5B 视觉编码器) 256K(Medium 3.5 与 Large 3 一致) 文本 / 图像 在役 2026-08-14

数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检

价格对比

模型 国内价格 海外价格 币种与计费说明 数据核验日期
GPT 系列 国内无官方直接服务;企业可走 Azure OpenAI 渠道 Sol:$5/$30;Terra:$2/$12;Luna:$0.20/$1.20(每百万 token,输入/输出;缓存输入约为输入价 1 折;单次请求输入超 272K token 整单按 2 倍输入、1.5 倍输出计费) 美元,OpenAI 官方 API 定价页口径(2026-08-11 核验) 2026-08-14
Claude 国内无官方直接服务 Fable 5:$10/$50;Opus 5:$5/$25;Opus 4.8:$5/$25;Sonnet 5:$2/$10(2026-08-10 起转为永久定价);Haiku 4.5:$1/$5(每百万 token,输入/输出) 美元,Anthropic 官方定价页口径(2026-08-11 核验) 2026-08-14
Gemini 国内无官方直接服务 ≤200K 上下文:$2/$12;>200K:$4/$18(每百万 token,输入/输出;Batch 半价) 美元,Google AI 官方定价页口径(基础档 2026-08-11 经官方模型页对比表核验;>200K 阶梯与 Batch 口径官方定价页本次不可达,沿用 07-24 核验值) 2026-08-11
DeepSeek V4 V4-Flash:缓存命中 ¥0.02 / 未命中 ¥1 / 输出 ¥2;V4-Pro:命中 ¥0.025 / 未命中 ¥3 / 输出 ¥6(每百万 token,人民币,官方中文定价页 2026-08-11 核验) V4-Pro:$0.435/$0.87;V4-Flash:$0.14/$0.28(每百万 token,输入/输出,缓存命中输入约为 1 折) 国内人民币 / 海外美元双口径,DeepSeek 官方 API 文档 2026-08-14
Kimi K3 输入缓存命中 ¥2 / 未命中 ¥20 / 输出 ¥100(每百万 token,人民币;充值 ¥10 起解锁,新人 15 代金券不可用于 K3) 输入缓存命中 $0.30 / 未命中 $3.00 / 输出 $15.00(每百万 token,美元) 国内人民币(官方 K3 定价页 2026-08-07 发布)/ 海外美元(官方博客口径),2026-08-11 核验 2026-08-14
Qwen(通义千问) 输入 ¥12 / 输出 ¥36(每百万 token,人民币原价;缓存命中输入 ¥1.5;Batch File 输入 ¥6 / 输出 ¥18) 国际部署(新加坡/法兰克福/弗吉尼亚/东京):输入 $2 / 输出 $6(每百万 token;缓存命中 $0.25) 国内人民币(阿里云百炼官方页 2026-08-11 核验)/ 海外美元(Alibaba Cloud 国际站官方页) 2026-08-14
GLM GLM-5.2:¥8/¥28(缓存输入 ¥2);GLM-4.7:¥2–4/¥8–16(按输入/输出长度三档分档);GLM-4.7-Flash:免费;GLM-4.7-FlashX:¥0.5/¥3(每百万 token,输入/输出) GLM-5.2 / 5.1:$1.4/$4.4(缓存输入 $0.26);GLM-4.7:$0.6/$2.2;GLM-4.7-Flash:免费(每百万 token,输入/输出) 国内人民币(智谱开放平台官方定价页)/ 海外美元(docs.z.ai 官方定价页),2026-08-11 核验 2026-08-11
MiniMax M3 API:≤512K 输入 ¥2.10 / 输出 ¥8.40(永久五折,刊例 ¥4.20/¥16.80);>512K ¥4.20/¥16.80;缓存读取 ¥0.42/¥0.84(每百万 token,人民币);Token Plan 订阅:Plus ¥49 / Max ¥119 / Ultra ¥469 每月 M3:$0.30/$1.20(每百万 token,输入/输出;输入超 512K token 后为 $0.60/$2.40;标注永久五折,刊例 $0.60/$2.40);海外 Token Plan:Plus $20 / Max $50 / Ultra $120 每月 国内人民币 / 海外美元,两套平台独立计费(2026-08-11 双平台官方定价页核验) 2026-08-11
Llama 国内无官方渠道,可通过第三方平台或自部署 权重免费自部署;Meta 官方无 Llama API 定价(官方仅给 Maverick 推理成本估算 $0.19/M token 起);第三方托管 API:Scout $0.20–$0.50,Maverick $0.85–$1.00(每百万 token) 美元,第三方托管平台口径,随平台浮动 2026-08-14
Mistral 国内无官方渠道 Medium 3.5:$1.5/$7.5;Large 3:$0.50/$1.50(每百万 token,输入/输出;Batch 半价,缓存输入最高省 90%) 美元,Mistral 官方定价页口径(2026-08-11 核验;文档站另有欧元口径 €0.44/€1.3) 2026-08-14

数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检

开源与权重

模型 开源协议 GitHub HuggingFace 魔搭 国内可用性
GPT 系列 闭源 GitHub ↗ 国内不可直接访问(企业可通过 Azure OpenAI 渠道)
Claude 闭源 GitHub ↗ 国内不可直接访问
Gemini 闭源 GitHub ↗ 国内无法直接访问
DeepSeek V4 MIT GitHub ↗ HuggingFace ↗ 魔搭 ↗ 国内可直接使用
Kimi K3 Kimi K3 License(自定义:MIT 式自由授权,可商用/修改/再分发;经营 Model-as-a-Service 且任意连续 12 个月总收入超 2000 万美元须另签协议;商业产品 MAU 超 1 亿或月收入超 2000 万美元须显著标注 "Kimi K3") GitHub ↗ HuggingFace ↗ 魔搭 ↗ 国内可直接使用(kimi.com / Kimi API 开放平台)
Qwen(通义千问) 闭源(官方已承诺 Qwen3.8-Max 权重将首次开源,并同步开源 Qwen3.8-27B;截至 2026-08-11 ModelScope 实测相关仓库均未上线,Qwen 开放权重惯例为 Apache 2.0) GitHub ↗ HuggingFace ↗ 魔搭 ↗ 国内可直接使用
GLM MIT(官方博客明确 "no regional limits") GitHub ↗ HuggingFace ↗ 魔搭 ↗ 国内可直接使用
MiniMax M3 MiniMax Community License(自定义非标准协议,商用前需阅读条款) GitHub ↗ HuggingFace ↗ 魔搭 ↗ 国内可直接使用(minimaxi.com)
Llama Llama 4 社区许可(商业使用受条款约束) GitHub ↗ HuggingFace ↗ 无官方国内服务,可自部署
Mistral Medium 3.5:Modified MIT;Large 3:Apache 2.0(Base 与 Instruct 权重均开源) HuggingFace ↗ 无官方国内服务

数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检

基准成绩

模型 SWE-Bench ProAA Coding Agent IndexFrontier-Bench v0.1Artificial Analysis Intelligence IndexARC-AGI-2SWE-Bench VerifiedTerminal Bench 2.1DeepSWEGPQA DiamondTerminal-Bench 2.1Artificial Analysis 综合排名SWE-bench VerifiedSWE-bench ProArtificial Analysis Intelligence Index(开源权重)MMLU ProMMLUPinch Bench 数据核验日期
GPT 系列 64.6% ↗ 80 ↗ 2026-08-14
Claude 45% ↗ 61 ↗ 2026-08-14
Gemini 77.1% ↗ 80.6% ↗ 2026-08-11
DeepSeek V4 87.9 ↗ 62.7 ↗ 2026-08-14
Kimi K3 93.5 ↗ 88.3 ↗ 全球第 3 ↗ 2026-08-14
Qwen(通义千问) 80.4% ↗ 2026-08-14
GLM 81.0 ↗ 62.1% ↗ 51 ↗ 2026-08-11
MiniMax M3 66.0% ↗ 59.0% ↗ 2026-08-11
Llama 80.5 ↗ 79.6 ↗ 2026-08-14
Mistral 77.6% ↗ 72.20 ↗ 2026-08-14

数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检;成绩链接直达来源,悬停查看口径说明

变更时间线

日期 模型 变更内容 来源
2026-08-14 GPT 系列 基准来源官方化:AA Coding Agent Index 归属修正为 GPT-5.6 Sol(max)(原标注 GPT-5 有误),来源由第三方博客换为 AA 官方文章;score 纯分数化,口径移入 note 来源 ↗
2026-08-14 Claude Frontier-Bench v0.1 补具体分数:新 SOTA→45%(Opus 5 max effort 峰值,读自官方发布图表,anthropic.com/news/claude-opus-5);score 纯分数化,口径移入 note 来源 ↗
2026-08-14 DeepSeek V4 基准官方化:Terminal Bench 2.1 更新为 V4-Pro GA 87.9(2026-08-13 官方更新日志);原 SWE-bench Verified 80.6% 为第三方流传口径、官方从未公布,替换为官方 DeepSWE 62.7 来源 ↗
2026-08-14 Kimi K3 基准来源官方化:AA 综合排名来源由财新报道换为 AA 官方文章,补精确分数 57.1 来源 ↗
2026-08-14 Qwen(通义千问) 修正错误分数:SWE-bench Verified 72.3%→80.4%(Qwen3.7-Max 官方发布口径,官方博客 JS 渲染无法直连,采用标注 Qwen-reported 的 Together AI 模型页,GIGAZINE/W&B 多源一致;原 72.3% 在任何官方/转引渠道均无出处) 来源 ↗
2026-08-14 Llama 基准来源官方化:Scout MMLU 79.6 来源由第三方收录站换为 Meta 官方模型卡(数字一致,注明 base 5-shot 口径) 来源 ↗
2026-08-14 Mistral 基准口径标注:Pinch Bench 72.20 为第三方基准(OpenClaw agent 测试),Mistral 官方未公布该成绩;来源由第三方收录站换为基准官方榜单 pinchbench.com 来源 ↗
2026-08-11 GPT 系列 来源 ↗
2026-08-11 GPT 系列 周巡检(官方模型文档直连核验):context "1M(最大输出 128K)"→1,050,000 token(三款一致,官方模型文档页口径);补缓存与超长输入计费口径;旧 GPT-5 系列(gpt-5-2025-08-07 / mini / nano / pro 快照)定于 2026-12-11 停服,官方推荐迁移至 GPT-5.6 对应层级 来源 ↗
2026-08-11 Claude 周巡检(官方定价页/文档直连核验):releaseDate 2026-07-25→2026-07-24(官方新闻列表标注 Jul 24);pricing 补 Opus 5 $5/$25(与 Opus 4.8 并列在售);context "200K(消费端)/ 500K(Enterprise 默认模型)"→API 1M/输出 128K(Haiku 4.5 200K/64K),旧值 500K 官方页面无对应口径故删除;旧款 Opus 4.1/4、Sonnet 4、Haiku 3.5 官方标注退役(Bedrock/Google Cloud 除外) 来源 ↗
2026-08-11 Gemini 周巡检:releaseDate 2026-02→2026-02-19(官方公告/模型卡精确到日);benchmarks 改官方模型卡口径(ARC-AGI-2 77.1%、SWE-Bench Verified 80.6%);API 模型 ID 仍为 gemini-3.1-pro-preview;>200K 阶梯定价与 Batch 半价本次官方定价页不可达未复核,保留旧核验值 来源 ↗
2026-08-11 DeepSeek V4 周巡检(官方中/英定价页直连核验):domestic 定价补人民币精确值(V4-Flash ¥1/¥2、V4-Pro ¥3/¥6 及缓存命中价);context 补最大输出 384K;params 经官方 arXiv 技术报告确认(另披露预训练量 Flash 32T / Pro 33T tokens);重要预警:官方定价页公告"计划近期整体上调 API 定价,预计涨幅较大",落地后需立即更新 来源 ↗
2026-08-11 Kimi K3 来源 ↗
2026-08-11 Kimi K3 周巡检:domestic 定价落定(官方 K3 定价页 2026-08-07:¥2/¥20/¥100 及缓存分档);overseas 定价补 $0.30/$3.00/$15.00;params 补全 2.8T 总参/104B 激活等官方模型卡规格;context 精确为 1,048,576 与输出上限口径;benchmarks 补官方模型卡 GPQA Diamond 93.5 / Terminal-Bench 2.1 88.3(官方坦承整体仍逊于 Claude Fable 5 与 GPT-5.6 Sol);附带:Moonshot V1 经典系列预计 2026-08-31 全平台下线 来源 ↗
2026-08-11 Qwen(通义千问) 周巡检(站长情报"Qwen3.8 发布"核验属实):latestVersion Qwen3.7-Max→Qwen3.8-Max;params 万亿级→2.4T(官方,激活 95B 仅二手口径故注明);context 256K→1M(含输入/输出/思维链上限,官方模型页);domestic 定价落定 ¥12/¥36 及缓存/Batch 价;overseas 待补核→$2/$6(国际站);开源承诺跟进:截至今日 ModelScope 实测 Qwen3.8-Max / 3.8-27B / 3.8-Max-Preview 仓库均 404、HuggingFace 未能直连,权重尚未上线,需一周内复查;Qwen3.8 官方 benchmark 因官方博客客户端渲染未能抓取,待补核 来源 ↗
2026-08-11 GLM 周巡检(双站官方定价页直连核验):releaseDate 待补核→2026-06-16(官方 release notes 与博客一致);overseas 定价落定 $1.4/$4.4(GLM-5.2/5.1)等四档;context 补最大输出 128K;benchmarks 补官方口径 Terminal-Bench 2.1 81.0 / SWE-bench Pro 62.1%;openWeights 确认为 MIT(官方博客原话);params 官方未公布保持待补核;HF zai-org 组织页本次网络不可达未能直开复核 来源 ↗
2026-08-11 MiniMax M3 周巡检(双平台官方定价页直连核验):releaseDate 2026-06-12→2026-06-01(官方博客"released today";06-12 为权重上架 HF/ModelScope 日,二手多源一致);domestic 定价补精确值 ¥2.10/¥8.40(永久五折)与订阅三档;overseas 补刊例价与海外订阅 $20/$50/$120;openWeights.license 细化为 MiniMax Community License(HF 模型卡元数据 license_name: minimax-community;权重本体在 HF,GitHub 仓仅文档),openWeights.url 改指 HF 模型仓;二手流传"MIT 许可证"与官方元数据矛盾,判定为错误信息不采用 来源 ↗
2026-08-11 Llama 周巡检(官方模型页/HF 模型卡核验):无新 Llama 版本——Behemoth 确认未发布且已从官方页面消失(二手称实质搁置,Meta 无正式取消声明,维持"未发布"表述);Llama 4 Scout/Maverick 参数、上下文、许可证复核无变化;注意 Meta 模型线已向 Muse 品牌扩展(闭源 Muse Spark 系列 + 开放权重 Muse Glimmer 30B,在 huggingface.co/meta-models,不属 Llama 系),暂不入本条 来源 ↗
2026-08-11 Mistral 周巡检(官方定价页/模型卡/退役表核验):latestVersion Large 3→Medium 3.5(官方模型总览将其列为 frontier-class 旗舰并置顶;Large 3 保持 GA 现役、仍为最大杯);pricing 补 Medium 3.5 $1.5/$7.5,确认 Large 3 $0.50/$1.50 不变;openWeights 区分两线许可;2026 上半年退役潮确认(Large 2.1 于 2026-05-30 退役,含 Pixtral Large / Devstral 2 / Medium 3/3.1 等);产品线更名 Le Chat→Vibe;Small 4(v26.03,Apache 2.0)发布 来源 ↗
2026-08-10 Claude 来源 ↗

数据核验日期逐行标注;更新机制:每日新闻联动 + 每周一巡检