模型情报简报 2026-09-02 官网 + X + B站 + V2EX

闭源顶到 Fable 5.1,开源卷到 2.4T

旗舰价被打到 $2 / $6,Flash 档已经下探到一毛五

过去 24 小时两件大事同时落地:Anthropic 正式发布 Claude Fable 5.1 / Mythos 5.1,阿里把旗舰迭代成 Qwen3.8-Max-0902,并在 Code Arena WebDev 以 1691 分登顶。

OpenAI 还没放 Astra,但已官方认定它达到 Preparedness Framework 的 Critical 网络安全能力阈值(ExploitBench 100%),是下一颗最大的未落地炸弹。

8 月这轮价格战把“能打的旗舰”压到 $2 入 / $6 出(Grok 4.6、Qwen3.8-Max),Flash 档更下探到 $0.15 / $0.50(GLM-5.3-Flash)。

Google 继续用 3.7 Flash 填旗舰空窗,3.5 Pro 仍未对公众放量;DeepSeek 则用 MIT 开源把 DeepSWE 从 12.8 拉到 62.7。

中文社区这几天刷的是实测、白嫖教程和额度烧完,不是论文。

数据口径:厂商官网优先,第三方榜单单独标注 价格单位:每百万 token,美元除非另行说明
ANTHROPIC · 2026-09-01
今日头条

科学 Agent 把分数翻倍,缓存一刀砍掉两成五

Fable 5.1 和 Mythos 5.1 是同一套权重、两套护栏:Fable 9 月 1 日全面开放,Mythos 只走受信通道,专门放开网安与生命科学。

官方表上,科学 Agent 基准 Terminal-Bench-Science 0.1 从 Fable 5 的 24.7% 拉到 52.6%,超过 Opus 5 的 29.0% 和 GPT-5.6 Sol 的 22.4%;Terminal-Bench 4.0 编码 55.8%(Mythos 60.9%)。

知识工作 GDPval-AA v2 拿到 1853,CursorBench 3.2 为 73.4%;Humanity's Last Exam 无工具 60.9%、有工具 65.0%。

典型按 token 计费工作负载官方估便宜约 25%(高度 Agent 场景最高约 45%),网安误报下降 60%;蛋白设计命中率近 50%,而行业常见只有 10–15%。

第三方 Artificial Analysis 指数把 Fable 5.1 放到 66;X 官方帖 1262 万浏览 / 5.67 万赞,B 站当天就有全栈实测视频播放 2.3 万+。

52.6%Science 0.1 · 前代 24.7%
1853GDPval-AA v2
-25%典型负载成本
66AA Index 第三方
OPENAI · GPT-5.6 GA 7/9 · ASTRA 预告 9/1
现役旗舰 + 未发炸弹

GPT-5.6 已是现役旗舰,Astra 卡在 Critical 网安门槛

GPT-5.6 三件套 7 月 9 日全面上线:旗舰 Sol $5 / $30、均衡 Terra $2.50 / $15、便宜 Luna $1 / $6。

8 月 6 日起 Luna 成为 ChatGPT 免费默认,并很快放开无限文本对话,把“能用的旗舰”和“免费默认”拆成两档。

Astra 尚未公开发售,但 9 月 1 日官方长文确认它达到 Critical 网安阈值:ExploitBench 100%,内部 20 条高危 V8 漏洞集上发现并使用了 2 个零日。

越狱拒答率提到 91.5%(Sol 仅 59%);高级网安能力计划先给小范围测试,再通过 Daybreak Blue 扩到防御用途。

8 月 29 日 OpenAI 宣布因 SpaceX 收购 Cursor 而终止合作,Cursor 直连拟于 11 月 12 日切断;V2EX 这两天在问 Sol 上下文 200K 太短要不要开到 1M。

$5 / $30Sol 输入 / 输出
100%Astra ExploitBench
91.5%Astra 越狱拒答
11/12Cursor 直连切断日
SPACEXAI / XAI · 2026-08-12
性价比旗舰

Grok 4.6 用 $2 / $6 摸到 Sol 同一档

Grok 4.6 于 8 月 12 日发布,500K 上下文,定价与 4.5 相同:$2 入 / $6 出,Fast 变体翻倍。

官方评测里 AA Intelligence Index 为 61,与 GPT-5.6 Sol 持平、比当时 Fable 5 的 62 少 1 分。

DeepSWE v1.1 从 4.5 的 54% 升到 65.9%;GDPVal-AA v2 从 1526 升到 1753;CursorBench 3.2 为 69.9%。

随后接入 GitHub Copilot、Amazon Bedrock、Microsoft Foundry,把“便宜旗舰”铺进企业通道。

X 上有人传“下周五出 Grok 4.7”,目前只是社交传闻,没有官网确认;B 站相关视频单条播放约 2.7 万。

61AA Index · 平 Sol
65.9%DeepSWE v1.1
1753GDPVal-AA v2
$2 / $6标准 API 价
GOOGLE DEEPMIND · 3.7 FLASH 8/13 · 视频理解 9/1
工作马,不是旗舰

Flash 连发、Pro 仍迟到;视频理解省 88% token

Gemini 3.7 Flash 8 月 13 日 GA:输入 1,048,576、输出 65,536,促销价 $0.75 / $3.75 用到 2026-12-31,之后回到 $1.50 / $7.50。

Google 自报 DeepSWE v1.1 从 3.6 Flash 的 49.0% 升到 65.3%;第三方测输出速度 340.1 tok/s,186 个模型里第一。

9 月 1 日上线 Agentic video understanding,长视频最多少用 88% token;8 月 27 日 Omni 1.1 Flash 转正,支持视频延长、首末帧插值和最高 4K。

Gemini 3.5 Transcribe 直播 / 批量 WER 为 2.6% / 4.0%,替换 Chirp 3。

真正被等的旗舰 Gemini 3.5 Pro 原定 6 月、再滑到 7 月,截至今日仍未对公众放量。

1,048,576输入上下文
65.3%DeepSWE v1.1
340 tok/s输出速度第一
-88%长视频 token
阿里通义千问 · 2026-09-02
今天刚升

Qwen3.8-Max-0902 以 1691 分拿下 Code Arena 第一

Qwen 官方账号 9 月 2 日宣布 Qwen3.8-Max-0902:仍是 2.4T 总参 / 约 95B 激活 / 1M 上下文,价格不变 $2 / $6,显式缓存命中 $0.17。

官方自测 TerminalBench 3.0 从 11.3 拉到 29.0,DeepSWE 1.1 从 56.6 到 69.3,QwenSWEbench V2 从 55.1 到 70.0。

Arena.ai 第三方:Code Arena WebDev 1691 分总榜第一,比 Opus 5 Max 的 1688 高 3 分、比上代 Max 的 1669 高 22 分。

混合成本约 $5/MToken,处在帕累托最前;官方帖约 39 万浏览 / 3579 赞。

8 月 12 日已开源底座 Qwen3.8-2.4T-A95B(BF16 约 4.89 TB);8 月 26 日的 Flash-Next 是 Qwen4 架构预览,125B MoE、仅 6B 激活。

1691Code Arena WebDev
2.4T总参数 · 95B 激活
69.3DeepSWE 1.1 自测
$2 / $6API 价不变
DEEPSEEK · FLASH 7/31 · PRO 8/13 · VISION 8/21
MIT 开源

Flash 先打价格,Pro 把 DeepSWE 从 12.8 拉到 62.7

V4-Flash-0731 是 284B / 13B 激活,V4-Pro-0813 是 1.6T / 49B 激活,都是 MIT,默认 1M 上下文、最大输出 384K。

Pro 的 DeepSWE 从预览 12.8 跳到 62.7;Flash 正式版 Terminal Bench 2.1 为 82.7、DeepSWE 为 54.4。

国内标价大致 Flash ¥1 / ¥2、Pro ¥3 / ¥6,另有峰谷价;国际大约 $0.43 / $0.87(Pro)。

8 月 21 日实验多模态 V4-Flash-Vision-Exp 上线,官方称多模态 Agent 接近 Opus 4.8。

该视觉模型官方帖 260 万浏览 / 1.1 万赞,是这轮开源阵营里传播最广的一条。

1.6TPro 总参 / 49B 激活
62.7Pro DeepSWE
82.7Flash TB 2.1
MIT权重可下
智谱 Z.AI · 2026-08-26
1/40 价格带

320B 开源多模态,限时大约是 Opus 的四十分之一价

GLM-5.3-Flash 8 月 26 日开源:320B 总参 / 18B 激活,原生图 / 视频 / 文件,1M 上下文 / 128K 输出,MIT 协议。

官方 AA 指数 57,与 Claude Opus 4.8 持平;自报 DeepSWE v1.1 为 63.4,上代 5.2 只有 46.2。

国际标价 $0.15 / $0.50,国内原价约 ¥0.8 / ¥2.8,首发 5 折到 9 月 9 日。

注意力计算量相对 GLM-5.3 降 3.01×,KV cache 降 4.44×;发布前曾以 ox-alpha 匿名测。

旗舰 GLM-5.3 权重 8 月 28 日上线,约 756 GB(141 个 safetensors,体量对应 FP8)。

57AA Index · 平 Opus 4.8
$0.15输入价 / 百万 token
320B总参 · 18B 激活
9/9国内 5 折截止
对照
截至 2026-09-02

七家现役旗舰一张表

模型 状态 关键规格 API 价 一条硬数据
Claude Fable 5.1 今天刚出 长程 Agent;Mythos 受信通道 缓存更便宜 Science 0.1 52.6%(前代 24.7%)
GPT-5.6 Sol 7/9 GA 旗舰;Luna 免费默认 $5 / $30 Astra 未发,ExploitBench 100%
Grok 4.6 8/12 500K 上下文 $2 / $6 AA Index 61,平 Sol
Gemini 3.7 Flash 8/13 1M in / 65K out $0.75 / $3.75 DeepSWE 65.3%,340 tok/s
Qwen3.8-Max-0902 今天刚出 2.4T / 95B,1M $2 / $6 Code Arena 1691 #1
DeepSeek V4-Pro-0813 8/13 1.6T / 49B,MIT ~$0.43 / $0.87 DeepSWE 12.8 → 62.7
GLM-5.3-Flash 8/26 开源 320B / 18B 多模态 $0.15 / $0.50 AA 57,约 Opus 1/40 价
社媒与社区

X 在刷登顶,B 站在刷白嫖,V2EX 在烧额度