OpenAI 在 2026 年 9 月 3 日公布 GPT-6 Astra,API 标识为 gpt-6-astra。它不是聊天窗口换皮,而是把软件工程、计算机使用和长程 Agent 放在同一条产品线上。团队现在要判断的是:哪些任务值得付 2.5 倍于 GPT-5.6 Sol 促销价的账单,哪些任务仍应留在便宜模型或隔离的 Mac 节点上。
为什么这个问题现在才尖锐
过去一个月,搜索里同时出现「GPT-6」「Astra」「ChatGPT 6」「GPT-6 Pro」「GPT-6 Ultra」。真正落地的只有一条线:GPT-6 Astra 是官方旗舰名,API 叫 gpt-6-astra,ChatGPT 付费档里的 GPT-6 Pro 由它驱动。没有单独的 ChatGPT 6,也没有已宣布的 Ultra。
矛盾不在名字,而在三件事叠在一起。第一,价格是上一代促销价的 2.5 倍,却被宣传成「所有工作的默认模型」。第二,能力跳变集中在终端、桌面 Computer Use 和安全研究,不在已经饱和的选择题。第三,8 月因网络安全阈值推迟发布,公开模型又锁住了高级攻击任务,于是「更强」和「你能不能用上这部分更强」不是一回事。
旧方式是:旗舰一出,网关默认改成新模型。新方式是:把流量分成聊天、补全、长上下文检索、会改文件的 Agent,再决定哪一截配得起 Astra。分水岭不是模型崇拜,而是工作流入口和执行边界。
GPT-6 Astra 怎么分类
先把它拆成三层,避免把产品名、能力档和准入档混成一句「最新最强」。
| 层 | 你听到的名字 | 实际含义 |
|---|---|---|
| 产品名 | GPT-6 Astra / ChatGPT 6 / GPT-6 Pro | 同一套权重;API 为 gpt-6-astra;ChatGPT 里叫 GPT-6 Pro |
| 能力档 | 旗舰 / 端到端 / Computer Use | 面向难推理、软件工程、桌面与浏览器 Agent、研究与长文档,不是日常闲聊首选 |
| 准入档 | 公开 API / Daybreak | 公开模型拒绝编写漏洞利用证明;更松的安全研究能力只给审核过的组织 |
模态上,上线时支持文本和图像输入、文本输出;音频和视频输入未开放。推理强度 reasoning.effort 支持 low、medium、high、xhigh、max,网关默认常为 low。Responses API 工具包括网页搜索、文件搜索、图像生成、代码解释器、托管 shell、apply patch、Skills、Computer Use、MCP 和 tool search。支持函数调用与结构化输出,不支持微调。免费 API 档不可用。
知识截止为 2026 年 4 月 30 日。企业工作区默认关闭 Astra,需管理员打开。订阅额度内可用,额外用量另购积分。这和「账号里立刻能看到」不是一回事——分阶段放量时,看不到多半是日程,不是你配错了。
发布时间、价格与上下文对比
非对称结论先写在这:Astra 的分水岭是「值不值得为这一跳付 2.5 倍」,不是「它是不是最新」。
| 项目 | GPT-6 Astra | GPT-5.6 Sol(对照) |
|---|---|---|
| 宣布 / API | 2026-09-03 宣布,09-04 API | 既有旗舰 |
| 模型 ID | gpt-6-astra | 上一代旗舰 ID |
| 标准输入 / 百万 token | $10 | $4(促销,至少到 2026-11-21) |
| 标准输出 / 百万 token | $50 | $20 |
| 缓存读 / 缓存写 | $1 / $12.50 | $0.40 / 按上一代规则 |
| 输入 > 272K | 整单 2× 输入与缓存、1.5× 输出($20 / $75) | $8 / $30 |
| Batch / Flex | 标准价 50% | 标准价 50% |
| Fast 模式 | 适用费率 2×,最高约 2× 速度 | 同样 2× |
| 上下文 / 最大输出 | 1,050,000 / 128,000 | 以当时模型卡为准 |
| 渠道 | OpenAI API、Azure、AWS Bedrock、ChatGPT 付费档 | 既有渠道 |
缓存写入按未缓存输入的 1.25 倍计,不是折扣。搜索和 Computer Use 另收工具调用费。长提示不要「先把整个 monorepo 塞进去再看账单」:超过 272K 输入后,整单升档,不是只给超出的那一截加价。
部署节奏:首日给有限组织(含 Daybreak 网络安全项目),随后数日进入 ChatGPT Plus、Pro、Business、Enterprise,以及 API 与云厂商。Pro / Business / Enterprise 另有 GPT-6 Astra Pro。合格 API 客户可申请零数据保留;OpenAI 同时在测 Private Safety Processing。速率数字按用量档变化,免费档不支持该模型。
Coding 能力怎么读,而不是怎么崇拜
OpenAI 称 Astra 是「迄今最适合软件工程的模型」。Jane Street、Lovable 等早期用户强调:Agent 编码时更好跟、更少轮次才到可合并质量。这些是体验描述。对照表才是决策材料——而且是自评。
| 基准(OpenAI 自评) | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| FrontierCode 1.1 Extended | 64.5 | 60.6 | 63.6 |
| FrontierCode 1.1 Main | 53.3 | 47.5 | 50.9 |
| AA Coding Agent Index v1.4 | 67.0 | 65.1 | — |
读法应当反过来:Terminal-Bench 从 37.3% 到 57.9%,说明会跑终端、会配环境、会做系统级任务的 Agent 确实上台阶;DeepSWE 只高 1.4 分,说明「在仓库里修 issue」这一档并没有出现代际裂缝。独立评测里,Artificial Analysis 的 Coding Agent Index 曾把 Fable 5.1 放在 70、Astra 放在 67——发布会叙事和第三方指数不必一致。
工程上更有用的是工具,不是分数。Astra 带 hosted shell、apply patch、code interpreter。Lovable 的观察是:把 effort 从 low 拉到 high,模型更愿意多轮构建、用浏览器验收,并偏向「真跑代码」而不是只打补丁。Codex 还在试验「跨窗口记笔记」:以前靠压缩摘要续命,细节会丢;现在可检索更早的窗口。该能力将在随后数周成为 Astra 默认,但上线时仍是实验项。
协议层没有变:模型产出结构化工具请求,运行时执行副作用。若你还在把三家 JSON 方言写进业务 if-else,先把内部 ToolCall 收拢,再接 Astra。细节见站内 Function Calling 协议对照。和 Gemini、上一代 GPT 的分流,可参考 Gemini 4 vs GPT-5.6。
Agent 与 Computer Use:真正拉开的那一层
OpenAI 把 Astra 定位成「计算机使用速度、准确率和安全的新前沿」。它能填表、改 CRM、整理日历、做检索并写进邮件或文档、在科学软件里看数据、建站并做前端验收、按屏幕排障。这些句子的共同点是:模型要碰到真实 UI 和文件系统,而不是只返回一段建议。
| 基准(OpenAI 自评) | GPT-6 Astra | GPT-5.6 Sol | 说明 |
|---|---|---|---|
| OSWorld 2.0 | 72.6% | 65.7% | 约 40 分钟 / 任务,Sol 约 75 分钟 |
| ScreenSpot-Pro(无外挂工具) | 92.7% | 76.9% | 屏幕定位 |
| Agents' Last Exam | 59.3% | 53.6% | 专业软件里的长任务 |
| BrowseComp | 91.5% | 90.4% | 浏览与检索 |
| AutomationBench | 41.4% | 18.1% | 办公自动化,基数仍低 |
和 Codex 套件叠在一起,Mind2Web 上的完成速度约为 Sol 的 1.9 倍。对齐数字同样被放进发布材料:在「任务做不到就越权」的内部评测里,无生产护栏的 Sol 越权约 48%,Astra 为 0%;幻觉相关评测从 12.2% 降到 4.2%。它更会补常规缺口、在结果会变时提问,并在 Codex 里异步提问、不影响无关步骤。
网络安全是另一条必须单独记账的能力。OpenAI 称 Astra 达到准备框架的 Critical 阈值:在受控评估中能发现并串联此前未知的漏洞。ExploitBench 自评 100%(Sol 78.5%)。公开上线版本会拒绝编写漏洞利用证明等高级攻击任务;防御侧仍可用于安全代码审查和补丁。更松的护栏只通过 Daybreak 放给受审组织。本文不讨论攻击步骤,只提醒:如果你的用例是安全研究,入口是项目审核,不是把公开模型「越狱」。
因此 Agent 能力不等于「给我一个永远在线的超级用户」。没有隔离主机,Computer Use 只是把风险从聊天框搬到你的桌面。需要真机、Xcode 或常驻节点时,先看 2026 AI 编程 Mac 怎么选,再决定本机还是 远程 Mac 租用。
场景怎么选
| 如果你是 | 就选 | 原因 |
|---|---|---|
| 日常补全、小重构、评论区改写 | GPT-5.6 Sol 或更便宜的路由模型 | DeepSWE 级差距撑不起 2.5 倍单价 |
| 要塞进近百万 token 的仓库或长文档检索 | Astra + 提示缓存,盯住 272K 门槛 | 窗口是 1.05M,但超 272K 整单升档 |
| 终端、桌面、浏览器端到端 Agent | Astra + 隔离执行环境 | 这是发布材料里跳得最大的一层 |
| 安全研究、漏洞验证 | 不要用公开 Astra 写攻击证明 | 公开模型会拒绝;走官方审核项目 |
| 幻灯片、文档、ChatGPT Sites | Astra 可用,先算输出 token | 模板遵循更好,但 $50/M 输出很贵 |
| iOS / Xcode / 真机验收 | 任意模型路由 + Cloud Mac | 缺的是机器,不是又一个旗舰 ID |
推荐组合
A — 个人开发者: 默认 Sol 或低价模型做补全;只有失败重试、跨模块重构、需要浏览器验收时升到 Astra。effort 默认 low,难题再 high。密钥与工作区分开。
B — 小团队 Agent: 网关按「聊天 / 编码 / computer-use」三路由。Astra 只接 hosted shell、apply patch、computer use。每个会话一台可销毁的远程 Mac,权限白名单化。日志打在工作区外,避免 destroy 时证据一起没。
C — 企业: 管理员先开工作区开关;锁快照而不是漂浮的 gpt-6-astra 别名;预算告警按项目;长上下文强制缓存前缀;安全研究走合规通道,不走生产网关。需要账户与交付边界时看 帮助中心,算月费时看 Mac mini 定价。
常见误区
- 把 ChatGPT 6、GPT-6 Pro、Astra、传闻中的 Ultra 当成四个模型。
- 把整个 monorepo 一次性塞进提示,触发 272K 整单附加费。
- 看见 DeepSWE +1.4 就宣布「编程代际革命」,忽略 Terminal-Bench 才是大跳、独立指数并不一边倒。
- 拿公开 Astra 做攻击研究或要求它写利用证明。
- 只换模型、不换执行环境:没有隔离主机,Agent 越强,桌面风险越大。
落地步骤:7 步
- 确认你的 API 档、ChatGPT 套餐或企业管理员是否已经放行 Astra;企业默认关闭。
- 在代码里锁定
gpt-6-astra与可用快照,禁止隐式跟随「最新旗舰」别名。 - 给现网流量打标签:聊天、补全、长上下文、会写磁盘的 Agent。只有后两类默认配 Astra。
- 打开提示缓存,给 272K 前后两档分别做成本估算,并加预算告警。
- 把会改文件、跑命令、开浏览器的会话放到隔离 Mac 节点,路径白名单,会话结束销毁。
- 按任务设
reasoning.effort:日常 low,跨模块 high,极难任务再试 xhigh / max,并记录 token。 - 选 10 个真实失败案例对照 Sol 与 Astra,用「轮次、返工、美元」而不是排行榜决定是否迁移。
FAQ
GPT-6 Astra 是什么?和 ChatGPT 6 是同一个吗?
是同一条产品线。官方名称是 GPT-6 Astra,API 为 gpt-6-astra;ChatGPT 付费档的 GPT-6 Pro 由它驱动。没有单独的 ChatGPT 6。
什么时候发布?现在账号里为什么还没有?
2026 年 9 月 3 日宣布,4 日 API 上线,随后数日进入付费 ChatGPT 与云厂商。分阶段放量时,看不到通常是日程,不是配置错误。
价格和上下文分别是多少?
标准价每百万 token 输入 10 美元、输出 50 美元;缓存读 1 美元、写 12.50 美元。上下文 1,050,000,最大输出 128,000。输入超过 272K,整单按长上下文档计费。Batch / Flex 半价,Fast 为适用费率的两倍。
Coding 是不是明显强于上一代和 Claude?
终端与 Computer Use 提升大;仓库内修 issue 的 DeepSWE 只高一点。独立 Coding Agent 指数上 Fable 5.1 仍可能领先。用自己的仓库验收。
能用公开模型做漏洞利用研究吗?
不能把公开模型当成攻击套件。它会拒绝高级网络攻击任务。防御向的代码审查可以使用;更松的研究能力只在审核项目里开放。
总结
GPT-6 Astra 已经发布,而且贵。它真正拉开的是 Computer Use、终端 Agent 和受控安全能力,不是「所有编程分数全面碾压」。获胜者是按任务路由的人:便宜模型处理日常,Astra 处理长上下文和会碰机器的那一截,执行落在可销毁的主机上。若还说不清 write_file 会写到哪台机器的哪个目录,就先不要把 Astra 接进可写工具。需要稳定的远程 Mac 时,从 租用页 和 定价页 看节点,账户问题走 帮助中心。