🤖
AI审核中

GPT-6 Astra

Java 13分钟 107浏览 0评论

这两年,大模型的更新越来越容易陷入一场数字竞赛:参数更多、上下文更长、跑分更高。然而读完 GPT‑6 Astra 的官方资料后,我认为它真正值得关注的地方,并不是某个单项数字,而是模型处理复杂工作的方式发生了变化。

OpenAI 将 GPT‑6 Astra 定位为面向高难度端到端任务的旗舰模型。它不只负责生成答案,还试图在代码、浏览器、文件和专业软件之间持续推进多步骤工作,期间可以调用工具、等待结果、接受用户修正,再回到原任务继续执行。

这让 Astra 更像一个可以持续协作的执行引擎,而不只是一个更聪明的聊天窗口。

资料口径:本文依据截至 2026 年 9 月 4 日的 OpenAI 官方文档整理。GPT‑6 Astra 正在分阶段开放,当天首先面向 Trusted Access Program 中的企业推出;API 以及 Plus、Pro、Business、Enterprise 方案将在随后几天陆续获得访问权限。本文不代表所有付费账户目前都已开通。

一、GPT‑6 Astra 是什么

GPT‑6 Astra 的正式模型 ID 是:

gpt-6-astra

OpenAI 官方称它是目前能力最强、智能水平最高的模型,重点面向以下任务:

  • 复杂推理与科学问题;
  • 软件开发、代码审查和大型工程任务;
  • 浏览器操作与网页研究;
  • 计算机操作和专业软件工作流;
  • 长文档分析与内容创建;
  • 需要多个工具配合的多阶段任务。

官方还表示,Astra 在部分评测中以更少的输出 token 获得了更好的结果。因此,虽然它的单 token 价格高于此前的模型,但某些复杂任务的单次完成成本反而可能降低。

这里需要保留一个理性的限定:这些是 OpenAI 给出的产品定位和评测结论。对真正准备接入 Astra 的团队来说,仍然应该用自己的任务、数据和验收标准进行对比,而不能只看厂商跑分。

二、模型规格一览

根据官方模型页,GPT‑6 Astra 的主要规格如下:

项目 官方规格
模型 ID gpt-6-astra
输入模态 文本、图片
输出模态 文本
上下文窗口 1,050,000 tokens
最大输入 922,000 tokens
最大输出 128,000 tokens
知识截止日期 2026 年 4 月 30 日
推理强度 lowmediumhighxhighmax
Responses API 支持
Chat Completions 支持
Batch API 支持
Realtime API 不支持
Fine-tuning 不支持

一个容易误解的地方是,上下文窗口达到 105 万 tokens,并不等于可以输入 105 万 tokens 的提示词。官方给出的最大输入是 92.2 万 tokens,其余空间还要留给模型输出和推理过程。

此外,知识截止日期也不等于模型拥有实时信息。需要最新资料时,仍然要通过 Web Search、浏览器或其他外部数据源完成检索。

三、Astra 最重要的四项变化

1. 异步工具调用

传统工具调用通常是一条串行链路:

  1. 模型决定调用工具;
  2. 应用执行工具;
  3. 模型暂停等待;
  4. 工具返回后继续推理。

如果工具需要运行几十秒,整个任务就会停在那里。

GPT‑6 Astra 增加了异步工具调用能力。开发者可以在函数工具或自定义工具上显式设置:

async: true

工具运行期间,Astra 可以继续推理、调用其他工具,或者先处理任务中不依赖该工具的部分。应用完成工具执行后,再使用原始 call_id 回传结果。

这里的关键是“异步”并不代表工具由模型自动执行。应用仍然负责:

  • 真正运行工具;
  • 保存等待中的调用状态;
  • 控制超时和重试;
  • 使用正确的 call_id 回传结果;
  • 处理权限、审计和幂等性。

Astra 改善的是模型等待工具时的任务编排能力,而不是替应用接管运行环境。

2. 运行中的指令修正

过去让模型执行一个长任务时,如果中途发现方向不对,通常只能取消请求、修改提示词,然后重新开始。

Astra 支持 Mid-turn steering,也就是在模型仍然工作时追加或修改用户要求。例如:

  • “不用继续分析旧接口,改为新版本。”
  • “保留刚才生成的测试,但不要修改数据库。”
  • “报告需要增加成本评估。”
  • “先暂停部署,只生成可审查的差异。”

通过 WebSocket 使用 Responses API 时,系统会保留已经完成的工作,并把新指令加入后续 continuation。模型不需要从头重做整个任务。

它和 Realtime API 并不是一回事。GPT‑6 Astra 本身不支持 Realtime;这里指的是 Responses API 长任务中的指令追加机制。

3. 动态调整推理强度

Astra 不支持关闭推理,也就是不能使用 none。可用档位从 lowmax

更有意思的是,应用可以在同一段持续会话中加入 configuration_update 输入项,动态调整后续工作的推理强度。例如:

  • 普通信息提取使用 low
  • 遇到复杂代码缺陷时提升到 high
  • 关键架构决策使用 xhighmax
  • 问题解决后再降回较低档位。

这种方式不需要重写原始提示词前缀,也有利于继续利用提示缓存。更新后的推理强度会持续生效,直到下一次配置覆盖。

4. 更完整的端到端工作流

Astra 支持结构化输出、函数调用、文件搜索、网页搜索、图片输入、代码执行、计算机操作、MCP、Hosted Shell 和 Prompt Caching 等能力。

当这些能力组合起来后,模型可以处理更接近真实工作的流程:

  • 阅读需求和设计稿;
  • 检查代码仓库;
  • 搜索外部资料;
  • 修改代码;
  • 运行测试;
  • 分析失败原因;
  • 根据用户中途反馈调整方向;
  • 最终输出报告或可交付结果。

四、GPT‑6 Astra 的典型工作流程

下面这张图展示了 Astra 通过 Responses API 处理复杂任务时的概念流程:

flowchart TD
    A(["用户提交复杂任务"]) --> B["Responses API:gpt-6-astra"]
    B --> C["Astra 分解任务并持续推理"]
    C --> D{"是否需要外部工具?"}

    D -->|"不需要"| I["生成文本或结构化结果"]
    I --> Z(["最终输出"])

    D -->|"需要"| E["发出异步函数或自定义工具调用"]
    E --> F["应用执行工具并维护 pending 状态"]
    E --> G["Astra 继续推理、调用其他工具或处理独立部分"]

    F --> H["应用使用原 call_id 回传工具结果"]
    G --> J["汇总已经完成的工作"]
    H --> J
    J --> C

    S["用户中途补充或修正要求"] -.->|"Mid-turn steering"| C
    R["configuration_update 调整推理强度"] -.-> C

这张图里有两个角色需要分清:

  • Astra 负责理解任务、推理、规划和决定调用什么;
  • 应用负责执行工具、保存状态、管理权限并回传结果。

一个可靠的智能体系统不能只依靠模型能力。工具运行器、任务状态机、权限系统、日志、重试和人工确认机制同样重要。

五、百万级上下文意味着什么

105 万 tokens 的上下文窗口,最直接的价值是减少复杂任务中的信息切割。

以前分析大型代码仓库、合同集合或研究资料时,应用通常要先把内容切成很多小块,再通过检索找出可能相关的部分。这套方法仍然有价值,但检索一旦遗漏关键上下文,模型就可能在信息不完整的情况下推理。

更大的上下文可以容纳:

  • 大型代码仓库中的多个模块;
  • 数百页的技术、法律或业务文档;
  • 很长的任务历史和工具执行记录;
  • 多轮推理过程中形成的中间结果;
  • 图片与文本混合的输入;
  • 多个智能体之间的任务交接内容。

不过,大上下文不代表应该把所有资料无差别塞进请求。大量无关信息仍然会增加成本、延迟和注意力干扰。

更合理的方式是先整理任务边界,再结合文件搜索、摘要、缓存和上下文压缩,让模型看到完成任务真正需要的信息。

六、哪些场景更适合 Astra

软件工程

Astra 适合处理跨文件、跨模块甚至跨工具的软件任务,例如:

  • 阅读需求和现有架构;
  • 定位缺陷根因;
  • 修改多个关联模块;
  • 运行单元测试与集成测试;
  • 根据失败日志继续修复;
  • 使用浏览器验证最终页面;
  • 输出变更说明和部署记录。

它的优势不只在于写代码,而在于维持整个任务的上下文,并持续推进到可以验证的结果。

深度研究

结合网页搜索、文件搜索和代码执行工具后,Astra 可以完成资料搜集、来源比对、数据处理和报告撰写。

异步工具调用在这个场景中尤其有价值:等待一个数据源时,模型可以先阅读已经返回的资料,或者继续调用其他独立来源。

文档与专业工作

官方将文档创建和专业软件工作列为主要用途。典型任务包括:

  • 汇总多份报告;
  • 对比合同或政策版本;
  • 生成带固定结构的分析文档;
  • 处理表格并解释结果;
  • 在浏览器或桌面软件中完成重复操作。

长时间运行的智能体

Mid-turn steering 对长任务非常重要。用户不必等到任务全部结束才发现方向错误,可以在执行过程中追加约束、改变优先级或者停止某个分支。

这使模型与人的协作更接近真实项目:要求会变化,任务也需要根据新信息重新规划。

七、如何通过 API 调用

OpenAI 推荐使用 Responses API。最简单的 Python 示例可以写成:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "high"},
    input=(
        "请审查这个项目的认证流程,找出安全风险,"
        "给出修复方案,但不要修改生产环境。"
    ),
)

print(response.output_text)

API Key 应当通过环境变量或密钥管理服务提供,不要直接写入代码仓库。

从旧模型迁移时,还要注意几个兼容性问题:

  1. Astra 虽然支持 Chat Completions,但工具调用必须使用 Responses API。
  2. 如果原来使用 noneminimal 推理强度,应先改为 low
  3. Astra 不支持 temperaturetop_ptop_logprobs
  4. 异步调用只对显式设置 async: true 的函数或自定义工具生效。
  5. Mid-turn steering 需要通过 WebSocket 使用 Responses API。
  6. configuration_update 不是永久配置,也不是微调,只影响当前持续会话后续的推理设置。

八、价格与成本边界

GPT‑6 Astra 的标准 API token 价格如下:

计费项目 每百万 tokens
输入 10 美元
缓存输入 1 美元
缓存写入 12.50 美元
输出 50 美元

当输入超过 272K tokens 时,整个请求都会使用更高费率:

  • 输入和缓存输入费率变为 2 倍;
  • 输出费率变为 1.5 倍。

需要注意,这里是 API 价格,不是 Plus、Pro 等 ChatGPT 订阅方案的价格。

OpenAI 表示 Astra 在一些评测中能用更少的输出 tokens 完成任务,因此预计单任务成本可能低于旧模型。但在实际系统中,成本还会受到很多因素影响:

  • 推理强度;
  • 输入上下文长度;
  • 工具调用次数;
  • 失败重试次数;
  • 缓存命中率;
  • 任务能否一次完成;
  • 是否需要人工返工。

评价 Astra 时,与其只比较每百万 tokens 的单价,不如比较“完成一个合格任务总共花了多少钱”。

九、当前限制与需要保持警惕的地方

尚未全面开放

截至 2026 年 9 月 4 日,Astra 仍处于分阶段推出阶段。文章发布较晚时,应重新检查官方模型页,确认账户范围和 API 可用状态是否已经变化。

不是所有端点都支持

Astra 支持 Responses、Chat Completions 和 Batch,但不支持 Realtime、Assistants、Fine-tuning、Embeddings,以及专用的图片、视频和音频生成端点。

模型可以通过 Responses API 调用 Image Generation 工具,但这不等于 Astra 自身会直接输出图片。它的原生输出模态仍然是文本。

更强的执行能力需要更严格的权限

当模型可以操作代码、浏览器、终端和外部系统时,错误操作造成的影响也会更大。生产应用至少需要:

  • 最小权限原则;
  • 清晰的工具白名单;
  • 高风险操作的确认边界;
  • 可审计的调用日志;
  • 超时、取消和重试机制;
  • 幂等的写入接口;
  • 对提示词、Skill、MCP 和项目指令文件进行审计。

官方指南特别提醒,Astra 对 Skill、AGENTS.md 等上下文指令更加敏感。如果系统中存在冲突、过期或来源不明的指令,模型可能准确地执行了一条本不应该存在的要求。

“最强”仍然不等于“不会犯错”

OpenAI 将 Astra 描述为目前最智能、最一致的模型,并加强了行为监控和任务边界控制。这些改进很重要,但不能替代应用自己的事实核查、测试和权限设计。

任何用于财务、医疗、法律、安全或生产基础设施的工作流,都不应该因为模型升级就取消必要的人工复核。

十、我会怎样评估是否值得迁移

如果准备在真实项目中尝试 Astra,我不会一开始就把所有流量切过去,而是选择一组高价值、可复现并且有明确验收标准的任务。

重点记录以下指标:

  • 端到端任务完成率;
  • 首次交付通过率;
  • 用户中途干预次数;
  • 工具调用成功率;
  • 总执行时间;
  • 输入、输出与缓存成本;
  • 失败后的恢复能力;
  • 与现有模型相比节省的人工时间。

对于简单问答、分类或短文本改写,更便宜、更快的小模型可能仍然合适。Astra 的价值更可能体现在那些步骤多、上下文长、工具依赖复杂,而且失败后返工成本很高的任务上。

十一、结语

GPT‑6 Astra 最值得关注的变化,不是上下文从几十万增长到 105 万,也不只是官方宣称的更高智能水平。

真正的变化是,大模型开始更认真地处理“工作正在进行中”这件事:

  • 工具还没返回时,可以继续推进其他步骤;
  • 用户改变要求时,不必把整个任务推倒重来;
  • 问题变复杂时,可以动态提高推理强度;
  • 面对代码、浏览器和专业软件时,可以维持更完整的执行链路。

这使 Astra 更接近一个长期协作的智能体核心。

它能否真正提高生产力,最终仍取决于模型之外的系统设计:工具是否可靠、权限是否清晰、状态能否恢复、成本是否可控,以及结果是否经过验证。

Astra 提供了一台更强的引擎。如何设计方向盘、刹车、仪表盘和道路规则,仍然是开发者必须完成的工作。

参考资料

  1. OpenAI Docs:Using GPT‑6 Astra
  2. OpenAI Docs:GPT‑6 Astra 模型规格
  3. OpenAI Docs:Async tool calling
  4. OpenAI Docs:Mid-turn steering
  5. OpenAI Docs:Reasoning models
  6. OpenAI Docs:API Pricing
0 条评论
如果你觉得文章对你有帮助,那就请作者喝杯咖啡吧☕
微信
支付宝
  0 条评论