GPT-6 Astra 发布后,一个高频反馈是能力很强,额度也掉得很快。
OpenAI 的说法略有不同。
在部分评测中,Astra 用更少的输出 Token 完成了任务,单次任务的预估 API 成本也可能低于早期模型。
这项结论只覆盖特定评测和 API 成本。
普通用户感受到的消耗还会受到推理强度、上下文长度、工具调用和测试次数影响。
Codex 套餐额度也没有公开与 API Token 一比一换算。
根据 OpenAI 模型指南以及它链接的推理、缓存和上下文文档,整理出 7 个更实用的省额度办法。
一、一般任务先用 Low
Astra 不支持 none,最低推理档位是 low。
整理资料、修改文案、调整格式和局部改动,可以先用 Low。
架构设计、复杂排错和深度研究,再提高推理强度。
API 用户还可以用 configuration_update 临时调整档位。
普通步骤保持 Low,遇到难题时升高,完成后再降回来。
二、把任务范围写具体
“帮我优化一下这个项目”可能触发全库检查、多个文件修改和完整测试。
更省的写法是明确对象与边界。
只修改登录页面的按钮文案,不调整样式,不检查其他页面。完成后确认项目可以正常构建。
提示词虽然多了几个字,模型做的工作却少了很多。
三、限制最终回复长度
官方文档提到,Astra 倾向生成详细回答,也喜欢使用列表、表格和 Markdown。
可以直接规定交付格式。
最终回答不超过 5 点,只说明结果、改动、验证情况和未解决问题。省略背景、过程复述和重复总结。
这能直接减少输出 Token。
四、小改动只跑必要测试
Astra 对测试比较认真,小任务也可能触发范围较大的验证。
可以补充一句。
只运行与本次改动直接相关的最小测试。测试通过后不要重复或扩大验证,除非出现失败或新的风险。
涉及支付、权限和数据迁移时,仍要保留必要检查。普通文案和样式修改,没有必要每次都跑完整测试。
五、允许它处理低风险细节
Astra 遇到歧义时更愿意提问。每增加一轮确认,模型都要重新读取上下文并继续推理。
可以提前授权。
对低风险细节作合理假设并继续执行。只有不同选择会明显影响结果,或者涉及不可恢复的操作时才向我确认。
这样能减少任务反复中断。
六、简单任务限制子代理
每个子代理都要读取任务、调用工具并返回结果。小任务交给多个代理,总消耗通常会更高。
可以规定默认不使用子代理。只有任务能够独立并行,并且确实能减少总工作量时才允许调用。
同时检查 Skills 和 AGENTS.md。
Astra 对这些文件里的指令更敏感。重复、过期或互相冲突的规则会增加输入,也可能让模型做额外检查。
七、长对话及时压缩
对话越长,每轮需要处理的历史内容越多。
API 用户可以使用 Compaction 压缩早期上下文,也可以通过 previous_response_id 延续已有任务。
经常重复使用的固定指令,还可以放在提示词前部,利用 Prompt Caching 降低输入成本。
缓存主要节省 API 费用,未必会减少 Codex 界面显示的消耗。
Compaction 会直接缩短后续请求需要处理的上下文。
普通 Codex 用户可以遵循一个简单原则。
同一个项目继续原任务,话题已经改变或历史材料大量失效,就新开任务,只提供当前步骤需要的背景。
可以直接复制的省额度提示词
采用省 token 模式完成本任务。
只处理我明确要求的范围,不主动扩展功能。
对低风险细节自行作合理假设,只有影响结果的关键歧义才提问。
默认不使用子代理,除非并行处理能够明显减少总工作量。
只读取与任务直接相关的文件,不进行无目的的全库扫描。
只运行最小必要测试,测试通过后不重复或扩大验证。
最终回复不超过 5 点,只报告结果、改动、验证情况和未解决问题。
Astra 会认真处理复杂任务。把范围、推理强度和完成标准写清楚,简单任务才能在该停的位置停下来。