GPT-6 带来的变化,不只是模型更聪明,而是我们可以更细地分配任务、控制推理投入、复用上下文。对于做内容和 GEO 的团队来说,真正值得研究的不是“哪个模型最强”,而是怎样让检索、写作、核验和发布这条流程更可靠,同时把每篇合格内容的成本降下来。
¶ 一、模型越来越强,为什么内容还是不好用?
如果你用 AI 批量写过文章,大概率遇到过这种情况:第一眼看,结构完整、语句顺畅,连总结都挺像那么回事。可认真检查一下,就发现数据没出处、产品版本对不上,或者写了两千字,还是没回答读者最关心的问题。
这时候,最容易想到的解决办法就是:换一个更强的模型。
但我更建议先问一句:问题到底出在模型能力,还是工作流程?
如果没有可靠资料,没有清晰的任务边界,也没有发布前的核验环节,换模型未必能解决根本问题。
OpenAI 的 GPT-6 使用指南实际上也没有只围绕“能力升级”展开,而是把模型选择、推理等级、缓存、上下文压缩和多智能体协作放在了一起讨论。它强调的是:让不同能力服务于具体任务,并在上线前衡量成功率、延迟和每次成功任务的成本。
对于内容团队,这个思路很实用:别只想着让 AI 写得更多,先让它交付得更稳。
¶ 二、Astra、Sol、Luna 怎么选?把它们当成不同岗位
按照上述 OpenAI 官方指南的定位,GPT-6 Astra 面向最困难的推理工作;GPT-6.1 Sol 面向复杂编码、研究和计算机操作;GPT-6 Luna 则更偏向目标明确、需要规模化处理的重复任务,比如字段提取、分类和结构化摘要。
与其死记参数,不如把它们理解成团队里的不同岗位。
下面这张表是结合内容业务给出的选型建议,并不是官方性能排名:
| 内容环节 | 建议优先评估的模型 | 主要考虑 |
|---|---|---|
| 文章分类、字段提取、固定格式摘要 | GPT-6 Luna | 任务清楚,先看格式正确率和单位成本 |
| 多来源研究、资料整理、文章整合 | GPT-6.1 Sol | 需要跨资料判断和多步骤执行 |
| 争议分析、复杂论证、重点内容审查 | GPT-6 Astra | 错误代价更高,需要更深入的判断 |
比如,我们准备写一篇“企业如何选择 AI 接口”的文章。提取各家文档里的价格和功能字段,不必一开始就动用最强模型;分析不同方案在复杂业务中的取舍,则值得投入更多推理资源。
当然,这不是说“小模型负责的内容不用检查”。价格、计费单位、版本号这类信息,即便只是提取,也可能出错。
任务简单,只代表处理方式可以更轻,不代表验收标准可以更松。
¶ 三、推理等级不是越高越好,要看这一步值不值得
模型选好之后,还有一个容易被忽略的变量:推理投入。
OpenAI 的指南把推理等级描述为能力与价格之间的权衡:Low 对应常规提取或小幅编辑,Medium 用于需要判断的工作,High 用于深度分析和仔细审查;更高档位则应在模型支持、且额外收益值得时间与成本时再使用。
说得直白一点:
- 改一个标题,没必要让模型反复推演。
- 对比三种业务方案,可以多给一些思考空间。
- 判断两份资料是否存在实质冲突,值得认真分析。
可以从下面这套方式开始测试:
| 任务 | 建议起点 | 什么时候升级 |
|---|---|---|
| 标签归类、格式转换 | 低推理投入 | 出现明显歧义或规则冲突 |
| 文章提纲、方案比较 | 中等推理投入 | 无法解释取舍,遗漏关键条件 |
| 事实冲突分析、重要结论审查 | 高推理投入 | 仍未解决关键问题,再测试更高档位 |
这里有个重要区别:多想一会儿,不等于多知道一些事实。
如果任务需要最新价格或刚发布的产品信息,首先要补齐来源,而不是单纯提高推理等级。缺少证据时,最好的输出可能是“这项信息还无法确认”,而不是一段更流畅的猜测。
另外,上表是工作流建议,不是通用 API 参数表。实际可用的档位与参数名称,要以具体模型和接入文档为准。
¶ 四、“缓存省 95%”很吸引人,但别算错账
缓存可能是批量内容生产中最值得关注的优化点之一。
品牌介绍、写作规范、固定术语表、审核要求……这些材料经常在每次请求里重复出现。OpenAI 建议把稳定指令和参考材料放在变化的任务细节之前,并保持工具定义一致,以便复用共享上下文。官方指南提到,缓存输入的费用相较未缓存输入最高可降低 95%,具体取决于模型。
但这里一定要看清楚:
缓存输入便宜 95%,不等于整篇文章的生产成本下降 95%。
以官方公布的 GPT-6.1 Sol 标准 API 价格为例:每百万输入 token 为 2 美元,缓存输入为 0.10 美元,输出为 10 美元。这里引用的是 OpenAI 官方标准价格,不代表本站或第三方接入渠道的实际报价,价格变化请以服务方最新页面为准。
我们做一个演示算例,不是实测结果:
假设一次任务有:
- 20,000 个输入 token;
- 其中 15,000 个可以命中缓存;
- 3,000 个输出 token。
| 费用项目 | 全部输入未命中缓存 | 15,000 个输入命中缓存 |
|---|---|---|
| 未缓存输入 | $0.0400 | $0.0100 |
| 缓存输入 | $0 | $0.0015 |
| 输出 | $0.0300 | $0.0300 |
| 合计 | $0.0700 | $0.0415 |
按这个假设计算,token 费用下降约 40.7%,并不是 95%。
而且,这还没有计入工具调用、失败重试、人工审核,以及可能适用的其他费用。
所以,比较靠谱的做法是把提示词拆成两层:
**稳定层:**品牌规范、写作风格、输出格式、审核规则。
**动态层:**本次主题、目标读者、新检索到的资料、当前任务要求。
然后观察真实请求中的缓存命中情况,而不是看到“最高优惠”就直接写进项目预算。
¶ 五、多智能体很适合做研究,但不适合为了热闹而分工
一篇研究型文章,往往包含几个可以独立推进的任务:
- 查官方文档;
- 找实际案例;
- 收集常见问题;
- 核对价格和功能;
- 整理不同来源之间的分歧。
这些任务有一定独立性,适合并行处理。
OpenAI 的指南介绍,GPT-6.1 Sol 可以在 Responses API 中把独立任务分派给子智能体,再汇总结果;该多智能体能力在指南中标注为 beta。
不过,多智能体不是免费的效率提升。
Anthropic 在其研究系统的工程复盘中提到,多智能体适合向多个独立方向展开的研究,但会显著增加 token 消耗;在他们观察的数据里,多智能体系统的 token 使用量约为普通聊天的 15 倍。这个数字属于其特定系统的经验,不能直接套用到所有产品。
因此,我更建议这样安排:
让多个智能体分别找证据,让一个编辑统一组织文章,再由人工把关。
不要让五个智能体分别写五段,然后直接拼起来。这样很容易出现重复、矛盾和文风不一致。
下面是一个适合内容团队起步的流程示意:

配图为 GPT Image 2 生成的方法示意,不代表性能实测。
要让这个流程真正有用,每个子任务最好交付四样东西:
- **结论:**发现了什么。
- **来源:**证据在哪里。
- **限制:**哪些情况不适用。
- **待确认项:**还有什么不能下结论。
特别要注意:事实核验不是让另一个模型“觉得这段话没问题”,而是让它重新对照来源。
多个智能体意见一致,不等于事实已经被证明。
¶ 六、长任务要保存状态,自动操作要划清权限
做一篇短文,把资料放进上下文可能就够了。做系列专题、持续维护产品文档,问题就不一样了。
OpenAI 的指南介绍了上下文压缩,用于减少长对话的上下文体积,同时保留继续任务所需的状态。
对于内容工作,我建议无论采用哪种压缩方式,都单独维护一份任务记录:
- 已确认的事实及其来源;
- 当前使用的产品版本;
- 尚未解决的资料冲突;
- 已完成和未完成的环节;
- 必须人工确认的决定。
不要只留下“我们已经研究过这个问题”这样的模糊摘要。后续写作真正需要的是证据和边界。
自动操作也是一样。官方指南建议,能用 API 或已连接工具直接完成的步骤,优先使用这些方式;需要读屏、点击或填写表单时,再考虑计算机操作能力。
对于博客流程,可以允许 AI 自动整理草稿、检查链接、生成配图,但把正式发布、删除文章和修改线上配置放在人工确认之后。
会操作后台,不代表应该拥有无限权限。
¶ 七、回到 GEO:写得更快,不等于更容易被 AI 引用
说到这里,需要把两个问题分开:
- 用 AI 提高内容生产效率;
- 让内容在生成式搜索回答中更容易被发现和引用。
前者是工作流问题,后者才是 GEO 关注的核心。
早期 GEO 研究围绕生成式引擎中的内容可见性展开,并报告了在其评测设置下最高约 40% 的可见性提升,同时指出不同领域的效果存在差异。这个结果不能直接理解为“照着做,本站流量就会涨 40%”。
Google 的官方说明则更务实:对于 AI Overviews 和 AI Mode,不需要一套额外的特殊优化要求;基础 SEO、可靠且以人为本的内容,仍然重要。页面要具备被索引和展示摘要的资格,才有机会作为支持链接出现。
这并不能代表所有 AI 搜索产品的规则,但至少提醒我们:别急着寻找所谓的“万能 GEO 模板”。
对于本站博客,我更建议先把下面几件事做好。
¶ 1. 一篇文章解决一个真实问题
“全面解析 AI 的未来”听起来很大,却不一定有用。
“批量生成产品文案,怎样判断缓存是否真的省钱”,反而更容易讲清楚,也更方便读者直接应用。
¶ 2. 给数字补上适用条件
不要只写“成本下降 40%”。
要说明使用什么模型、怎么算的、是否包含输出、工具和人工费用,以及这个数字是实验结果还是演示算例。
¶ 3. 关键内容不要只藏在图片里
Google 明确建议重要内容以文本形式呈现,结构化数据也应与页面可见内容保持一致。
所以,图表可以帮助理解,但正文仍要交代结论、数据和条件。
¶ 4. 把事实、建议和预测分开
“官方文档支持某项功能”是一类信息。
“我们建议内容团队这样用”是另一类。
“未来可能带来某种变化”又是第三类。
明确区分它们,比把所有句子都写得斩钉截铁更有价值。
¶ 5. 观察真实结果,不迷信自评得分
可以建立一个固定问题集,定期记录不同 AI 搜索产品是否引用本站、引用了哪篇文章、引用是否准确,再结合实际访问和转化分析。
这样的跟踪仍然会受到时间、地区和产品差异影响,但至少比给文章打一个没有公开依据的“GEO 高分”更有参考价值。
¶ 八、真正该优化的是“每篇合格文章的成本”
内容团队很容易盯着两个数字:一天生成多少篇,每篇消耗多少 token。
但如果生成了 100 篇,最后只有 20 篇能发布,这个效率可能并不高。
我更建议看这个指标:
单篇合格内容成本 = 总生产成本 ÷ 通过审核的文章数量
其中,总生产成本应该包含模型调用、检索工具、返工和人工审核,而不只是第一次生成的费用。
实际落地时,可以先选一批有代表性的任务做小规模测试,不要一开始就全站铺开。
重点记录:
| 指标 | 要回答的问题 |
|---|---|
| 事实错误率 | 有没有编造、过时信息或版本混淆? |
| 来源可追溯性 | 关键结论能不能找到原始依据? |
| 首轮审核通过率 | 有多少内容不需要大幅返工? |
| 单篇合格成本 | 包括失败任务和人工之后,究竟花了多少? |
| 交付时长 | 从开始检索到可以发布,需要多久? |
| 发布后的效果 | 是否带来有效访问、引用或业务转化? |
测试后再决定:哪些任务降级处理,哪些环节提高推理投入,哪些研究值得并行,哪些步骤必须交给人。
¶ 写在最后:把聪明用在该用的地方
GPT-6 给内容团队提供了更多选择,但选择变多,并不意味着每一步都要用最强配置。
更值得尝试的方向是:
简单任务轻量处理,复杂判断认真推理,重复上下文尽量复用,独立研究适度并行,正式发布之前保留审核。
对 GEO 来说,也一样。
没有哪个模型能替一篇文章保证被引用。我们能做的,是让它回答真实问题、提供可追溯的证据,并把适用范围讲清楚。
说到底,真正值得追求的不是“让 AI 多写一点”,而是:
让每一篇发布出去的内容,都更值得读,也更经得起检查。
¶ 参考资料
- OpenAI:GPT-6 实践指南
- OpenAI:Introducing GPT-6.1 Sol
- Anthropic:How we built our multi-agent research system
- GEO: Generative Engine Optimization(KDD 2024)
- Google Search Central:AI features and your website
本文为资料整理与应用分析,不属于本站性能实测。模型能力、测试阶段和价格可能变化,请以服务方最新文档为准。

