Planning with GPT, Execution with DeepSeek: A Cost-Saving Two-Model Workflow
Original title: 为了省钱,我给 GPT 招了个 DeepSeek 员工。
The author has GPT (gpt-6.1-sol, reasoning tier high) handle planning, key decisions, and acceptance in Codex, and calls DeepSeek-V4.1-Flash through the official DeepSeek Harness to write code, run experiments, and fix bugs—together producing a local PDF toolkit with five working features.
The author splits the work between GPT for planning and DeepSeek for execution to get a PDF toolkit running, and shares three prompts plus cache usage data that can carry over to cutting costs on long tasks.
The full text in the selected language is awaiting translation. The original is shown for now.
大家好,我是佬刘。
用 AI 做一个工具,最贵的地方,可能是让同一个模型从头忙到尾。
理解需求、写方案、改代码、跑命令、看报错,再改,再试。任务一长,这些循环就会不断积累调用成本。
所以我试了个安排。
让 GPT 做规划、关键判断和方向调整,把大量开发与试验交给更便宜的 DeepSeek。给 GPT 招了个员工
这次,我让它们一起做了一个本地 PDF 工具箱,五项功能已经跑通。
01
贵模型负责想,便宜模型负责干
执行模型当然也要思考。这里要调整的,是把持续写代码、运行和试验的工作量,放到哪条模型通路上。
这次 GPT 用的是 gpt-6.1-sol,推理档位 high;执行端通过 DeepSeek 官方 Harness,调用 DeepSeek-V4.1-Flash。
先看官方 API 的价格差,单位为美元/每百万 token。
GPT 价格按标准 API、输入不超过 272K token;DeepSeek 按非高峰价格,高峰时三项翻倍。
为什么选择 Flash 模型干活?原因在于,快!便宜!
我更想分享的是,这个组合怎么实际运转。
Codex 是 GPT 工作的入口。GPT 能操作项目文件、运行命令,也就能从终端启动 DeepSeek 的 Harness。
DeepSeek Harness 可以说是一把「专武」。它让模型读文件、写代码、调用工具、观察结果,再继续执行。并且对 DeepSeek 系列模型做了适配和优化,无论是模型能力还是缓存都有提升!
我只在 Codex 里交代目标。GPT 把需求整理成任务文件,再通过命令行交给 Harness。DeepSeek 在里面持续开发和自测,交付后,GPT 读取真实文件和结果,决定进入下一阶段,还是调整方案。
02
三段提示词,把协作跑起来
如果你也想跑,可以照着下面三段提示词来。打开 Codex,选一个空的项目目录,先把员工的工作环境装好。
安装、启动,再配置模型
第一段交给 Codex,安装并启动 Harness。
提示词 01 · 安装与启动
请按官方项目 https://github.com/deepseek-ai/deepseek-harness 的当前安装说明,在本机准备 DeepSeek Harness。先检查 Node.js、npm 和已有安装,缺少的依赖帮我补齐,已有可用版本就复用并记录版本。
在当前项目目录用官方 npm 包启动 Web 界面,快速启动方式是 npx @deepseek-ai/dsh web。保持服务运行,打开实际访问地址,并告诉我之后如何启动和停止。如果端口已被占用,先检查已有服务。本轮先完成安装和启动,模型 API 由我在界面里填写。
正常启动后,浏览器会打开 Harness 的界面,默认地址是 http://127.0.0.1:3080,以实际启动输出为准。把刚才的项目目录添加为工作区并选中,然后进入「设置 → 模型」。
如果走 DeepSeek 官方 API,就到 DeepSeek 开放平台 创建 API Key,填到 DeepSeek 提供商的密钥栏,保存后选择 DeepSeek-V4.1-Flash。本次官方 API 调用里的模型 ID 是 deepseek-flash。
也可以用第三方 API。已有提供商就选对应入口;自定义接口则填写 API 地址、协议、密钥和对方实际提供的模型 ID。界面支持兼容 OpenAI/Anthropic 协议的接口,模型列表没有自动出现时,也可以手动添加。官方模型配置说明
Harness 里还有一套插件体系,文件读写、终端命令、网页检索、Skills、上下文压缩等能力都在这套架构里,也能按需接入 MCP 或扩展插件。设置里的「内置插件」可以查看组件,插件管理页负责安装和启停。后面需要更多能力,可以继续加,不必只把它当成一个聊天窗口。
先让 GPT 想方案、写文档
模型配好以后,先让 GPT 想方案。
这是第二段。把里面的项目目标换成自己的,PDF 工具箱、记账页面、照片整理工具都可以。
提示词 02 · 规划与文档
我要做的项目是【填写目标、使用场景和核心功能】。你担任项目负责人,先分析需求、确定功能范围、技术方案和分阶段计划,本轮先完成规划。
把方案写进项目文件,至少包含需求说明、实现计划、任务清单和验收标准。每个阶段写清输入、预期结果、测试样本和完成条件,标出需要我决定的取舍。再整理第一轮发给 DeepSeek 的任务文件,列出它要先读的文档、要交付的文件和自测要求。给我一份简短的方案摘要和文档路径。
这些文档就是交接的底稿。GPT 先把要做什么、怎么做、做到什么程度算完成写清楚,DeepSeek 接到的是一轮具体任务,后面也有标准可以对照。
让 DeepSeek 开工,GPT 负责调度
看过方案,补上自己的要求,再发第三段,让它开始执行。
提示词 03 · 执行与验收
按刚才的方案推进项目。你负责调度、关键判断、方案修正和独立验收,通过 DeepSeek 官方 Harness 调用我已配置的 DeepSeek-V4.1-Flash,让它负责业务代码、运行试验和修复。
先核对命令行执行用的 profile、提供商和实际模型路由,确保与我要使用的配置一致。网页配置与 headless 配置分别检查。用写文件、续接读文件的小任务验证通路,把真实返回的 session ID、工作目录、Harness home、profile 和版本保存到项目状态文件。
后续开发和返工显式传入同一个 session ID,串行执行。续接失败先排查,不要悄悄另开会话。每轮让 DeepSeek 先读需求、方案和验收文档,再完成这一阶段,交付改动摘要、文件路径、自测结果和待决问题。
你按验收标准检查实际文件与运行结果,通过后继续下一阶段;需要调整时,更新方案,把复现样本和具体任务交回同一 session。阶段结束更新检查点、记录用量,详细证据留在项目里,按需读取。
这里有个容易忽略的细节。网页端和命令行 headless 是不同的 profile,网页里选好模型后,要让 Codex 检查执行端是否也用了对应配置。
真正派活的命令就两种,交给 Codex 管理就行。第一次读取任务文件,保留 JSON 事件输出。
npx @deepseek-ai/dsh --profile headless --json < task-01.md > run-01.jsonl从首次返回的 session 事件里取出真实 ID,存进状态文件。下一轮开发或返工,明确续接它。
npx @deepseek-ai/dsh --profile headless --json --session-id '替换为首次返回的真实ID' < task-02.md > run-02.jsonltask-01.md、task-02.md 都是 GPT 整理的任务文件。headless 完成一次任务就退出,下次默认开启新会话。所以,还在同一个 Codex 聊天里,不代表 DeepSeek 自动记得上一轮, --session-id 要由 Codex 每次明确带上,工作目录、Harness home 和 profile 也沿用原配置。
跑起来以后,开发过程就是一个循环。
GPT 写方案、定阶段目标,DeepSeek 开发和试验,GPT 检查交付、调整下一轮,再交给 DeepSeek 继续干。
03
PDF 工具箱,交付长什么样
PDF 工具箱先做图片互转,再做文字型 PDF 与 Word 互转,再加压缩。准备了 21 个样本,把页序、中文、透明底、照片方向、损坏文件等情况提前放进去。
PDF 转 Word 要得到真实、可修改的文字。压缩则要看文件有没有变小,还得看页面是否清晰。
其中一个大位图样本,从约 11.67 MiB 压到 294.9 KiB,减少 97.53%。另一份中文文件的无损整理只减少约 1.45%,没有收益的样本就保留原文件。
过程中,GPT 追加样本发现,同一张图片跨页复用时,初版压缩没照顾到最大显示尺寸。它把复现文件和处理要求交回 DeepSeek,由 DeepSeek 完成修复,再检查结果。
这就是负责人调整方向、执行端继续试验的一个节点。
04
上下文与缓存,长任务怎么省钱
开发细节不必全部搬进聊天。让 DeepSeek 先交短摘要,把文件和完整证据留在项目里,GPT 按需要读取。否则低成本模型刚省下的调用,可能又花在两边重复传材料上。
上下文压缩也别太勤。
每轮交付后,让 DeepSeek 更新检查点,写清目标、完成项、失败项、关键文件、运行命令和下一步。确实接近容量限制,或者历史日志已经妨碍继续工作时,再按本机版本支持的入口压缩,尽量选阶段检查结束的节点。
压缩前保存状态,压缩后继续同一 session、重读检查点并复查关键样本。压缩会改变历史前缀,也可能影响缓存复用。
这次保留了默认自动策略,没有发生原生压缩。写一份检查点,和 Harness 真正压缩历史,是两件事。
这套组合还有一个适合长任务的地方,上下文缓存。
模型持续工作,会反复带上前面的需求、对话和工具结果。DeepSeek 对满足条件的相同输入前缀,可以走更便宜的缓存读取。非高峰时,命中输入的单价是未命中输入的五十分之一,输出仍单独计费。
这张是本次任务在 DeepSeek 官网的实际用量统计。
官网显示总用量 37,244,445 token。拆开看,3692 万多是命中缓存的输入,未命中输入只有约 12.7 万,输出约 19.2 万。
输入 token 的缓存命中占比约 99.66%。这不是一次塞进去几千万 token,而是很多轮请求反复读取历史材料的累计。
按本次非高峰价格,再以 2026 年 9 月 30 日的汇率中间价,1 美元约合 6.7351 元人民币折算,可以把这一段执行成本算出来。下面的费用单位是人民币。汇率来源
本次 DeepSeek 执行端费用
也就是说,DeepSeek 这端正式开发与返工的 API 费用,按用量折算约 1.65 元,不到 2 元。GPT 这端的成本另计。本次适用的官方单价
这个数字让我觉得,持续让低成本模型读文件、改代码、跑试验,是值得做的。大量历史输入可以复用缓存,执行端就能耐心多试几轮。
持续 session 帮助保留对话,缓存是否命中仍取决于服务端的前缀匹配。有同一个 ID,不等于每次都保证命中。
05
再省一步,看看 Coding Plan
不过,我接着想到,如果以后每个月都让它做很多东西,还能不能再便宜一点?
这就可以看编程订阅了,比如月费 10 美元左右的 OpenCode Go 和 CommandCode GOAT。
OpenCode Go 和 CommandCode GOAT 都提供 V4.1 Flash。这两项是另外的套餐选择,本次实测使用的是 DeepSeek 官方 API。
下面专门按 DeepSeek 的用量来看,别把月费、套餐额度和请求次数混成一件事。
国内也有类似的编程订阅,例如阿里百炼平台和字节的火山。但是值得提醒的是,各家的Coding plan质量参差不齐,同样的模型效果可能有很大差别!
这一套分工的优势,也就在这里。GPT 负责规划和关键判断,执行端可以按任务能力、调用量和价格来选。用 DeepSeek 官方 API 跑通后,还可以评估更合适的编程套餐,或者让其他模型接手执行。
高频开发、能充分利用额度时,Coding Plan 有机会把平均执行成本压得更低。
06
把模型当成不同成本的同事
跑完这次,我更愿意把模型看成不同成本的同事。
目标已经清楚、大部分工作是持续执行,就让低成本模型多试几轮。关键选择、范围取舍、出现不确定性的时候,再请 GPT 判断。
短任务未必需要两个模型。交接太多,或者反复返工,便宜的单价也可能换不来便宜的交付。
我想要的一加一大于二,是让相对少的高成本判断,带动更多低成本执行。
下次让 AI 做工具,可以多想一步。
这件事里的哪些工作,值得交给贵模型?哪些可以交给便宜模型,耐心多试几轮?
你会给自己的 GPT 招个 DeepSeek 员工吗?欢迎在评论区聊聊
这里是佬刘,一个研究生的实测笔记。
Source: 佬刘AI · mp.weixin.qq.com