Skip to content
Original
佬刘AI· 佬刘·· 3 days agoSelectedAI score78

Planning with GPT, Execution with DeepSeek: A Cost-Saving Two-Model Workflow

Original title: 为了省钱,我给 GPT 招了个 DeepSeek 员工。

AI overview

The author has GPT (gpt-6.1-sol, reasoning tier high) handle planning, key decisions, and acceptance in Codex, and calls DeepSeek-V4.1-Flash through the official DeepSeek Harness to write code, run experiments, and fix bugs—together producing a local PDF toolkit with five working features.

Why it matters

The author splits the work between GPT for planning and DeepSeek for execution to get a PDF toolkit running, and shares three prompts plus cache usage data that can carry over to cutting costs on long tasks.

Full text

大家好,我是佬刘。

用 AI 做一个工具,最贵的地方,可能是让同一个模型从头忙到尾。

理解需求、写方案、改代码、跑命令、看报错,再改,再试。任务一长,这些循环就会不断积累调用成本。

所以我试了个安排。

让 GPT 做规划、关键判断和方向调整,把大量开发与试验交给更便宜的 DeepSeek。给 GPT 招了个员工

这次,我让它们一起做了一个本地 PDF 工具箱,五项功能已经跑通。

按成本分配模型工作

01

贵模型负责想,便宜模型负责干

执行模型当然也要思考。这里要调整的,是把持续写代码、运行和试验的工作量,放到哪条模型通路上。

这次 GPT 用的是 gpt-6.1-sol,推理档位 high;执行端通过 DeepSeek 官方 Harness,调用 DeepSeek-V4.1-Flash。

先看官方 API 的价格差,单位为美元/每百万 token。

官方 API 价格

GPT 价格按标准 API、输入不超过 272K token;DeepSeek 按非高峰价格,高峰时三项翻倍。

为什么选择 Flash 模型干活?原因在于,快!便宜!

我更想分享的是,这个组合怎么实际运转。

Codex 是 GPT 工作的入口。GPT 能操作项目文件、运行命令,也就能从终端启动 DeepSeek 的 Harness。

DeepSeek Harness 可以说是一把「专武」。它让模型读文件、写代码、调用工具、观察结果,再继续执行。并且对 DeepSeek 系列模型做了适配和优化,无论是模型能力还是缓存都有提升!

我只在 Codex 里交代目标。GPT 把需求整理成任务文件,再通过命令行交给 Harness。DeepSeek 在里面持续开发和自测,交付后,GPT 读取真实文件和结果,决定进入下一阶段,还是调整方案。

02

三段提示词,把协作跑起来

如果你也想跑,可以照着下面三段提示词来。打开 Codex,选一个空的项目目录,先把员工的工作环境装好。

安装、启动,再配置模型

第一段交给 Codex,安装并启动 Harness。

提示词 01 · 安装与启动

请按官方项目 https://github.com/deepseek-ai/deepseek-harness 的当前安装说明,在本机准备 DeepSeek Harness。先检查 Node.js、npm 和已有安装,缺少的依赖帮我补齐,已有可用版本就复用并记录版本。

在当前项目目录用官方 npm 包启动 Web 界面,快速启动方式是 npx @deepseek-ai/dsh web。保持服务运行,打开实际访问地址,并告诉我之后如何启动和停止。如果端口已被占用,先检查已有服务。本轮先完成安装和启动,模型 API 由我在界面里填写。

正常启动后,浏览器会打开 Harness 的界面,默认地址是 http://127.0.0.1:3080,以实际启动输出为准。把刚才的项目目录添加为工作区并选中,然后进入「设置 → 模型」。

如果走 DeepSeek 官方 API,就到 DeepSeek 开放平台 创建 API Key,填到 DeepSeek 提供商的密钥栏,保存后选择 DeepSeek-V4.1-Flash。本次官方 API 调用里的模型 ID 是 deepseek-flash。

也可以用第三方 API。已有提供商就选对应入口;自定义接口则填写 API 地址、协议、密钥和对方实际提供的模型 ID。界面支持兼容 OpenAI/Anthropic 协议的接口,模型列表没有自动出现时,也可以手动添加。官方模型配置说明

Harness 官方与自定义模型 API 配置

Harness 里还有一套插件体系,文件读写、终端命令、网页检索、Skills、上下文压缩等能力都在这套架构里,也能按需接入 MCP 或扩展插件。设置里的「内置插件」可以查看组件,插件管理页负责安装和启停。后面需要更多能力,可以继续加,不必只把它当成一个聊天窗口。

先让 GPT 想方案、写文档

模型配好以后,先让 GPT 想方案。

这是第二段。把里面的项目目标换成自己的,PDF 工具箱、记账页面、照片整理工具都可以。

提示词 02 · 规划与文档

我要做的项目是【填写目标、使用场景和核心功能】。你担任项目负责人,先分析需求、确定功能范围、技术方案和分阶段计划,本轮先完成规划。

把方案写进项目文件,至少包含需求说明、实现计划、任务清单和验收标准。每个阶段写清输入、预期结果、测试样本和完成条件,标出需要我决定的取舍。再整理第一轮发给 DeepSeek 的任务文件,列出它要先读的文档、要交付的文件和自测要求。给我一份简短的方案摘要和文档路径。

这些文档就是交接的底稿。GPT 先把要做什么、怎么做、做到什么程度算完成写清楚,DeepSeek 接到的是一轮具体任务,后面也有标准可以对照。

让 DeepSeek 开工,GPT 负责调度

看过方案,补上自己的要求,再发第三段,让它开始执行。

提示词 03 · 执行与验收

按刚才的方案推进项目。你负责调度、关键判断、方案修正和独立验收,通过 DeepSeek 官方 Harness 调用我已配置的 DeepSeek-V4.1-Flash,让它负责业务代码、运行试验和修复。

先核对命令行执行用的 profile、提供商和实际模型路由,确保与我要使用的配置一致。网页配置与 headless 配置分别检查。用写文件、续接读文件的小任务验证通路,把真实返回的 session ID、工作目录、Harness home、profile 和版本保存到项目状态文件。

后续开发和返工显式传入同一个 session ID,串行执行。续接失败先排查,不要悄悄另开会话。每轮让 DeepSeek 先读需求、方案和验收文档,再完成这一阶段,交付改动摘要、文件路径、自测结果和待决问题。

你按验收标准检查实际文件与运行结果,通过后继续下一阶段;需要调整时,更新方案,把复现样本和具体任务交回同一 session。阶段结束更新检查点、记录用量,详细证据留在项目里,按需读取。

这里有个容易忽略的细节。网页端和命令行 headless 是不同的 profile,网页里选好模型后,要让 Codex 检查执行端是否也用了对应配置。

真正派活的命令就两种,交给 Codex 管理就行。第一次读取任务文件,保留 JSON 事件输出。

npx @deepseek-ai/dsh --profile headless --json < task-01.md > run-01.jsonl

从首次返回的 session 事件里取出真实 ID,存进状态文件。下一轮开发或返工,明确续接它。

npx @deepseek-ai/dsh --profile headless --json --session-id '替换为首次返回的真实ID' < task-02.md > run-02.jsonl

task-01.md、task-02.md 都是 GPT 整理的任务文件。headless 完成一次任务就退出,下次默认开启新会话。所以,还在同一个 Codex 聊天里,不代表 DeepSeek 自动记得上一轮, --session-id 要由 Codex 每次明确带上,工作目录、Harness home 和 profile 也沿用原配置。

跑起来以后,开发过程就是一个循环。

GPT 写方案、定阶段目标,DeepSeek 开发和试验,GPT 检查交付、调整下一轮,再交给 DeepSeek 继续干。

03

PDF 工具箱,交付长什么样

PDF 工具箱先做图片互转,再做文字型 PDF 与 Word 互转,再加压缩。准备了 21 个样本,把页序、中文、透明底、照片方向、损坏文件等情况提前放进去。

PDF 转 Word 要得到真实、可修改的文字。压缩则要看文件有没有变小,还得看页面是否清晰。

其中一个大位图样本,从约 11.67 MiB 压到 294.9 KiB,减少 97.53%。另一份中文文件的无损整理只减少约 1.45%,没有收益的样本就保留原文件。

PDF 工具箱,交付长什么样:该节配图

过程中,GPT 追加样本发现,同一张图片跨页复用时,初版压缩没照顾到最大显示尺寸。它把复现文件和处理要求交回 DeepSeek,由 DeepSeek 完成修复,再检查结果。

这就是负责人调整方向、执行端继续试验的一个节点。

04

上下文与缓存,长任务怎么省钱

开发细节不必全部搬进聊天。让 DeepSeek 先交短摘要,把文件和完整证据留在项目里,GPT 按需要读取。否则低成本模型刚省下的调用,可能又花在两边重复传材料上。

上下文压缩也别太勤。

每轮交付后,让 DeepSeek 更新检查点,写清目标、完成项、失败项、关键文件、运行命令和下一步。确实接近容量限制,或者历史日志已经妨碍继续工作时,再按本机版本支持的入口压缩,尽量选阶段检查结束的节点。

压缩前保存状态,压缩后继续同一 session、重读检查点并复查关键样本。压缩会改变历史前缀,也可能影响缓存复用。

这次保留了默认自动策略,没有发生原生压缩。写一份检查点,和 Harness 真正压缩历史,是两件事。

这套组合还有一个适合长任务的地方,上下文缓存。

模型持续工作,会反复带上前面的需求、对话和工具结果。DeepSeek 对满足条件的相同输入前缀,可以走更便宜的缓存读取。非高峰时,命中输入的单价是未命中输入的五十分之一,输出仍单独计费。

这张是本次任务在 DeepSeek 官网的实际用量统计。

本次任务的 DeepSeek 官网 API 用量

官网显示总用量 37,244,445 token。拆开看,3692 万多是命中缓存的输入,未命中输入只有约 12.7 万,输出约 19.2 万。

输入 token 的缓存命中占比约 99.66%。这不是一次塞进去几千万 token,而是很多轮请求反复读取历史材料的累计。

按本次非高峰价格,再以 2026 年 9 月 30 日的汇率中间价,1 美元约合 6.7351 元人民币折算,可以把这一段执行成本算出来。下面的费用单位是人民币。汇率来源

官网用量与人民币费用

本次 DeepSeek 执行端费用

也就是说,DeepSeek 这端正式开发与返工的 API 费用,按用量折算约 1.65 元,不到 2 元。GPT 这端的成本另计。本次适用的官方单价

这个数字让我觉得,持续让低成本模型读文件、改代码、跑试验,是值得做的。大量历史输入可以复用缓存,执行端就能耐心多试几轮。

持续 session 帮助保留对话,缓存是否命中仍取决于服务端的前缀匹配。有同一个 ID,不等于每次都保证命中。

05

再省一步,看看 Coding Plan

不过,我接着想到,如果以后每个月都让它做很多东西,还能不能再便宜一点?

这就可以看编程订阅了,比如月费 10 美元左右的 OpenCode Go 和 CommandCode GOAT。

OpenCode Go 和 CommandCode GOAT 都提供 V4.1 Flash。这两项是另外的套餐选择,本次实测使用的是 DeepSeek 官方 API。

下面专门按 DeepSeek 的用量来看,别把月费、套餐额度和请求次数混成一件事。

OpenCode Go 与 CommandCode GOAT 套餐

国内也有类似的编程订阅,例如阿里百炼平台和字节的火山。但是值得提醒的是,各家的Coding plan质量参差不齐,同样的模型效果可能有很大差别!

这一套分工的优势,也就在这里。GPT 负责规划和关键判断,执行端可以按任务能力、调用量和价格来选。用 DeepSeek 官方 API 跑通后,还可以评估更合适的编程套餐,或者让其他模型接手执行。

高频开发、能充分利用额度时,Coding Plan 有机会把平均执行成本压得更低。

06

把模型当成不同成本的同事

跑完这次,我更愿意把模型看成不同成本的同事。

目标已经清楚、大部分工作是持续执行,就让低成本模型多试几轮。关键选择、范围取舍、出现不确定性的时候,再请 GPT 判断。

短任务未必需要两个模型。交接太多,或者反复返工,便宜的单价也可能换不来便宜的交付。

我想要的一加一大于二,是让相对少的高成本判断,带动更多低成本执行。

下次让 AI 做工具,可以多想一步。

这件事里的哪些工作,值得交给贵模型?哪些可以交给便宜模型,耐心多试几轮?

你会给自己的 GPT 招个 DeepSeek 员工吗?欢迎在评论区聊聊

这里是佬刘,一个研究生的实测笔记。


Source: 佬刘AI · mp.weixin.qq.com