Планируем с GPT, выполняем с DeepSeek: экономичная схема совместной работы двух моделей
Оригинальный заголовок: 为了省钱,我给 GPT 招了个 DeepSeek 员工。
Автор поручил GPT (gpt-6.1-sol, уровень рассуждений high) в Codex отвечать за планирование, ключевые решения и приёмку, а через официальный Harness DeepSeek вызывал DeepSeek-V4.1-Flash для написания кода, проведения экспериментов и исправления ошибок — так был создан локальный PDF-инструментарий с пятью работающими функциями.
Автор запустил PDF-инструментарий, разделив задачи между GPT (планирование) и DeepSeek (выполнение), и привёл три промпта и данные о расходе кэша, что можно перенести на длительные задачи для снижения затрат.
大家好,我是佬刘。
用 AI 做一个工具,最贵的地方,可能是让同一个模型从头忙到尾。
理解需求、写方案、改代码、跑命令、看报错,再改,再试。任务一长,这些循环就会不断积累调用成本。
所以我试了个安排。
让 GPT 做规划、关键判断和方向调整,把大量开发与试验交给更便宜的 DeepSeek。给 GPT 招了个员工
这次,我让它们一起做了一个本地 PDF 工具箱,五项功能已经跑通。
01
贵模型负责想,便宜模型负责干
执行模型当然也要思考。这里要调整的,是把持续写代码、运行和试验的工作量,放到哪条模型通路上。
这次 GPT 用的是 gpt-6.1-sol,推理档位 high;执行端通过 DeepSeek 官方 Harness,调用 DeepSeek-V4.1-Flash。
先看官方 API 的价格差,单位为美元/每百万 token。
GPT 价格按标准 API、输入不超过 272K token;DeepSeek 按非高峰价格,高峰时三项翻倍。
为什么选择 Flash 模型干活?原因在于,快!便宜!
我更想分享的是,这个组合怎么实际运转。
Codex 是 GPT 工作的入口。GPT 能操作项目文件、运行命令,也就能从终端启动 DeepSeek 的 Harness。
DeepSeek Harness 可以说是一把「专武」。它让模型读文件、写代码、调用工具、观察结果,再继续执行。并且对 DeepSeek 系列模型做了适配和优化,无论是模型能力还是缓存都有提升!
我只在 Codex 里交代目标。GPT 把需求整理成任务文件,再通过命令行交给 Harness。DeepSeek 在里面持续开发和自测,交付后,GPT 读取真实文件和结果,决定进入下一阶段,还是调整方案。
02
三段提示词,把协作跑起来
如果你也想跑,可以照着下面三段提示词来。打开 Codex,选一个空的项目目录,先把员工的工作环境装好。
安装、启动,再配置模型
第一段交给 Codex,安装并启动 Harness。
提示词 01 · 安装与启动
请按官方项目 https://github.com/deepseek-ai/deepseek-harness 的当前安装说明,在本机准备 DeepSeek Harness。先检查 Node.js、npm 和已有安装,缺少的依赖帮我补齐,已有可用版本就复用并记录版本。
在当前项目目录用官方 npm 包启动 Web 界面,快速启动方式是 npx @deepseek-ai/dsh web。保持服务运行,打开实际访问地址,并告诉我之后如何启动和停止。如果端口已被占用,先检查已有服务。本轮先完成安装和启动,模型 API 由我在界面里填写。
正常启动后,浏览器会打开 Harness 的界面,默认地址是 http://127.0.0.1:3080,以实际启动输出为准。把刚才的项目目录添加为工作区并选中,然后进入「设置 → 模型」。
如果走 DeepSeek 官方 API,就到 DeepSeek 开放平台 创建 API Key,填到 DeepSeek 提供商的密钥栏,保存后选择 DeepSeek-V4.1-Flash。本次官方 API 调用里的模型 ID 是 deepseek-flash。
也可以用第三方 API。已有提供商就选对应入口;自定义接口则填写 API 地址、协议、密钥和对方实际提供的模型 ID。界面支持兼容 OpenAI/Anthropic 协议的接口,模型列表没有自动出现时,也可以手动添加。官方模型配置说明
Harness 里还有一套插件体系,文件读写、终端命令、网页检索、Skills、上下文压缩等能力都在这套架构里,也能按需接入 MCP 或扩展插件。设置里的「内置插件」可以查看组件,插件管理页负责安装和启停。后面需要更多能力,可以继续加,不必只把它当成一个聊天窗口。
先让 GPT 想方案、写文档
模型配好以后,先让 GPT 想方案。
这是第二段。把里面的项目目标换成自己的,PDF 工具箱、记账页面、照片整理工具都可以。
提示词 02 · 规划与文档
我要做的项目是【填写目标、使用场景和核心功能】。你担任项目负责人,先分析需求、确定功能范围、技术方案和分阶段计划,本轮先完成规划。
把方案写进项目文件,至少包含需求说明、实现计划、任务清单和验收标准。每个阶段写清输入、预期结果、测试样本和完成条件,标出需要我决定的取舍。再整理第一轮发给 DeepSeek 的任务文件,列出它要先读的文档、要交付的文件和自测要求。给我一份简短的方案摘要和文档路径。
这些文档就是交接的底稿。GPT 先把要做什么、怎么做、做到什么程度算完成写清楚,DeepSeek 接到的是一轮具体任务,后面也有标准可以对照。
让 DeepSeek 开工,GPT 负责调度
看过方案,补上自己的要求,再发第三段,让它开始执行。
提示词 03 · 执行与验收
按刚才的方案推进项目。你负责调度、关键判断、方案修正和独立验收,通过 DeepSeek 官方 Harness 调用我已配置的 DeepSeek-V4.1-Flash,让它负责业务代码、运行试验和修复。
先核对命令行执行用的 profile、提供商和实际模型路由,确保与我要使用的配置一致。网页配置与 headless 配置分别检查。用写文件、续接读文件的小任务验证通路,把真实返回的 session ID、工作目录、Harness home、profile 和版本保存到项目状态文件。
后续开发和返工显式传入同一个 session ID,串行执行。续接失败先排查,不要悄悄另开会话。每轮让 DeepSeek 先读需求、方案和验收文档,再完成这一阶段,交付改动摘要、文件路径、自测结果和待决问题。
你按验收标准检查实际文件与运行结果,通过后继续下一阶段;需要调整时,更新方案,把复现样本和具体任务交回同一 session。阶段结束更新检查点、记录用量,详细证据留在项目里,按需读取。
这里有个容易忽略的细节。网页端和命令行 headless 是不同的 profile,网页里选好模型后,要让 Codex 检查执行端是否也用了对应配置。
真正派活的命令就两种,交给 Codex 管理就行。第一次读取任务文件,保留 JSON 事件输出。
npx @deepseek-ai/dsh --profile headless --json < task-01.md > run-01.jsonl从首次返回的 session 事件里取出真实 ID,存进状态文件。下一轮开发或返工,明确续接它。
npx @deepseek-ai/dsh --profile headless --json --session-id '替换为首次返回的真实ID' < task-02.md > run-02.jsonltask-01.md、task-02.md 都是 GPT 整理的任务文件。headless 完成一次任务就退出,下次默认开启新会话。所以,还在同一个 Codex 聊天里,不代表 DeepSeek 自动记得上一轮, --session-id 要由 Codex 每次明确带上,工作目录、Harness home 和 profile 也沿用原配置。
跑起来以后,开发过程就是一个循环。
GPT 写方案、定阶段目标,DeepSeek 开发和试验,GPT 检查交付、调整下一轮,再交给 DeepSeek 继续干。
03
PDF 工具箱,交付长什么样
PDF 工具箱先做图片互转,再做文字型 PDF 与 Word 互转,再加压缩。准备了 21 个样本,把页序、中文、透明底、照片方向、损坏文件等情况提前放进去。
PDF 转 Word 要得到真实、可修改的文字。压缩则要看文件有没有变小,还得看页面是否清晰。
其中一个大位图样本,从约 11.67 MiB 压到 294.9 KiB,减少 97.53%。另一份中文文件的无损整理只减少约 1.45%,没有收益的样本就保留原文件。
过程中,GPT 追加样本发现,同一张图片跨页复用时,初版压缩没照顾到最大显示尺寸。它把复现文件和处理要求交回 DeepSeek,由 DeepSeek 完成修复,再检查结果。
这就是负责人调整方向、执行端继续试验的一个节点。
04
上下文与缓存,长任务怎么省钱
开发细节不必全部搬进聊天。让 DeepSeek 先交短摘要,把文件和完整证据留在项目里,GPT 按需要读取。否则低成本模型刚省下的调用,可能又花在两边重复传材料上。
上下文压缩也别太勤。
每轮交付后,让 DeepSeek 更新检查点,写清目标、完成项、失败项、关键文件、运行命令和下一步。确实接近容量限制,或者历史日志已经妨碍继续工作时,再按本机版本支持的入口压缩,尽量选阶段检查结束的节点。
压缩前保存状态,压缩后继续同一 session、重读检查点并复查关键样本。压缩会改变历史前缀,也可能影响缓存复用。
这次保留了默认自动策略,没有发生原生压缩。写一份检查点,和 Harness 真正压缩历史,是两件事。
这套组合还有一个适合长任务的地方,上下文缓存。
模型持续工作,会反复带上前面的需求、对话和工具结果。DeepSeek 对满足条件的相同输入前缀,可以走更便宜的缓存读取。非高峰时,命中输入的单价是未命中输入的五十分之一,输出仍单独计费。
这张是本次任务在 DeepSeek 官网的实际用量统计。
官网显示总用量 37,244,445 token。拆开看,3692 万多是命中缓存的输入,未命中输入只有约 12.7 万,输出约 19.2 万。
输入 token 的缓存命中占比约 99.66%。这不是一次塞进去几千万 token,而是很多轮请求反复读取历史材料的累计。
按本次非高峰价格,再以 2026 年 9 月 30 日的汇率中间价,1 美元约合 6.7351 元人民币折算,可以把这一段执行成本算出来。下面的费用单位是人民币。汇率来源
本次 DeepSeek 执行端费用
也就是说,DeepSeek 这端正式开发与返工的 API 费用,按用量折算约 1.65 元,不到 2 元。GPT 这端的成本另计。本次适用的官方单价
这个数字让我觉得,持续让低成本模型读文件、改代码、跑试验,是值得做的。大量历史输入可以复用缓存,执行端就能耐心多试几轮。
持续 session 帮助保留对话,缓存是否命中仍取决于服务端的前缀匹配。有同一个 ID,不等于每次都保证命中。
05
再省一步,看看 Coding Plan
不过,我接着想到,如果以后每个月都让它做很多东西,还能不能再便宜一点?
这就可以看编程订阅了,比如月费 10 美元左右的 OpenCode Go 和 CommandCode GOAT。
OpenCode Go 和 CommandCode GOAT 都提供 V4.1 Flash。这两项是另外的套餐选择,本次实测使用的是 DeepSeek 官方 API。
下面专门按 DeepSeek 的用量来看,别把月费、套餐额度和请求次数混成一件事。
国内也有类似的编程订阅,例如阿里百炼平台和字节的火山。但是值得提醒的是,各家的Coding plan质量参差不齐,同样的模型效果可能有很大差别!
这一套分工的优势,也就在这里。GPT 负责规划和关键判断,执行端可以按任务能力、调用量和价格来选。用 DeepSeek 官方 API 跑通后,还可以评估更合适的编程套餐,或者让其他模型接手执行。
高频开发、能充分利用额度时,Coding Plan 有机会把平均执行成本压得更低。
06
把模型当成不同成本的同事
跑完这次,我更愿意把模型看成不同成本的同事。
目标已经清楚、大部分工作是持续执行,就让低成本模型多试几轮。关键选择、范围取舍、出现不确定性的时候,再请 GPT 判断。
短任务未必需要两个模型。交接太多,或者反复返工,便宜的单价也可能换不来便宜的交付。
我想要的一加一大于二,是让相对少的高成本判断,带动更多低成本执行。
下次让 AI 做工具,可以多想一步。
这件事里的哪些工作,值得交给贵模型?哪些可以交给便宜模型,耐心多试几轮?
你会给自己的 GPT 招个 DeepSeek 员工吗?欢迎在评论区聊聊
这里是佬刘,一个研究生的实测笔记。
Источник: 佬刘AI · mp.weixin.qq.com