Claude Code 接入 DeepSeek 教程:Windows / Mac 配置与 API Key 设置
这篇教程讲如何把 Claude Code 的模型请求从 Anthropic 切到 DeepSeek API,保留 Claude Code 的 Agent 工作流。
这篇教程讲如何把 Claude Code 的模型请求从 Anthropic 切到 DeepSeek API,保留 Claude Code 的 Agent 工作流。
Flash-Agents 是一个 Claude Code 插件,把实现切片、移植测试、审查 diff、梳理代码库这类有边界的编码工作交给 DeepSeek V4.1 Flash worker,Claude 保留架构、验收标准和最终审查。
推荐理由:作者把 Claude Code 的编码任务外包给 DeepSeek Flash worker,并给出沙箱、补丁与实测数据,可据此判断成本与安全边界。
作者让 GPT(gpt-6.1-sol,推理档位 high)在 Codex 里负责规划、关键判断和验收,通过 DeepSeek 官方 Harness 调用 DeepSeek-V4.1-Flash 负责写代码、跑试验和修复,一起做出五项功能跑通的本地 PDF 工具箱。
推荐理由:作者用 GPT 规划、DeepSeek 执行的分工跑通 PDF 工具箱,并给出三段提示词和缓存用量数据,可迁移到长任务降本。
杭州良渚聚集了一批逃离 9-9-6 的开发者,在这里以 vibe-coding 方式构建 AI 产品,如模拟飞行环境的专注计时器 FocusFlight、AI 工作流工具 YouMind,以及用大语言模型解读八字的 FateTell,后者已有数十万用户。北京已将 AI 列为国家优先事项并推出 A.I. Plus 计划,但良渚的软件更偏向小众趣味,类似手工作坊式产品。
2026年9月共发布43款大模型,国产约占八成,1M上下文与全模态成标配,Intern-Decision、NeoHorse-1等"决策模型"与"自进化后训练"新品类首次进入开源清单。
匿名 Flash 模型 Space Bunny 在 OpenRouter 和 OpenCode 上调用量很大,支持 1M 上下文和原生多模态,作者实测其能力好过 DeepSeek V4.1 Flash,速度明显快于 GPT 6 Sol,视频理解、长程任务与 Coding 表现不错,遇到 Bug 时会自主调用视觉工具截图验证。
MiniMax 公测 M3.1-Flash-Preview,在 MiniMax Code 和 Token Plan 均可调用,实测流式输出平均 118 tokens/秒、TTFT 380 毫秒。
Martin Alderson 认为前沿实验室的推理价格战正在加速:OpenAI 在约两个月内把 GPT-5.6 Luna 降价 90%、GPT-6 Sol 降价 60%,Anthropic 的 Opus 5.5 输入输出降价 20%、缓存读取降价 60%。
Claude Opus 5.5 被称为截止今天的世界最强模型,同时也是最便宜的模型。作者用 Claude Max Plan 20x 实测:月费 $200 美金,5 天消耗 164 亿 Token,折合每月可消耗 600 亿 Token,考虑缓存后实际价值约 $15000~$20000。
作者长期高强度使用 OpenCode + OpenChamber + OpenCode Go 与 Ollama Cloud 的 DeepSeek V4 Flash 订阅,同时跑 15 个项目额度消耗很少。
Cline 把 VS Code 扩展从约 76,000 行单体核心迁移到 Cline SDK,并自建灰度发布机制:一个安装包内打包 loader、legacy 和 next 两套扩展,由 PostHog 功能开关按百分比决定激活哪套,崩溃时自动回退到 legacy,开关可随时降到 0% 作为 kill switch。
推荐理由:Cline 官方复盘如何把 1100 万用户的 VS Code 扩展迁到新 harness,含灰度机制与前后指标对比。
Simon Willison 转述剑桥大学计算机教授、OCaml 编译器核心维护者 Anil Madhavapeddy 的观察:OCaml 项目补丁刚被公开讨论,约十分钟内就有网站开始探测百分号编码的路径穿越序列,说明自动化监控在盯着公开仓库。
斯坦福大学研究人员主导、Terminal-Bench 团队联合全球科研机构专家打造的 Terminal-Bench-Science 0.1 发布,首批含生命、物理、地球、数学和工程科学领域的 70 项任务。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。
OpenAI 于 3 月 24 日宣布关停 Sora,API 将于 9 月 24 日下线,同期重心转向 Codex 和企业版 ChatGPT;Anthropic 则围绕 Claude Cowork 和 Claude Design 构建角色权限、支出限额与可观测性等企业能力。
有开发者因 DeepSeek v4 pro 涨价,在 V2EX 求推荐能替代接入 Claude Code 的模型/API。其需求包括支持超大上下文与最大 effort、同时兼容 Anthropic API 和 OpenAI API,并提到 ChatGPT 5.6 Sol 的 Ultra 模式也非 100% 成功率。评论区有人推荐 5.6luna,称速度稍慢但更便宜。
DeepSeek AI 与北京大学在论文中提出时空可组合性,形式化了 DeepSeek Harness 底层开源 TypeScript 微内核 Cordis 的架构。
作者指出,跑智能体任务时缓存读取而非输入输出才是主要成本,因为每轮都要重读已有上下文,累计开销随轮次呈平方增长。
DeepSeek V4 Flash 缺多模态能力,可用 Qwen-3.7-Flash 作视觉补充,通过路由组合补齐读图场景。方案是输入带图片走 Qwen-3.7-Flash 识图并输出结构化描述,纯文本继续走 V4 Flash 推理,也可把描述交给 V4 Flash 做深度推理、写代码和总结。
作者深度体验几天 DeepSeek V4 Flash 0731 正式版后总结:便宜到跑批处理、Agent 循环和几十轮对话账单基本无感,速度快到配合 Agent 工具循环每步几秒内完成,1M 上下文可容纳整个仓库和完整对话历史、无需频繁 compact,结合 Cache 打折长上下文成本还能再降。
Cline 盘点了 2026 年值得开发者尝试的 5 个开放权重模型:Kimi K3、DeepSeek V4 Flash、GLM-5.2、DeepSeek V4 Pro 和 MiniMax M3。
Martin Alderson 表示自己第一次不再按原始智力挑选日常主力模型,而是按速度挑选,因为 Opus 4.6 级别的模型对写代码、整理研究、做幻灯片和数据库分析等日常任务已经够用。
作者梳理了 KV cache 压缩技术的发展脉络,指出存储一个上下文 token 所需内存自 2017 年以来下降约 100 倍,而同期顶级数据中心 GPU 显存仅从 16GB 增至 288GB。
DeepSeek 正以开源和极致压缩 KV 缓存换取中国 AI 硬件生态的独立:在 100 万上下文、8-bit KV 精度下,1.6T 参数的 DeepSeek V4 仅需 5.48 GB HBM,而 GLM5 需 60 GB、Qwen3-235B-A22B 需 89 GB。
作者 Martin Alderson 认为开放权重模型正在收紧,Meta 已完全不再发布最新的 Muse Spark 模型,阿里越来越多地只在 API 上首发模型,Kimi K2.6 的许可证要求月活超 1 亿或月收入超 2000 万美元的产品在 UI 中显著标注 Kimi K2.6,Mistral 也对商业使用附加了不同条件。
作者发现 Cursor 直连 DeepSeek API 在 V4 加思考加工具调用时容易出错,因为调用方需要正确回放 reasoning_content,于是改用本地 Ollama 跑 deepseek-v4-pro。