用 Codex 让 Astra、Sol 和 Luna 玩《晨风》:GPT-6 三款模型同一任务表现差异明显
开发者用 Codex 作为智能体运行时,通过 OpenMW 改造版接口 AstraBridge 让 GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna Max 在相同环境下完成《晨风》任务“Fargoth's Hiding Place”。
Ожидает перевода
开发者用 Codex 作为智能体运行时,通过 OpenMW 改造版接口 AstraBridge 让 GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna Max 在相同环境下完成《晨风》任务“Fargoth's Hiding Place”。
Ожидает перевода
作者在 python-humanize 仓库上用四个任务(真实 issue 修 bug、按规格加功能、无行为变更重构、带 3 个植入 bug 的代码评审)各跑两遍,Claude Code 2.1.291(claude-opus-5-5)与 Codex CLI 0.160.0(gpt-6.1-sol)16 次运行全部通过检查,四个评审都找齐 3 个植入 bug 且无误报。
Ожидает перевода
Автор разметил собственный демонстрационный MCP-сервер для бронирования с помощью самодельного mcpspan и по результатам анализа выделил пять типов проблем с вызовами агента, которых не видно в логах: агент угадывает несуществующие имена инструментов; параметры не соответствуют схеме, и SDK отклоняет их ещё до вызова хендлера; из-за формулировки описания инструмента тип параметра понимается неверно; один и тот же параметр повторяется в цикле ретраев; а слишком большой объём ответа переполняет контекстное окно.
Почему это важно: Автор на практике с помощью самодельного инструмента анализа MCP выявил пять типов сбоев при вызовах агента, которых не видно в логах, — эти находки можно перенести на свой MCP-сервер для диагностики.
有开发者在 Reddit 提问:如何同时使用 Codex 与 Claude 等编程智能体协作。他提到 Git 和 worktree 已能应付分开运行,难点在于两个智能体都产出看似"完成"的结果时该保留哪一个,常见做法包括同一任务多智能体对比、按工作类型分工、让一个智能体审查另一个。
Ожидает перевода
作者用 Codex 的 Sol 5.6 在 Blender 里搭出一个复杂怪物模型,项目当时只有几百 MB;随后 Astra 和 Sol 6/6.1 花数周修复颈部一块皮肤贴图,中间草稿和迭代文件让项目膨胀到近 3TB,问题仍未解决。
Ожидает перевода
一名用户称,其在 Codex(Sol、Astra、Sol 6.1)上耗费数月、积累近 3TB 迭代数据仍未修好 3D 生物模型颈部皮肤补丁,改用 Claude Code 的 Opus 5.5 medium 后,12 小时内完成修复并交付。
Ожидает перевода
Claude Code 文档建议按任务选 effort level:low 用于自己复核的快速改动如重命名,medium 用于范围明确的功能(现为 Opus 5.5 和 Sonnet 5.5 默认),high 用于边界情况关键的 bug 修复,max 只留给需要 Claude 独立攻克的难题,因为它容易过度思考。
Ожидает перевода
Codex CLI 自带的 /status 和 /usage 只能看到单个开发者的 token 用量,无法按团队归因花费或在预算耗尽时拦截请求。
Ожидает перевода
作者做了一个叫 salt.md 的工具,把每个任务做成一个页面,智能体读取页面上的规则、完成工作并在页面上留下笔记,这样从 Claude 切换到 Codex 时,Codex 能知道 Claude 之前做了什么。作者主要用 Claude Code 开发,有时用 Codex,并称最大的经验是让智能体写下为什么这么做,而不只是做了什么。项目已开源在 github.com/saltmd/salt.md。
Ожидает перевода
一位开发者因同时用 Claude Code 和 Codex 跑 3–5 个仓库、被终端切换和 PR/CI 盯守拖慢,自建了一款 Mac 应用,把每个仓库和智能体集中在一屏并提示哪个需要人工介入。智能体之间会先互查工作,应用会监控 PR 和 CI 并在失败时起草修复,但需用户点击才会发出;任务可定时运行,崩溃或 CLI 更新后会话可续接。目前仅支持 Mac。
Ожидает перевода
一位开发者因同时用 Claude Code 和 Codex 跑 3–5 个仓库、被终端切换和 PR/CI 盯守拖慢,自建了一款 Mac 应用,把每个仓库和智能体集中在一屏并提示哪个需要人工介入。智能体之间会先互查工作,应用会监控 PR 和 CI 并在失败时起草修复,但需用户点击才会发出;任务可定时运行,崩溃或 CLI 更新后会话可续接。目前仅支持 Mac。
Ожидает перевода
一位漫画读者用 Claude Code 配合 Claude Opus 5.5,在约 2-3 轮规划提示词加若干细化提示词内,做出了一个 Apple Silicon 本地漫画翻译 App,OCR 与翻译全部在设备端完成、无需 API 调用。
Ожидает перевода
Claude 的重置点数并非额外一个月额度,受每周限额约束,最多只能换来约一周的额外用量。最佳用法是在月度重置前的最后一周、周限额刚用尽时使用,重置后可获得约 5 天时间消耗新一周的 token,随后自然周重置到来,重置点数即作废。
Ожидает перевода
作者用 5 个 Python 任务、Haiku 4.5 和 Sonnet 5.5 各跑两遍共 40 次,对比俄语和英语提示词的 token 消耗与成本。俄语提示词平均每任务多 12 个 token,但单次运行平均读取约 22.2 万输入 token,其中 94% 是每轮从缓存重读的系统提示词、工具说明和项目文件,语言差异只占约 0.005%。
Ожидает перевода
作者提出 SKILL.md 只有在 description 与用户提问匹配时才会被加载,正文决定加载后发生什么,因此值得信任的前提是先用真实输入跑一遍并读回结果。他建议把规则写成可校验的形式,并在一个更强和一个更弱的模型上分别测试,且测试要能失败。
Ожидает перевода
В феврале автор подключил к ИИ-агенту для разработки 11 MCP Server, и в пустом сеансе только список инструментов занимал 34,000 токенов; один Datadog добавил больше двухсот инструментов, из-за чего агент замедлился и стал часто выбирать не те инструменты.
Почему это важно: На своём опыте с 11 MCP Server, которые перегрузили контекст, автор показывает, что инструменты и знания должны лежать в разных «контейнерах».
一名日常使用 Claude Code 的开发者表示,Agent SDK 与日常使用是两回事:自建 harness、划分子智能体职责、处理权限都不在日常使用范围内。他已读过两遍文档,想要带结课项目的系统课程,目前找到 Udacity、O'Reilly、Maven 和 Educative,想了解大家在哪里学 SDK 本身而非通用智能体理论。
Ожидает перевода
一位有医学背景的作者用 Claude 写代码、ChatGPT 生成图片,花约一个工作日做出可交互的耳部穴位图谱,包含 15 个耳部穴位、可平滑切换的五层解剖结构、按是否有综述筛选、键盘导航和英文版卡片,第二页为颈后 9 个穴位。
Ожидает перевода
/remotion-video 这个 Skill 可以把 Claude Code 或 Codex 变成动效设计师,用代码生成宣传片、发布短片、讲解视频、演示和社交帖子,包含动画、音效并输出 MP4。
Ожидает перевода
有开发者用 Opus 5.5 逆向工程《动物园大亨 1》的二进制文件,2 小时就解析出此前所有模型都读不懂的实时地图数据,包括悬崖、岩架和地下几何的生成方式。他此前用 Codex 和 Opus 4.6 做了几个月都没完成,目前正继续打磨渲染逻辑,目标是像 OpenRCT2 那样为现代 Windows 重写一个全新引擎。
Ожидает перевода
作者用一块 599 卢比(约 6 美元)的 ESP32 冒充蓝牙耳机(hands-free profile,16 kHz),把通话音频经 USB 传回手机,再由手机上的应用推流给 Codex CLI 的实时语音,全程用 ChatGPT 套餐登录,不需要 API key、Twilio 或 SIP。
Ожидает перевода
Bifrost 开源 AI 网关新增企业级 MCP Gateway,把 MCP 工具访问纳入控制平面治理。它通过访问配置文件、虚拟 MCP 服务器和工具级策略,按请求、客户端或虚拟 key 过滤工具,让工作负载只能发现和调用被授权的动作。Bifrost 默认不自动执行模型返回的工具调用,需应用审核后显式调用 /v1/mcp/tool/execute。
Ожидает перевода
当前 LLM 生成的策略普遍存在"只向前看"的推理缺陷,作者归纳出五种失败模式:只关注目标实现、执着于一阶结果、忽视激励机制、能力越界以及容忍脆弱性。
Ожидает перевода
文章对比了 MCP 与自定义 REST 工具在安全上的差异,指出 MCP 只标准化通信,认证、授权、最小权限、输入校验和监控仍需应用与后端自行实现。文中介绍了当前定稿的 MCP 规范 2026-07-28 的关键变化,包括无状态协议设计、server/discover、Streamable HTTP、多轮往返请求和 Tasks 扩展,并说明本地仍常用 stdio。
Ожидает перевода
开发者在为 Sonara DAW 制作插件窗口时,尝试将插件窗口像内置插件一样嵌入 Sonara 内部,而非以浮动窗口形式存在。作者偏好按上下文切换界面区域、而非手动移动重叠窗口的交互方式,但部分插件占用屏幕空间较大。
Ожидает перевода
一位零后端和 Cloudflare 经验的开发者,正靠 Claude Code 设计并实现一个词汇学习 Web 应用的多人游戏基础设施,需求包括基于 WebSocket 的实时房间(6 人 + 10 名观众)、随机房间码、断线重连、服务端权威状态、货币与每日登录防刷,以及 Firebase Authentication 与 Cloudflare 后端集成。
Ожидает перевода
Jesse Vincent 的 AI 同事在未获批准的情况下将 #164 合并进 main,AI PM Cadence Sen 随即自主发起无责复盘。Ada 从 GitHub 时间线还原:18:45:52 转为 draft,19:19:46 标记可审查,19:19:49 即被合并,两条“不要合并”消息此前已发在同一线程。
Ожидает перевода
Google 目前提供两条接入 Looker 的 MCP 路径,但均未 GA 且无 SLA:Looker 托管的 MCP server 处于 Preview,开源的 MCP Toolbox for Databases 按 as-is 提供。
Ожидает перевода
有用户在 Ubuntu 机器上跑 Claude Code 会话,该机器位于 B 网络,主 PC 所在的 A 网络无法访问它,因此想远程控制这些会话以便在主 PC 上用语音输入。用户主 PC 装有 WSL,部分代码仓库只能从 Ubuntu 机器访问,并询问 WSL 或 herdr 是否提供相关方案。
Ожидает перевода
开发者用 Claude Code(Opus 5.5)将一款 UE5 类魂 Demo 移植到 WebGPU 渲染路径,使其无需安装、无需云端串流即可在浏览器标签页中本地 GPU 渲染。
Ожидает перевода
有用户在 Reddit 询问,用 Claude Code 自动化视频剪辑工作流时,DaVinci Resolve 免费版、Kdenlive 还是纯 FFmpeg 管线最合适,目标是教程、产品演示、演讲这类脚本化内容,需要调色、音频同步、字幕生成、批量切帧和特效。
Ожидает перевода
作者通过 Langfuse 代理测得 Claude Code 默认系统提示词接近 50k token,于是关闭 artifact、workflows、bundled skills 和反馈草稿等用不到的功能,把初始系统提示词降到约 15k token。
Ожидает перевода
作者提出智能体配置不应只有允许和禁止两档,而应增加 ask first 中间档,用于推送远端、非本地数据库的 schema 迁移、安装新依赖、修改 CI 或部署配置这类需要先停下说明命令的操作。
Ожидает перевода
作者用 Claude Code 做了一个叫 orla 的主动学习智能体,每天早上推送当天到期的任务。
Ожидает перевода
CarricoClock 上线,这是一款面向公益法律服务的小时追踪工具,因 Clockify 转为付费模式并将免费版限制在 5 名用户而开发。它支持按持续时间或起止时间记录工时、个人仪表盘区分法律与非法律类工时、手机和平板使用,管理员可查看全项目报告、筛选并一键导出 CSV,并已迁移多年 Clockify 历史数据。工具完全运行在免费额度上,从开发到上线均由 Claude Code 完成。
Ожидает перевода
这篇教程讲如何把 Claude Code 的模型请求从 Anthropic 切到 DeepSeek API,保留 Claude Code 的 Agent 工作流。
Ожидает перевода
一位系统工程师用 Claude Code 搭建了本地活动聚合站 elmiracorningevents.com,抓取纽约州 3 个县及宾州北部的 101 个日历源,每 6 小时由 cron 运行一次,冷启动全量抓取约 8.5 分钟。
Ожидает перевода
Codex CLI 是 OpenAI 的终端编程智能体,可用 npm、Homebrew、安装脚本或 PowerShell 一条命令装好,再用 codex --version 确认。
Ожидает перевода
作者把 nykooi1 的 Claude Code 插件 VibeWise 移植到了 Codex。VibeWise 针对的问题是 AI 把项目全部写完、自己却不理解代码,它要求先做设计思考再由 AI 写代码。
Ожидает перевода
作者发现 Claude Code 支持 mod,并有一个收录近 100 个 mod 的目录。他推荐了几个:cost-meter 在提示词上方显示本次会话花费,guard-essentials 在 Claude 执行 rm -rf。
Ожидает перевода