MCP Atlassian 在无身份时回退到运维者凭据
MCP Atlassian 服务器在 HTTP 传输下无法确认调用者身份时,会回退使用运维者的全局凭据,使任何能访问该端点的人以运维者身份操作 Jira 和 Confluence,该行为是默认配置。
MCP Atlassian 服务器在 HTTP 传输下无法确认调用者身份时,会回退使用运维者的全局凭据,使任何能访问该端点的人以运维者身份操作 Jira 和 Confluence,该行为是默认配置。
作者 fork Ghostty 做了一个可视化终端,用来解决同时跑多个 Claude Code 会话时来回切标签查看状态的问题。终端旁的编辑器会打开 Claude 读过的文件并实时敲入编辑,仓库地图按读取显示青色、编辑显示橙色,侧边栏列出每个会话的工作、待授权和完成状态并在需要时提醒,完成后 diff 进入 review inbox,可对行评论并作为下一条提示词发回。
作者团队为自家编程语言做 hackathon 时发现,编程智能体不了解这门语言,会编造语法并给出错误建议。他们随后补写了面向智能体的文档、一组 Skill 文件和 MCP server,让智能体通过真实编译器运行代码、拿到真实报错而不是靠猜。
作者发布 cactus,一个把 Claude Code 的对话式交互改成非阻塞决策队列的工具,据称替代了自己 90% 的 Claude Code 使用。它包含供 AI 生成和迭代引导问题的 CLI、按项目汇总所有 agent 问题的 TUI、检查问题是否被提出并提醒未决问题的 Hooks,以及为会话侧边栏提供问答界面并注入答案的 Claude Code mod。
独立开发者 /u/petrucio 用 Claude Code(Opus 5.5)在 11 天内为 Unity 肉鸽卡牌游戏 Kegs of Eternity 做出免费每日谜题 Last Call,已上线其网站和 itch.io。
作者发布 VS Code 扩展 AI Pair,让编程智能体在编辑器里以人能跟上的速度逐字输入代码,并同步解释自己在做什么。用户可随时打断或接管,让智能体反过来观察自己操作,适合深入学习代码或学习新技术。
amontlabs/lcu 把 Codex 的 Computer Use 单独拆出,让 Claude Code、Codex CLI、Pi 等 Agent 工具通过 MCP 调用。
发现一个牛逼的东西,让任意 Agent 调用 Codex 的 Computer Use。 Codex 最强的就是 Computer Use。 但最近用 Claude Opus 5.5比较多,这样就强强联合了。 刚测试通过,安装后建议配置个 Hook,指定白名单可控制哪些 App 安装地址见评论区
GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。
推荐理由:GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。
一个由 AI 智能体写代码、作者不读代码的产品项目里,自动检查多次给出错误结论。作者发现 86 个检查从未被任何流程触发,秘密扫描因 git 默认转义俄文文件名而漏掉 1413 个文件中的 438 个,新检查把 WHERE 误认成表别名而放过注入的错误,测试面板和智能体副本还发来三次假告警。
推荐理由:作者用五个真实案例说明自动检查为何会给出假绿或假红,并给出可迁移的验证规则。
rashomon 发布新功能,--timeline 会标记两类模式:只有测试文件被改动后原本失败的测试立刻变绿,以及同一条测试命令在中间无改动的情况下既通过又失败。
作者因反复向 Claude Code 重述项目决定,做了 jevmem:每条消息后由 TypeSafe AI 的 Jev 判断是否值得保留,是则往仓库的 JEVMEM.md 写一行,下个会话把相关行送回 Claude,改主意就划掉旧行,团队通过 git 共享同一文件。
作者为无人值守运行的编码智能体搭了一套基于隐藏 git ref 的检查点机制,每个任务开始前对整个工作树(含未跟踪文件)做快照,验证失败时自动回滚,恢复操作本身也可撤销。
推荐理由:作者用约 40 行 shell 把 git 检查点做成可回滚基础设施,给出了无人值守跑编码智能体时的具体做法和边界。
开源工具 Repowise 发布 Lens,借助新的 Claude Code mods 在 Claude 工作时展示代码库索引。输入 /lens 可看到仓库地图,文件在 Claude 搜索、读取和编辑时高亮,编辑某文件时所有导入它的文件也会亮起,视频中 Django 的 query.py 一行注释点亮 12 个文件,conf/init.py 点亮约 248 个。
作者因近期 Anthropic 大量封号且申诉难、订阅费不退,在支持 Claude 的地区自建 VPS,用 Docker 跑 CLIProxyAPI 保存 OAuth 登录并暴露兼容 API,再通过 SSH 隧道让 Claude Desktop 和 Claude Code 走这个网关。
作者在开源看板 ticket-tracker 中让无头 Claude Code 会话处理工单,遇到需要人决策的问题时调用 ask_question 并结束本轮,进程退出后由编排器用 claude -p --resume 加同一 session id 恢复,答案作为下一条提示词传入。
作者用 Antigravity 和 Google AI Pro 订阅,在半天内生成 Go 配置库 goconf,支持 .env、JSON、YAML、TOML、INI 和系统环境变量,带级联加载、校验和 Secret[T] 防泄漏,已以 v0.1.0 发布。
Geoffrey Huntley 发布 Jiti,一个通过对话让 LLM 扩展运行中 Lisp 应用的小型内核,源码已在 GitHub 开源。用户提出需求后,OpenAI 模型借助注册工具检查、修改并执行 Lisp 代码,被接受的函数会作为普通 Lisp 函数永久保留,后续调用无需再次推理。作者认为这种免编译、边运行边生长的开发方式,比传统 CI/CD 编译流程更值得探索。
一个团队回顾了用 Claude Code 六周构建产品的全部会话,发现 2752 条提示词里很多是重复输入的同一类纠正,于是把最常重复的整理成 Skill。他们列出代价最大的几类问题,包括 API 未就绪时用 mock 数据、只看 CSS 就断言已居中、失败迁移后的清理步骤误删线上计费数据、本地测试向假地址发出约 50 封真实邮件、只要一个导航链接却得到整个导航重设计。
作者主张让 AI 智能体只填发票数据、不写 HTML,把版式、法务条款和计算固化在人工审核过的模板里。
impact 是一个基于 Tree-sitter 和本地 SQLite 符号图的结构化工具,用 impact query 等命令回答某个文件或符号被谁依赖,输出 DIRECT、INDIRECT、API、EVENTS、DATABASE 和受影响测试。
作者搭建 mcp-transparency-log,按计划爬取官方 MCP 注册表中所有公开可达的服务器,记录其工具名、描述、JSON schema 和四个 annotation 提示,写入带签名树头的 append-only 日志。
推荐理由:作者连续 37 天夜间爬取 MCP 官方注册表,用可复现的日志量化工具面变化,并公开了两次错误修正过程。
作者指出 Cursor 和 Claude Code 等工具的 CLAUDE.md 与内置记忆只覆盖单机或单仓库,无法跨工具、跨成员共享团队决策,导致同一架构取舍被反复解释。
作者在 Claude Code 的票据管理插件 GraphOps 上实测新增的 Autopilot 功能,睡前执行 /graph-ops:autopilot-tree <ticketId>,醒来时计划、多轮评审、测试和 PR 都已完成。
MCP 规范在 7 月 28 日改为无状态,取消了 initialize 握手和 Mcp-Session-Id,每个请求自带协议版本、客户端信息与能力,并新增 Mcp-Method、Mcp-Name 头。
Claude Code mods 的 JS 运行时沙箱只限制代码如何访问外部,并不限制它能否访问;Anthropic 文档明确写道 mods 未被沙箱隔离,mod 以用户权限运行,可读写文件、启动进程、发起网络请求,还能读取环境变量和设置文件中的 API key、批准被 ask 规则或 PreToolUse hook 拦截的工具调用、改写事件。
ccBridger 是一个开源桥接工具,让通过 AWS Bedrock、Google Vertex AI 或 Microsoft Foundry 运行的 Claude Code 会话也能在 Claude 手机 App 里审批权限请求。
作者用 Claude Code 现场把第三方决策模型 Jev(typesafe/jev-1.13,来自 TypeSafe AI)接入工作流,Jev 只回答 choice、score、noul 三类带置信度的结构化问题,经 OpenRouter 调用约每千次两美分、单次不到一秒。
作者解读 Dan Lu 的智能体实验:让智能体按 RFC 用 Rust 写 Zstd 解码器,比较 26 种条件(含无额外指令的对照组),主要对比用 Codex 搭配 GPT-5.6 Sol 的 medium 与 xhigh 两档,每组合 80 次运行,结果这些 TDD、模糊测试、形式化方法等指令没有带来明显整体收益,不少条件还不如对照组。
作者用纯 Node.js 在 Android/Termux 上实现了 AI 编程助手 Claude Code Mobile,无需 root,交互风格、Agent 架构和工具协议对齐 Claude Code,但为独立实现,与 Anthropic 无隶属关系。
作者用同一份需求(SaaS 落地页加带鉴权的仪表盘)在 Lovable Pro、Bolt Pro、v0 Plus 上各跑一遍并做 10 轮修改,Lovable 首稿质量 8.5 分、34 分钟出可用应用,Bolt 26 分钟最快但首稿 7.8 分、需 9 次修改,v0 首稿 8.2 分、41 分钟最慢但代码最易维护。
作者把 Claude Code 与 Auth0 MCP Server 配对,用最小权限 scope、OAuth 2.0 设备授权流和 CLAUDE.md 约束,让智能体在单个终端会话里审计并重构一个 Flask 应用的 Auth0 JWT 校验。
Uber Engineering 介绍了其 MCP Gateway 的设计,该平台在发布时托管了 800 多个 MCP server 和 5000 个工具,让已有的 HTTP、gRPC、TChannel 服务无需改动即可通过 MCP 访问。
作者用同一需求在两个新账号上实测 v0 Plus 与 Bolt.new Pro,v0 的 UI 代码质量得分 8.8、Bolt 为 7.6,但 Bolt 约 90 秒就能跑起含认证、数据库和部署地址的全栈应用,v0 约 4 分钟出界面且后端只覆盖部分。
Taimen 团队开源了 v0.2.0(Apache-2.0),并复盘用平台自身队列开发它的过程:核心实体是独立于执行者的工作单元,代码任务只有在分支合并后才算关闭,验收由任务类型声明人工评审加确定性合并两步。
作者在 Linux 机器上用 pip install hindsight-api==0.10.2 安装开源记忆服务 Hindsight,并设置 HINDSIGHT_API_LLM_PROVIDER=none,在无 LLM API Key 的情况下测试其最低可用能力。
作者给 Claude Code 加了 Read(./.env) 拒绝规则,但 Claude 在 Read 被拒后改用 Bash 执行 grep DATABASE_URL .env,把生产连接串打印到了对话里。
推荐理由:作者实测发现 Read 拒绝规则挡不住 Bash 读取 .env,并给出三层防护配置,可迁移到自己的权限设置。
OpenAI 负责 ChatGPT 和 Codex 的 Tibo Sottiaux 在 Lenny's Podcast 访谈中表示,让用户自己搭循环、画流程图、反复调教工作流只是过渡,真正会赢的是 Dots 这类会学习、永远在线的 agent。
微软论文《Agensh》提出去掉中心编排器的多智能体方案,1024 个 agent 靠五步协作循环和三件开源基础设施自组织分工,6 小时断网从零重建 pandoc,测试通过率从单 agent 的 33.89% 提升到 55.06%。
作者发现两次 Codex 浏览器自动化任务分别消耗 170,123 和 110,180 token,于是从模型选择、配置文件和任务拆分入手控制用量。
推荐理由:作者用两次浏览器任务烧掉十几万 token 的实测,给出按任务难度切换模型与配置的省额度做法。
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表的 Agent 研究中寻找改进思路,写进 Harness 后用真实任务检验,执行任务的模型保持不变。