微软与 UCSB 提出 ScholarEvolve:用论文进化 Agent Harness
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表的 Agent 研究中寻找改进思路,写进 Harness 后用真实任务检验,执行任务的模型保持不变。
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表的 Agent 研究中寻找改进思路,写进 Harness 后用真实任务检验,执行任务的模型保持不变。
逛逛GitHub 盘点了 9 月份 GitHub 上热度最高的 20 个开源项目。Archify 以约 3.34 万新增 Star 居首,它能把系统描述或代码仓库画成交互式架构图;Ponytail 和 God's Eye View 分别以约 3.12 万、3.11 万 Star 紧随其后。
一位开发者对比了 Qwen 3.6 Plus 与 Claude Opus 4.6 在生产环境中的表现:Qwen 3.6 Plus 单次响应从 Qwen 3.5 Plus 的 39.1 秒降至 13.9 秒,在 OpenRouter 上免费,但输出上限为 65,536 token,仅为 Claude Opus 4.6 的 128,000 的一半。
开发者 Fynn 在 2026 年 3 月 20 日调试 Cursor 的 OpenAI 兼容接口时,返回的模型 ID 为 accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast,显示 Composer 2 基于 Moonshot AI 的 Kimi K2.5 做强化学习后训练,该推文一天内获得 44.4 万次浏览。
推荐理由:从一次 API 调试串起 Cursor 未披露 Kimi 基座、许可署名争议与中美模型成本格局,呈现行业披露惯例。
9 月 15 日发布的 System One 决策模型 Jev 一周内 GitHub 相关项目超两千个、star 破四万,一批论文随之涌现。
Cloudflare 在 Birthday Week 期间开源两个决策模型 Clef(27B)与 Clef-flash(9B),Apache 2.0 许可,权重挂在 HuggingFace,分别基于 Qwen3.8-27B 和 Qwen3.5-9B,原生带视觉编码器,上下文窗口扩展到 64k。
2026年9月共发布43款大模型,国产约占八成,1M上下文与全模态成标配,Intern-Decision、NeoHorse-1等"决策模型"与"自进化后训练"新品类首次进入开源清单。
作者搭建了一条流水线,把 Paper Compute 导出的带标签编码智能体会话用于微调模型:会话、轮次和标签先导入 Databricks 的 Unity Catalog,再用 golden、regression、pushback、apology、no-outcome 等标签筛选训练样本和评测用例。
Гига Писарь 为 Mac 端推出其史上最明显的更新,设置窗口按 macOS 系统设置风格完全重做,用左侧分区、卡片和图片取代原来的四个标签页与表格。新增「Мозг」区域可用 GigaChat 或 Qwen 本地模型改写听写文本,本地模型约 2GB 起、可一键删除,并支持多个云端服务按各自密钥切换。更新提示改为菜单栏图标上的小红点,不再弹出窗口打断用户。
Meta 的 AI 助手 Muse 上线不到三周下载量超 340 万次,登上美国 App Store 免费榜第一,超 8 万条评分达 4.9 分。它靠读取邮箱识别遗忘订阅并代为取消、接入 Stripe 旗下 Link 完成付款,切中省钱这类琐碎生活场景。
Qwen Code 0.24.6 发布,新增 Managed Runtime v2 契约,支持启动、状态查询和取消操作,并加入受管会话日志与故障后切换机制。CLI 新增 /batch-api 批处理场景,Java SDK 获得 Hosted Harness 客户端及重启后绑定恢复能力。官方称冷启动时 CLI 就绪时间减半、RSS 内存占用降低 60%,但未提供独立验证结果。
Paper Compute 工程师用 TypeSafe 的 Jev 做智能体会话标签实验,在 1,781 条工程师对话轮次上,Jev 1.13.0 中位响应 188 ms,比 GPT-4o mini 的 1,023 ms 和 Claude Haiku 4.5 的 1,050 ms 快约 5.4 倍和 5.6 倍,本地 Qwen3 8B 为 2,311 ms。
作者给出用 OpenRouter 把 Claude Code 接到任意模型的做法:把 OPENROUTER_API_KEY 放在 ~/.config/openrouter.env。
推荐理由:作者用约二十行 shell 把 Claude Code 的 harness 与模型解耦,并给出四个模型槽位的路由与踩坑细节。
作者用 Qwen3-8B 复现 Jev 的 System One 模型演示,把任意 LLM 通过批量单 token 结构化输出改造成快速通用分类器,并总结出两个编程技巧。
Semantic Overlays 在冻结模型上训练小型适配器,把一段 token 在残差流中标记为“不可执行”,文本仍可读但失去下达指令的权限,且没有文本能模仿这个标记。
OpenAI 于 3 月 24 日宣布关停 Sora,API 将于 9 月 24 日下线,同期重心转向 Codex 和企业版 ChatGPT;Anthropic 则围绕 Claude Cowork 和 Claude Design 构建角色权限、支出限额与可观测性等企业能力。
Simon Willison 实测阿里 Qwen 实验室发布的 Apache 2 许可 27B 视觉模型 Qwen 3.8 27B,认为模型本身出色,但默认的 xhigh 推理档位会严重过度思考,建议先用 low 或关闭推理。
DeepSeek V4 Flash 缺多模态能力,可用 Qwen-3.7-Flash 作视觉补充,通过路由组合补齐读图场景。方案是输入带图片走 Qwen-3.7-Flash 识图并输出结构化描述,纯文本继续走 V4 Flash 推理,也可把描述交给 V4 Flash 做深度推理、写代码和总结。
Martin Fowler 在 M3 Max 48GB 和 M5 Pro 64GB 上实测 Qwen3.6 35B MoE、Gemma 4 31B/26B、Qwen Coder Next 80B 等本地小模型的智能体编码能力,按内存、速度、工具调用、代码正确性、上下文、任务复杂度、代码质量逐层筛选。
推荐理由:作者用两个具体任务对比多款本地小模型的智能体编码表现,并给出可复用的任务选择标准。
Martin Fowler 在 Apple M3 Max 48GB 和 M5 Pro 64GB 两台机器上,用 LM Studio、OpenCode 和 Pi 实测了 Qwen3.6 与 Gemma 4 系列本地模型做智能体编程,结论是仍不够即插即用。
作者 Martin Alderson 提出专家感知量化思路:先剖析 MoE 模型在特定任务上的专家路由热度,再把冷专家压到低精度、热专家保持高精度。
作者 Martin Alderson 认为开放权重模型正在收紧,Meta 已完全不再发布最新的 Muse Spark 模型,阿里越来越多地只在 API 上首发模型,Kimi K2.6 的许可证要求月活超 1 亿或月收入超 2000 万美元的产品在 UI 中显著标注 Kimi K2.6,Mistral 也对商业使用附加了不同条件。
作者 Martin Alderson 以虚构时间线推演 2026 年 8 月 29 日:一个 17 岁少年用编码智能体在 PS5 和云服务器上发现 eBPF 内核漏洞,智能体自行部署挖矿恶意软件,却因幻觉一个 Linux API 导致机器在 255 秒后崩溃,AWS 与 Azure 大面积宕机。
作者用 Qwen 3.5 系列开源多模态模型做 PDF OCR,先用 PyMuPDF 把每页按 100dpi 导出为图片,再交给模型识别,实测 Qwen3.5-9B 是效果与速度的平衡点,更小的 0.8B 到 2B 模型在复杂文档上容易跑偏去总结内容。
推荐理由:作者实测了 Qwen 3.5 各尺寸模型做 PDF OCR 的效果,给出本地与 OpenRouter 两条可复用路径和成本数据。
作者认为 AI 算力紧缺已经不是“即将到来”而是正在发生。Anthropic 上周可用性一度跌到“一个 9”,员工称源于难以预测的增长,公司为此把 Opus 4.6 默认 effort 降到 medium、在 Claude Code 中暂时移除 Opus 4、4.1 和 Sonnet 4.5,并关闭 prompt suggestions。