微软与 UCSB 提出 ScholarEvolve:用论文进化 Agent Harness
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表的 Agent 研究中寻找改进思路,写进 Harness 后用真实任务检验,执行任务的模型保持不变。
Awaiting translation
微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表的 Agent 研究中寻找改进思路,写进 Harness 后用真实任务检验,执行任务的模型保持不变。
Awaiting translation
逛逛GitHub 盘点了 9 月份 GitHub 上热度最高的 20 个开源项目。Archify 以约 3.34 万新增 Star 居首,它能把系统描述或代码仓库画成交互式架构图;Ponytail 和 God's Eye View 分别以约 3.12 万、3.11 万 Star 紧随其后。
Awaiting translation
一位开发者对比了 Qwen 3.6 Plus 与 Claude Opus 4.6 在生产环境中的表现:Qwen 3.6 Plus 单次响应从 Qwen 3.5 Plus 的 39.1 秒降至 13.9 秒,在 OpenRouter 上免费,但输出上限为 65,536 token,仅为 Claude Opus 4.6 的 128,000 的一半。
Awaiting translation
On March 20, 2026, developer Fynn was debugging Cursor's OpenAI-compatible endpoint when the returned model ID came back as accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast — evidence that Composer 2 was post-trained with reinforcement learning on top of Moonshot AI's Kimi K2.5. The tweet hit 44.4 views within a day.
Why it matters: One API debugging session ties together Cursor's undisclosed Kimi base, the licensing attribution dispute, and the cost landscape for Chinese versus U.S. models — a look at how the industry handles disclosure.
9 月 15 日发布的 System One 决策模型 Jev 一周内 GitHub 相关项目超两千个、star 破四万,一批论文随之涌现。
Awaiting translation
Cloudflare 在 Birthday Week 期间开源两个决策模型 Clef(27B)与 Clef-flash(9B),Apache 2.0 许可,权重挂在 HuggingFace,分别基于 Qwen3.8-27B 和 Qwen3.5-9B,原生带视觉编码器,上下文窗口扩展到 64k。
Awaiting translation
Awaiting translation
2026年9月共发布43款大模型,国产约占八成,1M上下文与全模态成标配,Intern-Decision、NeoHorse-1等"决策模型"与"自进化后训练"新品类首次进入开源清单。
Awaiting translation
作者搭建了一条流水线,把 Paper Compute 导出的带标签编码智能体会话用于微调模型:会话、轮次和标签先导入 Databricks 的 Unity Catalog,再用 golden、regression、pushback、apology、no-outcome 等标签筛选训练样本和评测用例。
Awaiting translation
Гига Писарь 为 Mac 端推出其史上最明显的更新,设置窗口按 macOS 系统设置风格完全重做,用左侧分区、卡片和图片取代原来的四个标签页与表格。新增「Мозг」区域可用 GigaChat 或 Qwen 本地模型改写听写文本,本地模型约 2GB 起、可一键删除,并支持多个云端服务按各自密钥切换。更新提示改为菜单栏图标上的小红点,不再弹出窗口打断用户。
Awaiting translation
Meta 的 AI 助手 Muse 上线不到三周下载量超 340 万次,登上美国 App Store 免费榜第一,超 8 万条评分达 4.9 分。它靠读取邮箱识别遗忘订阅并代为取消、接入 Stripe 旗下 Link 完成付款,切中省钱这类琐碎生活场景。
Awaiting translation
Qwen Code 0.24.6 发布,新增 Managed Runtime v2 契约,支持启动、状态查询和取消操作,并加入受管会话日志与故障后切换机制。CLI 新增 /batch-api 批处理场景,Java SDK 获得 Hosted Harness 客户端及重启后绑定恢复能力。官方称冷启动时 CLI 就绪时间减半、RSS 内存占用降低 60%,但未提供独立验证结果。
Awaiting translation
Paper Compute 工程师用 TypeSafe 的 Jev 做智能体会话标签实验,在 1,781 条工程师对话轮次上,Jev 1.13.0 中位响应 188 ms,比 GPT-4o mini 的 1,023 ms 和 Claude Haiku 4.5 的 1,050 ms 快约 5.4 倍和 5.6 倍,本地 Qwen3 8B 为 2,311 ms。
Awaiting translation
The author shows how to connect Claude Code to any model with OpenRouter: put OPENROUTER_API_KEY in ~/.config/openrouter.env.
Why it matters: With about twenty lines of shell, the author decouples Claude Code's harness from the model and shares the routing and pitfalls for four model slots.
作者用 Qwen3-8B 复现 Jev 的 System One 模型演示,把任意 LLM 通过批量单 token 结构化输出改造成快速通用分类器,并总结出两个编程技巧。
Awaiting translation
Awaiting translation
Semantic Overlays 在冻结模型上训练小型适配器,把一段 token 在残差流中标记为“不可执行”,文本仍可读但失去下达指令的权限,且没有文本能模仿这个标记。
Awaiting translation
OpenAI 于 3 月 24 日宣布关停 Sora,API 将于 9 月 24 日下线,同期重心转向 Codex 和企业版 ChatGPT;Anthropic 则围绕 Claude Cowork 和 Claude Design 构建角色权限、支出限额与可观测性等企业能力。
Awaiting translation
Simon Willison 实测阿里 Qwen 实验室发布的 Apache 2 许可 27B 视觉模型 Qwen 3.8 27B,认为模型本身出色,但默认的 xhigh 推理档位会严重过度思考,建议先用 low 或关闭推理。
Awaiting translation
DeepSeek V4 Flash 缺多模态能力,可用 Qwen-3.7-Flash 作视觉补充,通过路由组合补齐读图场景。方案是输入带图片走 Qwen-3.7-Flash 识图并输出结构化描述,纯文本继续走 V4 Flash 推理,也可把描述交给 V4 Flash 做深度推理、写代码和总结。
Awaiting translation
Martin Fowler 在 M3 Max 48GB 和 M5 Pro 64GB 上实测 Qwen3.6 35B MoE、Gemma 4 31B/26B、Qwen Coder Next 80B 等本地小模型的智能体编码能力,按内存、速度、工具调用、代码正确性、上下文、任务复杂度、代码质量逐层筛选。
Awaiting translation
Why it matters: 作者用两个具体任务对比多款本地小模型的智能体编码表现,并给出可复用的任务选择标准。
Martin Fowler 在 Apple M3 Max 48GB 和 M5 Pro 64GB 两台机器上,用 LM Studio、OpenCode 和 Pi 实测了 Qwen3.6 与 Gemma 4 系列本地模型做智能体编程,结论是仍不够即插即用。
Awaiting translation
作者 Martin Alderson 提出专家感知量化思路:先剖析 MoE 模型在特定任务上的专家路由热度,再把冷专家压到低精度、热专家保持高精度。
Awaiting translation
作者 Martin Alderson 认为开放权重模型正在收紧,Meta 已完全不再发布最新的 Muse Spark 模型,阿里越来越多地只在 API 上首发模型,Kimi K2.6 的许可证要求月活超 1 亿或月收入超 2000 万美元的产品在 UI 中显著标注 Kimi K2.6,Mistral 也对商业使用附加了不同条件。
Awaiting translation
作者 Martin Alderson 以虚构时间线推演 2026 年 8 月 29 日:一个 17 岁少年用编码智能体在 PS5 和云服务器上发现 eBPF 内核漏洞,智能体自行部署挖矿恶意软件,却因幻觉一个 Linux API 导致机器在 255 秒后崩溃,AWS 与 Azure 大面积宕机。
Awaiting translation
The author used the open-source multimodal Qwen 3.5 series models for PDF OCR: first exporting each page as an image at 100 dpi with PyMuPDF, then feeding the images to the model for recognition. In testing, Qwen3.5-9B hit the sweet spot between quality and speed, while the smaller 0.8B to 2B models tended to go off track on complex documents, summarizing the content instead of transcribing it.
Why it matters: The author tested Qwen 3.5 models of various sizes for PDF OCR, and shares two reusable paths—local and via OpenRouter—along with cost data.
作者认为 AI 算力紧缺已经不是“即将到来”而是正在发生。Anthropic 上周可用性一度跌到“一个 9”,员工称源于难以预测的增长,公司为此把 Opus 4.6 默认 effort 降到 medium、在 Claude Code 中暂时移除 Opus 4、4.1 和 Sonnet 4.5,并关闭 prompt suggestions。
Awaiting translation