Перейти к содержимому
Оригинал
老刘说NLP· 刘焕勇·· 1 день назадОценка ИИ22

《Agent Harness 技术蓝皮书》对内发布,并定量定性分析 RAG 当前研究趋势

Оригинальный заголовок: Agent Harness技术蓝皮书对内发布及定量及定性角度看RAG当前研究趋势

Заголовок и краткое изложение на выбранном языке ожидают перевода.

Краткий обзор ИИ

社区对内发布《Agent Harness 技术蓝皮书》,全书 8 篇 33 章共 139 页,将 Agent Harness 定义为围绕大语言模型构建的确定性运行时。同期基于 arxiv API 检索 2026-08-01 至 10-05 的 66 天数据,去重后新增 930 篇 RAG 相关论文,约 14 篇/天,研究重心已从检索 pipeline 搭建转向系统层、质量层与形态层。

Полный текст

Полный текст на выбранном языке ожидает перевода. Пока показан оригинал.

今天是2026年10月5日,星期一,北京,天气晴。

假期第五天,继续看技术趋势。

来看看,RAG的论文现在都还有吧?限定范围在 2026年6月份至今,都在研究啥?咋研究的?有啥结论?看下趋势啥的。

来看看,RAG的论文现在都还有吧?限定范围在 2026年6月份至今,都在研究啥?咋研究的?有啥结论?看下趋势啥的。:该段配图

另一个,我们继续做技术总结,在之前的文章《技术总结:Agent Memory绿皮书及Jev技术白皮书继续对内发布》(https://mp.weixin.qq.com/s/ILcTkboB5I8owEQcRg5rHg)中,我们完成了Agent Memory这一书的整理和发布。

今天,社区继续对内发布《Agent Harness 技术蓝皮书》,作为系列的补充,来做个记录,感兴趣的可以看看。


一、Agent Harness技术蓝皮书对内发布

大语言模型在形式上只是一个无状态、随机、仅输出文本的映射函数。

当我们要求一个智能体跨越时间去完成真实任务:读写文件、调用接口、记忆上下文、从失败中恢复并接受权限约束,就必须在模型之外引入一层确定性的运行时。

这个就是Agent Harness(智能体外壳/确定性控制平面),定义为围绕大语言模型或任意生成式模型构建的确定性运行时,负责把模型的文本输出转化为在真实环境中具备约束、可观测、可恢复的行动序列,并在此过程中持久化状态、管理上下文、寻址并执行工具、落实权限边界与人机协同。

一、Agent Harness技术蓝皮书对内发布:该节配图

《Agent Harness技术蓝皮书》一书以第一性原理为起点,系统回答五个问题:它到底是什么、为什么必然存在、由哪些模块构成、如何工程化实现、以及它的真实价值与夸大之处分别在哪里。全书三十三章按“是什么→由什么构成→怎么造→怎么跑住→怎么落地→值不值→具体怎么写→用什么造”的顺序推进。,全书共8篇,139页。

一、Agent Harness技术蓝皮书对内发布:该节配图

里面看5个结论发现:

其一,有Harness是结构性必然,四个硬缺口来自"模型即采样函数"这一定义;

其二,两个平面正交,harness 的价值=用确定性平面约束、放大、兜底随机平面;

其三,终止与预算是停机不可判定性的强制代偿,不是保守设置;

其四,上下文必须账本化管理,副作用必须先于重试被确认;

其五,无可观测性即无定位能力,无评测集即无法演进。

二、定量和定性角度看RAG目前研究现状?

还是从定量和定性的角度去看,通过采集,通过 arxiv 官方 API(export.arxiv.org),以四组关键词变体("retrieval-augmented generation"、"RAG"、"retrieval-augmented"、ti:retrieval AND abs:generation)检索 submittedDate ∈ [2026-08-01, 2026-10-05] 的论文,分页抓全后按 arxiv_id 去重,2026-08-01 至 10-05 的 66 天里,arxiv 新增去重后 930 篇相关论文(约 14 篇/天)。

1、先说定性结论

其一,RAG 不是"过气"话题,而是稳定高产赛道。两个月日均量基本持平(15.3 → 14.3 篇/天),且已成为信息检索(cs.IR)内部占比最高的研究主题之一。数据层面没有看到"长上下文模型出来以后 RAG 萎缩"的证据;

其二,从"要不要检索"走向"何时检索、检索多少、由谁生成" 。自适应路由与轨迹微调控制器是典型新范式;

其三,安全从边界话题升格为系统性工程。已出现集合级投毒、过期文档污染、向量索引删除泄露、私有信息检索等"pipeline级"威胁与防御;

其四,GraphRAG 从概念走向可工程化系统,长上下文记忆发生架构分化。如LiteRAG 以算法化探索替代 LLM 控制,记忆系统在"写时蒸馏 vs 读时检索 vs 非破坏性版本化"三条路线上分化。

综合去看,研究重心已从"检索pipeline怎么搭"整体转向三个层面:系统层(自适应路由、RL 训检索器/控制器,从"是否检索"推进到"何时/检索多少/由谁生成",且用 RL 和轨迹微调把检索变成可学习动作。这是本窗口最实质的范式增量(EDAR、Fellowship、BRIDGE、MCite-RL))、质量层(安全攻防、评测方法论【合成分布失真、多轮退化、指标污染】、效率与压缩)、形态层(GraphRAG 工程化、长上下文记忆架构、多模态与垂直领域落地);

进一步的,RAG 研究处于"工程化与再定义"阶段:核心路线问题(检索→排序→生成)已基本收敛,增量来自系统级控制、安全与评测方法论、以及 GraphRAG/记忆/多模态的新形态。最大的结构性风险不是"RAG 过气",而是评测与真实部署之间的失真正在扩大,这与领域 2019-2023 年间"基准繁荣"阶段的历史经验一致,需要警惕分数通胀。还是要评测先行。

2、再看统计数据

RAG 仍是高产赛道,论文量是"研究是否还活着"最直接的证据。窗口内月均约 450 篇、日均约 14-15 篇,8 月与 9 月几乎持平。注意,这还只是"检索增强生成"及其近义词的直接命中,如果把 Agent、记忆、检索优化等外围论文算进来,体量更大。

二、定量和定性角度看RAG目前研究现状?:该节配图

如果按照主题来分,可以看到12 个主题簇的多标签分布如下:

二、定量和定性角度看RAG目前研究现状?:该节配图

具体在做的事情如下:二、定量和定性角度看RAG目前研究现状?:该节配图

Источник: 老刘说NLP · mp.weixin.qq.com