跳到正文
原文
老刘说NLP· 刘焕勇·· 2天前AI 评分26

技术观察:从论文看数据合成方向趋势及5个任务核心发现

原文标题:技术观察:论文角度看数据合成方向趋势及5个任务核心发现

AI 导读

对 arXiv 2026年3月至10月初的 225 篇数据合成论文(cs.CL/cs.LG/cs.AI)统计显示,领域重心已从"怎么生成"转向"怎么验证与怎么度量",验证/过滤是唯一横跨全部任务的方案族,理论/度量增长最快。

正文

今天是2026年10月4日,星期日,北京,天气晴。

假期第四天,继续看技术。

这次来看数据合成方向,看看这块的进展,可以通过arXiv官方API(export.arxiv.org/api/query)来做统计分析,来做下,看看能发现啥。

一、数据合成方向大体的统计数据

在arXiv中检索2026年3月至10月初的论文,共得到225篇(cs.CL/cs.LG/cs.AI,摘要含synthetic data/data synthesis),做个统计,大致如下,按照主题:

一、数据合成方向大体的统计数据:该节配图

更进一步,按两个正交维度切成12类任务。

纵向六类按训练流水线阶段走:预训练语料(T1)→指令与偏好数据(T2)→RL轨迹(T3)→Agent/工具数据(T4)→代码与数学推理数据(T5)→评测与基准(T6)。

横向六类按数据形态与目标走:多模态/语音(T7)、表格/时序(T8)、对话与社会模拟(T9)、隐私与安全(T10),以及两个横切任务:理论与度量(T11)、垂直领域应用(T12)。

一、数据合成方向大体的统计数据:该节配图

从中有几个发现:

其一,领域重心已经从“怎么生成”移到“怎么验证与怎么度量”。验证/过滤是唯一横跨全部任务的方案族,理论/度量是增长最快的方案族。合成数据的竞争从生成能力转向反馈信号与度量体系;

其二,提示工程作为独立方案正在消退。多Agent流水线正在从卖点降级为实现细节;两者的份额被“验证器+pipeline工程”吸收;

其三,增量方向(绝对量增长)明确且集中。理论化(含缩放律与坍缩治理)、对话/社会模拟、垂直领域、表格时序、安全。存量方向(指令、Agent、评测)进入平台期。

也就是说,指令数据、Agent数据、评测三类份额大幅下降但绝对量持平,说明它们不再是增量方向而非在退潮;真正的上升项(理论、对话模拟、安全、表格时序、垂直领域)是绝对量增长驱动的。

二、5 个数据合成任务核心发现

1、预训练数据合成。预训练合成的上界由种子语料和变换算子决定,所以这任务的竞争焦点已经不在“生成质量”而在“配比与选择”。

2、指令偏好数据合成。这类任务既最贵又最容易学错(学成风格判别器)。所以在现有证据下,这种任务的重心是把“偏好”拆解成可独立验证的成分:规格条目、事实性、风格,分别合成、分别验收,再组合。

3、RL轨迹数据合成。本质变化是数据形态:从“一个数据集”变成“一个随策略边界移动的供给过程”。判断一篇RL合成工作是否实质创新,看它回答了三个问题没有:边界在哪(难度估计)、边界上怎么供数(在线/失败复用/跨模型)、供来的样本凭什么是可信的(奖励构造)。

4、Agent数据合成。质量下限由环境保真度决定,不由生成模型决定。这条链是确定的:环境状态不真→轨迹不可执行→RL奖励是噪声→模型学到表面模式。所以,Agent数据的投入优先级应当是:可执行环境>参数可信机制>任务多样性>生成模型能力。

5、垂直数据合成。越是结构化、有执行标准(编译器、临床规程、制造参数约束)的域,合成路线越可靠;越是自由文本域,越退回judge验收的老问题。

来源:老刘说NLP · mp.weixin.qq.com