范围:2025–2026,以 LLM 为中心并保留数据中心边界工作。页面聚焦真正修改、合成或迁移推荐训练数据的方法。多数工作把 LLM 作为离线判断器、标注器、语义生成器或模拟器;SCALR 等少量非 LLM 方法只有在直接借鉴 synthetic-data paradigm 或提供必要数据生成对照时才保留。每条新增边和每个被删除事件都应先视为假设,而不是事实。
部署规则。保留原始日志,为交互附加经过校准的软权重或置信标签,并尽可能把昂贵的 LLM 判断蒸馏成可复用的轻量清洗器。除推荐准确率外,还应报告长尾质量、校准、数据效率,以及在未修改真实交互上的结果。